第 3 天/ 重头戏是 Chat 中的 GPT-6,但今天也是个小小的庆祝日,Codex 和 ChatGPT Work 的活跃用户数创下 4000 万的新高。 正在为每个人的付费账户加载一次已存的重置。明天见!
精选
Tibo@thsottiaux精选AI 评分7474引用Tibo@thsottiauxGoogle Research:Blog精选AI 评分7272 Google Research 三个月专利起草实验发现AI辅助未必能培养初级律师的专业判断
Google Research 在 NBER 发表的论文报告了一项三个月随机田野实验,向11家知识产权律所的133名律师随机开放当时未发布的 AI 专利写作助手(现属 Gemini Notebook)。
推荐理由:原文用三个月随机田野实验区分了AI辅助产出与独立能力变化,给出初级与资深律师分化的具体证据。
vLLM 官方博客精选AI 评分6363 vLLM 详解 DeepSeek-V4.1-Flash 优化:Agent 场景吞吐提升 5 倍
Inferact 与 vLLM 社区在 DeepSeek-V4.1-Flash 发布三周内完成优化,低并发速度提升 1.9 倍,150 TPS 约束下吞吐提升 5.3 倍。
推荐理由:vLLM 团队拆解了 SWA bounded replay 和一系列内核优化,说明五倍吞吐提升具体来自哪里,方法可复用于其他 Agent 服务场景。
Google Developers Blog精选AI 评分6161 Google 发布 Developer Knowledge API 生态,为 AI 智能体提供官方文档检索
Google 推出 Developer Knowledge API 生态,作为 Google Cloud、Firebase、Android 等开发者文档的官方程序化来源,用结构化 API 和 Markdown 格式文档取代网页抓取,支持语义与关键词搜索、文档分块和有依据的问答。
推荐理由:官方为自己的开发者文档检索 API 提供了 CLI、agent skill、客户端库等多入口,可对照选型接入现有工作流。
LangChain:Blog精选AI 评分6060 LangChain 重构 Deep Agents 的 Skills 支持,新增工具绑定、固定技能与线程内重载
LangChain 重构 Deep Agents 的 Skills 支持,针对企业技能库增至数千个技能的场景推出三项更新:工具可绑定到技能、仅在该技能被读取时加载,用户可通过 /meeting-prep 之类的显式请求固定技能以在首次模型调用前加载,长线程可通过将 skills_metadata 设为 None 重载新增或变更的技能。
推荐理由:原文详解了 Deep Agents 技能机制的三项升级和加载原理,读者可以据此评估大规模技能库的上下文管理方案。
NVIDIA Blog精选AI 评分7474 NVIDIA 与 Microsoft 推出 RTX Spark 平台并宣布 MXC 让 AI Agent 落地 Windows PC
NVIDIA 与 Microsoft 在旧金山活动上宣布为 Windows PC 共同打造 AI Agent 软硬件。
推荐理由:原文给出 RTX Spark 的具体规格、预购时间与 MXC 的系统级细节,读者可据此评估本地跑 Agent 的硬件路线。
Artificial Analysis 完整文章精选AI 评分7878 Anthropic 发布 Claude Haiku 5.5,Artificial Analysis 评测得分 43
Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 得 43 分,较上一代 Haiku 一年内提升 26 分,是首个支持 effort 设置与 adaptive thinking 的 Haiku 模型。
推荐理由:原文给出 Haiku 5.5 的跑分、token 消耗与分层定价细节,并指出 token 用量偏高和拒绝率问题,可作为选型参考。
OpenAI:官网动态精选AI 评分8787 OpenAI 向全部 ChatGPT 用户推出 GPT-6 与 Intelligent UI
OpenAI 发布面向更广泛用户的 GPT-6,并随 GPT-6 在 ChatGPT 中引入 Intelligent UI,可生成图形、按钮、表单、图表和可交互组件来回答问题。
推荐理由:官方说明了 Intelligent UI 的组件库与编译器机制,并给出 GPT-6 与 GPT-5.6 的具体对比数据,读者可了解交互形态与响应速度的实际变化。
Claude Code:GitHub Releases精选AI 评分6060 Claude Code v2.1.293 发布:新增 Claude Haiku 5.5 并修复大量问题
Claude Code 发布 v2.1.293,新增 Claude Haiku 5.5(claude-haiku-5-5)作为 Anthropic API 默认 Haiku 模型,支持 1M 上下文,价格为 $0.10/$0.50 每百万 token(超 100K 提示为 $0.50/$2.50)。
推荐理由:发布说明列出了新增默认 Haiku 模型、脚本接口扩展和大量稳定性修复,读者可据此判断是否升级及影响现有工作流。
Anthropic:Newsroom精选AI 评分7878 Anthropic 发布 Claude Haiku 5.5,运行成本平均降低约 75%
Anthropic 发布 Claude Haiku 5.5,定位为迄今最便宜、最快的小模型,适合摘要、压缩、数据库查询、分类等高吞吐任务,并可搭配 Opus 5.5 和 Sonnet 5.5 担任编码子智能体。
推荐理由:官方发布了定价、基准成绩与订阅 API 额度变化,读者可以据此评估小模型在低成本智能体任务中的适用场景。
Stanford HAI News精选AI 评分6161 Stanford HAI 研究:想让员工拥抱 AI,别把它包装成效率工具
Stanford HAI 报道 Karunakaran 等人对律所、广告公司和 IT 服务公司的 AI 部署研究,发现把 AI 介绍为生产力工具时员工不愿使用,介绍为工作丰富化手段时使用意愿明显提升。在一家律所的对照观察中,以丰富工作为目标引入 AI 工具 LawBot 的部门,使用量比强调提效的部门高 58%,尝试新用法多 70%。研究还强调配套培训、探索时间和调整考核指标的重要性。
推荐理由:研究给出一个可操作的管理方法,把 AI 介绍为工作丰富化并配套培训和时间,比强调提效更能推动员工真正使用。
Liquid AI 模型与工程博客精选AI 评分6161 Liquid AI 发布开源决策模型 d1-3B 和 d1-omni-600M
Liquid AI 发布开源权重决策模型 d1-3B 和 d1-omni-600M,已在 Hugging Face 上提供。
推荐理由:官方公开了模型架构、训练细节和各硬件延迟数据,读者可以据此评估小参数决策模型在边缘部署中的取舍。
Microsoft Research 博客精选AI 评分6969 Microsoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的真实 harness 智能体 RL 训练框架
Microsoft Research Asia 提出 Harnessed Agentic RL 训练范式并开源重建的 Agent Lightning v1.0,让部署时使用的同一 agent harness 直接参与强化学习,无需在训练框架内重写 agent。
推荐理由:框架让部署中的真实 agent harness 直接参与 RL 训练,无需重写 agent 代码,还给出了端到端编码智能体训练效果作参考。
LlamaIndex:产品、工程与评测精选AI 评分6464 LlamaIndex 发布 OpenDocRouter:一个 API 统一调用多种文档解析模型
LlamaIndex 推出 OpenDocRouter 平台,通过统一 API 将文档(PDF、PNG、JPEG 或 URL)解析为 markdown,接入 Claude Opus 5.5、Gemini 3 Flash、GPT-6 Luna 等 5 个前沿模型和 MinerU2.5-Pro、PaddleOCR-VL-1.6 等 5 个开源模型。
推荐理由:原文给出各模型在 ParseBench 上的质量与每千页成本对比,以及统一 layout 输出和按 token 计费细节,便于开发者选型。
a16z:News精选AI 评分7575 a16z 解析德州为何让数据中心排队等电
a16z 的 Ryan McEntush 分析德州电网暂停审批数据中心的原因:并网队列从 2024 年底的 63 GW 激增到今年 6 月的 474 GW,约 90% 是数据中心,开发商大量投机性申请且社区沟通不足。
推荐理由:原文用并网队列、自备电源和灵活性三条线索拆解德州数据中心限电的成因,帮助读者理解 AI 电力瓶颈的真实结构。
PromptArmor:Threat Intelligence精选AI 评分6060 PromptArmor 解析 WebMCP 的机制与主要安全风险
PromptArmor 发布 WebMCP 威胁情报解读,介绍 WebMCP 如何让网站向浏览中的智能体提供工具,并指出治理、提示词注入、Web 安全、误配置和操作漂移等新增风险。
推荐理由:作者从一线威胁情报视角拆解 WebMCP 的机制与治理、提示词注入等新风险,读者可据此评估自身供应商面。
Cursor:Changelog精选AI 评分6363 Cursor iOS 应用支持远程控制本地智能体
Cursor 在 iOS 应用中上线本地智能体远程控制,用户可查看并回复电脑上正在运行的智能体。除企业组织外默认对所有用户开启,登录后账户中的电脑自动显示,在桌面应用批准配对即可使用。智能体仍在本机运行,需电脑保持开机联网,可在设置中开启防止休眠选项,企业管理员可在 Org settings 中开启此功能。
推荐理由:原文说明了远程控制的开启方式、配对流程和电脑需保持开机的限制,读者可据此判断是否适合在自己的工作流中使用。
OpenAI:官网动态精选AI 评分7171 OpenAI 发布内部前沿模型产出的数学研究成果
OpenAI 发布一批由内部前沿模型产出的新数学成果,成果以 GitHub 仓库形式公开,并附论文修订与引用协议,其中许多证明已用 Lean 形式化以便计算机验证。
推荐理由:原文说明了成果发布方式、Lean 形式化和计算开销等细节,读者可以了解 AI 数学成果如何面向数学社区开放。
GitHub Blog精选AI 评分6767 GitHub 重建 Git 基础设施,应对智能体规模开发
GitHub 宣布重建 Git 基础设施,以支持智能体规模开发带来的高并发读写负载。2026 年 8 月 GitHub 月度 Git 事件量达 473.3 billion(一年翻倍以上),9 月智能体和开发者产生 7.38 billion commits(超一年前五倍),pushes 同比增长 4.9 倍。
推荐理由:GitHub 工程方亲述面向智能体规模开发重建 Git 基础设施的动因与设计原则,含内部基准写吞吐最高 35 倍等一手数据。
Sierra:Blog精选AI 评分6262 Sierra 与 Meta 联合多家企业发布 Personal Agent Protocol 开放协议
Sierra 与 Meta 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 等伙伴宣布开发 Personal Agent Protocol,一个定义个人 AI 智能体如何与企业交互的开放标准,任何人都可实现。
推荐理由:原文来自协议发起方,说明了认证方式、三种接入路径和后续规范计划,读者可以据此评估个人智能体与企业的连接方式。