# BestBlogs 早报：Anthropic 研发指标与 397B Agent RL 配方

- 来源：ginobefun (@hongming731)
- 发布时间：2026-09-19 07:24
- AIHOT 分数：35
- AIHOT 链接：https://aihot.news/items/cmu7lp05l0i0nrogr2dyhuk8i
- 原文链接：https://x.com/hongming731/status/2101090104051949800

## AI 摘要

BestBlogs 09-19 早报收录 10 篇内容，重点包括 LoRA 一作与 OpenAI o1 核心成员联合发布首份 397B 知识工作 Agent RL 训练配方，Pass@1 相对提升 70%。

## 正文

BestBlogs 早报 · 09-19

Anthropic 研发指标 / 业务评测治理 / 端到端 Agent / 397B Agent RL / Claude 生物建模

[1] ★ 精讲｜理解前沿实验室 AI 研发进度的衡量指标
Anthropic 把实验室内部的研发进展拆成 AI 参与研发、对智能体行动的监督和算力分配三组可持续披露的指标。它关注的是模型如何被开发，而非只评估模型能做什么；原文也承认跨实验室可比性仍受方法与自评限制。对中文读者而言，这提供了观察前沿能力扩张与安全投入时可追问的共同口径。
来源：http://anthropic.com
https://www.bestblogs.dev/article/92f0944b85

[2] ★ 精讲｜让 Agent 可评、可控、可迭代：业务效果导向的评测体系与场景实践
大淘宝团队聚焦会直接影响业务指标的策略类 Agent：离线判断合理，线上效果仍可能失准。文章把评测展开为从输入约束到业务效果的分层对象、问题归因和上线治理，并以自动挖掘、筛选与验证规则的方式校准 Judge。它的启发在于，把评测结果接回准入、灰度和回归，才能让改进有可追踪的落点。
来源：大淘宝技术
https://www.bestblogs.dev/article/4368159142

[3] ★ 精讲｜AI Coding 贡献率超 90%，需求交付却只快了 10%：菜鸟如何用 Agent 托管端到端交付？
菜鸟的复盘给出一个很具体的提醒：代码生成占比提升，并不会自动缩短需求交付。它把瓶颈放回需求澄清、测试、部署和人工交接等整条链路，继而用通用 Agent、Plugin、Playbook 与结构化任务状态组织云端托管交付。对团队而言，值得先判断哪些小而边界清楚的任务适合交给系统闭环完成。
来源：InfoQ 中文
https://www.bestblogs.dev/article/1ec038b912

[4] LoRA 一作、OpenAI o1 核心成员的新工作：首次公开 397B 模型的 Agent RL 训练配方
LoRA 一作、OpenAI o1 核心成员联合发布的首份 397B 知识工作 Agent RL 训练配方，系统公开了从 Harness 治理、Token 对齐到异步训练调优的完整流程，Pass@1 相对提升 70%，并论证了 Agent RL 本质是系统工程而非算法选型。
来源：青稞 AI
https://www.bestblogs.dev/article/0be94b80ea

[5] Claude 如何提升生物分子建模能力
Anthropic 展示了 Claude 如何优化 30 多个开源生物分子模型，实现平均 4 倍的加速，并支持在单个 GPU 节点上对大规模分子系统进行建模。
来源：Anthropic Research
https://www.bestblogs.dev/article/d6e9da3e9a

[6] 日志服务 TLS AgentLoop：让多模态调用清晰可见
火山引擎日志服务 TLS AgentLoop 通过将多模态媒体内容（图、音、视）直接关联至会话与调用链，解决了多模态 Agent 调试中由于缺乏视觉上下文而导致的排查困难问题。
来源：字节跳动技术团队
https://www.bestblogs.dev/article/8869e8bc87

[7] Canto：为真实世界打造的语音模型 | Wispr Flow
Wispr AI Lab 推出了 Canto，这是一个针对挑战性真实口述环境优化的实时语音模型，利用监督微调（SFT）和基于 GRPO 的强化学习，在嘈杂和低音量条件下表现优于竞争对手。
来源：Hacker News
https://www.bestblogs.dev/article/d9276e20ff

[8] DoorDash 利用多智能体 LLM 清理 60,000 个特性标志
DoorDash 构建了一个基于 Claude 和 MCP 的多智能体 LLM 系统，用于自动化清理过时的特性标志（Feature Flags），将单个标志的平均清理时间从约 1.5 小时缩短至 13.8 分钟。
来源：InfoQ
https://www.bestblogs.dev/article/3b45608a3f

[9] 为智能体重建 Web：MCP Apps 与面向意图的互联网 [视频]
Liad Yosef 认为，面向智能体的 Web 需要意图级 API、可发现的资源，以及只在仍需人工判断时把品牌化 UI 通过 MCP Apps 带回对话。
来源：AI Engineer
https://www.bestblogs.dev/video/5b234d92c

[10] 同样的时间与预算，做 3 条还是做 30 条？AI 如何改写内容的生产逻辑
通过星榜创始人刘思洋的实践案例拆解 AI 内容生产的「系统工程」逻辑，揭示废片率 50%仍可盈利的工业账本及「假降本」陷阱，提出从创意到交付的核心在于控制无效调用、复用经验与数据反馈闭环。
来源：非凡产研
https://www.bestblogs.dev/article/0aac7db719

---
http://BestBlogs.dev · 发现真正适合你的高质量内容
BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
在线阅读：https://www.bestblogs.dev/explore/brief/2026-09-19

### 引用推文

> ginobefun：https://x.com/i/article/2101088198101229570
