BestBlogs 早报 · 09-19
Anthropic 研发指标 / 业务评测治理 / 端到端 Agent / 397B Agent RL / Claude 生物建模
[1] ★ 精讲|理解前沿实验室 AI 研发进度的衡量指标 Anthropic 把实验室内部的研发进展拆成 AI 参与研发、对智能体行动的监督和算力分配三组可持续披露的指标。它关注的是模型如何被开发,而非只评估模型能做什么;原文也承认跨实验室可比性仍受方法与自评限制。对中文读者而言,这提供了观察前沿能力扩张与安全投入时可追问的共同口径。 来源:http://anthropic.com https://www.bestblogs.dev/article/92f0944b85
[2] ★ 精讲|让 Agent 可评、可控、可迭代:业务效果导向的评测体系与场景实践 大淘宝团队聚焦会直接影响业务指标的策略类 Agent:离线判断合理,线上效果仍可能失准。文章把评测展开为从输入约束到业务效果的分层对象、问题归因和上线治理,并以自动挖掘、筛选与验证规则的方式校准 Judge。它的启发在于,把评测结果接回准入、灰度和回归,才能让改进有可追踪的落点。 来源:大淘宝技术 https://www.bestblogs.dev/article/4368159142
[3] ★ 精讲|AI Coding 贡献率超 90%,需求交付却只快了 10%:菜鸟如何用 Agent 托管端到端交付? 菜鸟的复盘给出一个很具体的提醒:代码生成占比提升,并不会自动缩短需求交付。它把瓶颈放回需求澄清、测试、部署和人工交接等整条链路,继而用通用 Agent、Plugin、Playbook 与结构化任务状态组织云端托管交付。对团队而言,值得先判断哪些小而边界清楚的任务适合交给系统闭环完成。 来源:InfoQ 中文 https://www.bestblogs.dev/article/1ec038b912
[4] LoRA 一作、OpenAI o1 核心成员的新工作:首次公开 397B 模型的 Agent RL 训练配方 LoRA 一作、OpenAI o1 核心成员联合发布的首份 397B 知识工作 Agent RL 训练配方,系统公开了从 Harness 治理、Token 对齐到异步训练调优的完整流程,Pass@1 相对提升 70%,并论证了 Agent RL 本质是系统工程而非算法选型。 来源:青稞 AI https://www.bestblogs.dev/article/0be94b80ea
[5] Claude 如何提升生物分子建模能力 Anthropic 展示了 Claude 如何优化 30 多个开源生物分子模型,实现平均 4 倍的加速,并支持在单个 GPU 节点上对大规模分子系统进行建模。 来源:Anthropic Research https://www.bestblogs.dev/article/d6e9da3e9a
[6] 日志服务 TLS AgentLoop:让多模态调用清晰可见 火山引擎日志服务 TLS AgentLoop 通过将多模态媒体内容(图、音、视)直接关联至会话与调用链,解决了多模态 Agent 调试中由于缺乏视觉上下文而导致的排查困难问题。 来源:字节跳动技术团队 https://www.bestblogs.dev/article/8869e8bc87
[7] Canto:为真实世界打造的语音模型 | Wispr Flow Wispr AI Lab 推出了 Canto,这是一个针对挑战性真实口述环境优化的实时语音模型,利用监督微调(SFT)和基于 GRPO 的强化学习,在嘈杂和低音量条件下表现优于竞争对手。 来源:Hacker News https://www.bestblogs.dev/article/d9276e20ff
[8] DoorDash 利用多智能体 LLM 清理 60,000 个特性标志 DoorDash 构建了一个基于 Claude 和 MCP 的多智能体 LLM 系统,用于自动化清理过时的特性标志(Feature Flags),将单个标志的平均清理时间从约 1.5 小时缩短至 13.8 分钟。 来源:InfoQ https://www.bestblogs.dev/article/3b45608a3f
[9] 为智能体重建 Web:MCP Apps 与面向意图的互联网 [视频] Liad Yosef 认为,面向智能体的 Web 需要意图级 API、可发现的资源,以及只在仍需人工判断时把品牌化 UI 通过 MCP Apps 带回对话。 来源:AI Engineer https://www.bestblogs.dev/video/5b234d92c
[10] 同样的时间与预算,做 3 条还是做 30 条?AI 如何改写内容的生产逻辑 通过星榜创始人刘思洋的实践案例拆解 AI 内容生产的「系统工程」逻辑,揭示废片率 50%仍可盈利的工业账本及「假降本」陷阱,提出从创意到交付的核心在于控制无效调用、复用经验与数据反馈闭环。 来源:非凡产研 https://www.bestblogs.dev/article/0aac7db719
--- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-19