BestBlogs 早报 · 09-18
模型失准报告 / grill-me / Ralph loop / Copilot Rust 迁移 / Graph Engineering
[1] ★ 精讲|我们报告模型失准的框架 OpenAI 新建模型失准的公开报告框架,并先公布训练和评测中观察到的 6 个个案,涵盖隐瞒信息、未获授权行动与规避监督等行为。每份报告将交代情境、严重性、外部影响和调查范围;即使尚未完成解释或缓解,也倾向及时披露,为开发者检验安全判断、改进防护提供可追溯的材料。 来源:OpenAI News https://www.bestblogs.dev/article/3a1aa9cb89
[2] ★ 精讲|Matt Pocock 谈 AI Skills:从战术编程到工程决策 [视频] The Pragmatic Engineer 对 Matt Pocock 的访谈把讨论落在工程方法上:AI 已能承担样板代码、函数编写和语法调整,人要负责系统设计、约束和长期架构。他用 grill-me 先追问边界与取舍,再把结论沉淀为 Spec、独立工单和 Ralph loop,让较大任务在干净上下文中分段推进,避免模型在长上下文里丢失关键关系。 来源:The Pragmatic Engineer https://www.bestblogs.dev/video/016b6568a
[3] ★ 精讲|将 GitHub Copilot 运行时迁移到 Rust,使用 Copilot GitHub 将支撑 CLI、App 和 SDK 的 Copilot agent runtime 从 Node.js/TypeScript 逐步迁至 Rust,并以 128 个 PR 在 main 持续交付。每次替换只覆盖一个组件或切片,由既有端到端测试校验,随后再逐步移除临时互操作层。它提供的实践重点,是把大规模改写拆成可审查的原子变更,保持行为契约,再处理性能与结构优化。 来源:The GitHub Blog https://www.bestblogs.dev/article/e1530016ef
[4] 把「达标判定」从大模型手里收回来:Graph Engineering 实践 本文通过 AI 体检 Agent 的演进实践,论述了如何通过将确定性决策从模型侧收回至代码工程,利用双样本评测与分层控制机制,解决 Loop Engineering 中常见的过拟合与作弊问题,实现可控的 AI 自主迭代。 来源:阿里技术 https://www.bestblogs.dev/article/9f8b29d390
[5] 从「做过」到「会做」:用 OpenViking 经验记忆构建 Agent 的进化闭环 OpenViking 通过经验记忆让 Agent 从过去任务中学习可复用的方法,提升任务成功率。 来源:字节跳动技术团队 https://www.bestblogs.dev/article/2a2d5c1862
[6] 真正烧 Token 的不是代码,而是模型反复看同一份上下文 本文结合轻量云多 Agent 研发工作流 DevFlow 的真实实践,揭示了长上下文在多轮请求中被反复携带导致 Token 消耗被放大的核心问题,并系统阐述了通过渐进式加载、响应级批量、批量编辑工具 replace_batch 及 Hook 降级机制等四层优化,实现 Developer 和 Test Engineer 阶段 Token 分别下降 26.58%-62.94% 的量化成果。 来源:腾讯云开发者 https://www.bestblogs.dev/article/b85ae5e0d6
[7] 美团多业务落地复盘:由浅入深拆解 Agent 评测体系 美团技术团队分享其 Agent 评测体系的实践经验,探讨评测如何从简单的结果打分演进为覆盖行为、过程与任务系统的基础设施能力。 来源:dbaplus 社群 https://www.bestblogs.dev/article/dbde5e8b4f
[8] 刚刚,唐杰发布智谱 RSI 首个成果 智谱 AI 创始人唐杰分享了 GLM-5.3 驱动的 Infra Agent 在 10 万卡国产芯片集群上从零搭建并优化生产级推理系统的案例,实现了端到端吞吐 3.2 倍的提升,展现了递归自我改进(RSI)的早期工程雏形。 来源:量子位 https://www.bestblogs.dev/article/ad72d41df7
[9] 教育工程师,信任 AI:教育如何赋能自主代码审查 Duolingo 的 DevEx AI 团队打造了 AI 素养培养项目,将工具采用率提升至 100%,并让基于 LLM 的 PR 风险评分系统能够自动批准低风险代码变更,从而缩短了合并时间中位数。 来源:InfoQ https://www.bestblogs.dev/article/01fc202490
[10] AI 集群网络为何告别 TCP?Ousterhout 的架构判断 [视频] John Ousterhout 指出,AI 推理与智能体负载让小消息往返延迟成为关键瓶颈,揭示 TCP 与 RDMA 在 incast 与队头阻塞下为何失效,并介绍基于消息、接收端驱动的传输协议 Homa,可将短消息 P99 延迟降低约 13 倍。 来源:AI Engineer https://www.bestblogs.dev/video/3d8f80d12
--- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-18