# BestBlogs 早报：Claude Opus 5.5 与 MiMo V2.6 等

- 来源：ginobefun (@hongming731)
- 发布时间：2026-09-23 08:29
- AIHOT 分数：32
- AIHOT 链接：https://aihot.news/items/cmuddlkm206piroggzfferg09
- 原文链接：https://x.com/hongming731/status/2102555892210389034

## AI 摘要

Anthropic 发布 Claude Opus 5.5，官方称典型任务成本较 Opus 5 低 40%，并引入每次行动前的分类器、可审计沙箱和合并前代码审查。小米 MiMo-V2.6 以大规模 RL 训练，两种模型在 6 天 Live RL 中各完成 30 步、累计约 75 万条轨迹，并公开训练框架与轻量 Harness。本期早报还涵盖美团推荐基座大模型落地、千问办公企业上下文等 10 条内容。

## 正文

BestBlogs 早报 · 09-23

Claude Opus 5.5 / MiMo V2.6 / 任务级评估 / Agent Harness / 企业上下文

[1] ★ 精讲｜Anthropic 发布 Claude Opus 5.5，长任务成本降四成
Anthropic 把 Opus 5.5 的重点放在更长、更可控的真实工作流：官方称其典型任务成本较 Opus 5 低 40%，并引入每次行动前的分类器、可审计沙箱和合并前代码审查。它同时承认预发布评估仍难覆盖真实部署，适合拿来审视高能力 Agent 的效率提升与治理边界如何并行落地。
来源：Hacker News
https://www.bestblogs.dev/article/3af6c5a106

[2] ★ 精讲｜Xiaomi MiMo-V2.6：扩展强化学习，迈向自我提升
小米把 MiMo-V2.6 的重点放在可验证复杂任务上的大规模 RL，而非只展示单项榜单：两种模型在 6 天 Live RL 中各完成 30 步、累计约 75 万条轨迹，并公开了训练框架、任务环境和轻量 Harness。文章也保留与最强闭源模型仍有差距的判断；对开发者而言，更值得看的是把训练过程和复现资源一并开放的做法。
来源：Xiaomi MiMo
https://www.bestblogs.dev/article/8717d12a88

[3] ★ 精讲｜MTFM：美团统一推荐基座大模型在外卖多业务场景的落地实践
美团将外卖首页、拼好饭等长期独立建模的场景放进一个推荐基座：用异构 Tokenizer 和动态 Mask 处理不同特征与时序，以混合注意力控制长序列成本。文章称多个业务已全量，最显著业务订单增长超过 6%，推理成本降低 24%。这份实践的价值在于同时交代统一建模、训练稳定与训推优化如何相互配合，而非只报告线上结果。
来源：美团 · 技术团队
https://www.bestblogs.dev/article/695010f7fb

[4] 腾讯 15 年资深后台工程师，转战大模型推理的抉择
本文分享了一位腾讯 15 年资深后台工程师在 AI 时代转型大模型推理工程的心路历程、技术路径及对未来趋势的深度思考。
来源：腾讯技术工程
https://www.bestblogs.dev/article/a6da76a758

[5] 高级评估: 如何在产品中发现并修复隐藏的 AI 失败
大多数 AI 团队会跳过错误发现并直接写入指标，但审查跟踪以找到值得测量的失败是最高效的步骤，编码代理可以自动化大部分工作，约 30 分钟。
来源：Lenny's Newsletter
https://www.bestblogs.dev/article/3f08d1eb1d

[6] Impeccable：用技能工程构建可靠智能体执行框架 [视频]
Paul Bakaus 展示了 Impeccable 如何借助独立评审、反吸引子、任务路由、持久记忆、可执行上下文、Hooks、实时交互和模型专属构建，将设计提示转化为可靠的智能体 Harness。
来源：AI Engineer
https://www.bestblogs.dev/video/d645aff0f

[7] 提效约 70%！去哪儿网 AI Coding 驱动大型系统重构实践
去哪儿网分享如何通过构建 Harness（约束系统）与 Loop（反馈系统），将 15 万行代码的大型核心系统重构转化为可拆解、可验证的工程化 AI Coding 实践，实现交付效率提升 70% 及显著的性能优化。
来源：dbaplus 社群
https://www.bestblogs.dev/article/28a7fada55

[8] 千问办公押注的企业上下文，是 Agent 时代的组织语言
千问办公发布企业上下文（Enterprise Context）及相关产品，旨在通过构建结构化的组织知识体系、赋予 Agent 明确的组织身份与安全审计机制，将 AI 从通用办公工具升级为能深度嵌入企业业务流程的数字员工。
来源：爱范儿
https://www.bestblogs.dev/article/50c945cbe4

[9] AI 进入生产阶段之后， 智能、算力、芯片 会走向哪里？ [播客]
庄明浩以单口 PPT 形式整理 AICC2026 人工智能计算大会，从需求侧结构性跃迁、智能重新定义、算力芯片生态三层，论证 AI 进入生产阶段比的是「谁能让每个任务跑完」。
来源：屠龙之术
https://www.bestblogs.dev/podcast/bb87a822d

[10] 有效第三方评估的优先事项和原则
OpenAI 承诺支持独立评估，提供训练、评估和部署的深度访问，并提出了四个评估优先事项。
来源：OpenAI News
https://www.bestblogs.dev/article/6e88bfa7b4

---
http://BestBlogs.dev · 发现真正适合你的高质量内容
BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
在线阅读：https://www.bestblogs.dev/explore/brief/2026-09-23

### 引用推文

> ginobefun：https://x.com/i/article/2102545548788281344
