https://x.com/i/article/2104137100413304832
BestBlogs 精选周刊第 114 期:过剩与短板
🎧 本期也有播客版本:BestBlogs 精选周刊第 114 期 · 时长 24:11 · 在小宇宙搜索「BestBlogs」即可收听。
在线阅读和收听:https://www.bestblogs.dev/newsletter/issue114
导语
过去一周,Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo-V2.6 几乎挤在同一个发布窗口里出现。只看发布稿,行业仍在沿着熟悉的坐标前进:能力更强、速度更快、价格更低、上下文更长。
但把本周 20 篇精选、7 天早报和最近几期周刊放在一起读,另一个变化更加清楚:模型能力每向前推进一步,系统的主要瓶颈就向任务链后方移动一步。模型便宜以后,团队开始为路由、缓存、重试和验证付费;代码生成提速以后,测试、审批、上下文和跨角色等待开始主导交付周期;任何功能都能快速实现以后,判断什么值得做反而成为更难的问题。
第 110 期讨论「新的稀缺」,第 111 期讨论「经验复利」,第 112 期追问怎样的智能才可托付,第 113 期把编译器、评测、运行框架与组织流程称为「模型之外的尺子」。第 114 期继续往下走:这些尺子已经不只是模型外面的安全附件,而是生产系统的主要组成部分。
本期仍然沿 4 条主线展开,不增加新的章节:
• 智能供给过剩以后,为什么模型单价要让位于任务经济
• 为什么评测从上线前的收尾检查变成生产控制面
• 为什么个人快了 3 到 5 倍,组织交付却可能只快几天
• 当执行能力变得充裕,产品信念与人的成长为什么会成为短板
这 4 条线讨论的是同一件事:过剩不会消灭稀缺,只会把稀缺推到更难被量化、更依赖组织判断的位置。
一、智能供给过剩以后,任务经济成为新尺子
Claude Opus 5.5 的官方发布,是理解这一周的好起点。Anthropic 给出的输入、输出价格分别是每百万词元 4 美元和 20 美元,缓存读取降到 0.2 美元;与 Opus 5 相比,词元单价下降 20%,输出速度提高 30% 以上,典型任务的综合运行成本下降 40%。
这里的「综合成本」比单价更值得注意。Anthropic 称,Opus 5.5 不只每个词元更便宜,完成同一任务消耗的词元也更少。一次 20 万行代码库审计,Opus 5.5 在 3 小时内完成,Opus 5 用了 20 多小时并消耗 2.5 倍词元;在把 HAProxy 从 C 改写为 Rust 的内部实验中,Opus 5.5 用 9.5 小时完成,Fable 5.1 用了 12 小时,前者成本低 51%。
更重要的是,长任务的「完成」开始同时包含速度、正确性和可验收性。发布稿提到,一位早期测试者用它在不到一天内完成 68 万行代码迁移;页面加载优化任务运行 40 次,成功 39 次。知识工作测试中,模型要从难以检索的网页副本里完成季度报告,任何虚构数字或引语都会判失败,Opus 5.5 的 18 次运行中有 16 次过线,两个对照模型没有一次达到相同标准。
这些仍是厂商组织的内部或早期客户案例,不能直接外推到所有代码库,也不能把一次迁移的代码行数当作通用生产率指标。它们真正说明的是,模型比较正在从「一道题答对没有」转向「一个长任务花多少钱、多久完成、失败后怎样恢复、最后能否验收」。基准测试仍有价值,却越来越难单独回答生产选型问题。
数字生命卡兹克对同夜发布的 Opus 5.5、GPT-6 Sol 和 Luna 做了横向拆解。GPT-6 Sol 与 Luna 的重点并非把能力推到最前沿,而是在相近档位上把成本较 GPT-5.6 同类模型继续压低约 50%。这给团队带来更细的模型分层:高难任务使用旗舰模型,机械任务交给低成本模型,遇到失败再自动升级到更强模型。
问题在于,便宜模型不一定带来便宜任务。较小或蒸馏模型遇到超出能力边界的任务时,可能持续推理、反复尝试,输出词元急剧增加,几次失败重试的总成本甚至超过一次直接调用旗舰模型。缓存命中率也会改变账本:标价很低的模型,如果上下文结构不断变化、工具定义频繁重排,缓存优势就很难兑现。
因此,模型成本至少要拆成 5 笔账:
• 上下文组装与缓存写入成本
• 首次执行的输入、输出和占用时间
• 失败后的重试、升级模型与恢复成本
• 自动评测、人工复核与回归测试成本
• 没有完成任务所造成的等待和机会成本
每百万词元的价格只是其中一项。生产系统最终要为之买单的,是一次可验收任务的全部成本。
Grok 4.7 提供了另一种有价值的对照。xAI 将价格维持在每百万输入词元 2 美元、输出 6 美元,把改进集中在更大基座、更长强化学习与更强自检。官方数据并不整齐:它在 EEBench 电气工程评测中得到 64.0%,高于 Fable 5.1 的 56.4%;在 Harvey 法律智能体评测中得到 19.6%,也明显领先对照模型。但 CursorBench 4.0 只有 46.3%,低于 Fable 5.1 的 51.8%;Terminal-Bench 4.0 为 37.6%,对照模型达到 57.9%。
这种「有输有赢」比全面领先更能帮助选型。它提醒团队先描述任务,再选择模型:长时间办公室工作、法律分析、终端操作和代码库修改,需要的能力组合并不相同。把所有任务压给同一个模型,只是让采购决策变得简单,运行时的失败形态却会变得更复杂。
路由与缓存决定真实成本
OpenAI 推理团队对生产路由的重构,把任务经济从模型选择推进到系统选择。一个请求并不是找到某个模型就结束了,同一模型背后可能有不同地区、不同 GPU 型号、不同容量与健康状态的推理引擎。路由器要同时处理首个词元延迟、后续生成速度、就绪副本数量、网络距离、数据驻留限制和 KV 缓存命中率。
早期方案使用类似比例控制器的反馈环。引擎持续上报性能信号,控制器根据它相对集群平均值的表现调整权重。它能够自适应,却也会产生振荡:流量从一个变慢的引擎移走后,引擎很快冷却;控制器下一轮又判断它有余量,把流量重新推回去。流量在引擎之间来回摆动,不只让决策难以解释,也会破坏对话前缀已经建立的 KV 缓存。
新架构把职责拆成控制面与数据面。控制面根据全局容量和约束周期性计算权重,数据面保存异步更新的本地快照,在请求到达时快速选择引擎。同步路径只负责执行当前请求;引擎信号采集和权重更新都异步进行。这样既避免把全局优化塞进每次请求,也能通过惩罚、重试上限和负载丢弃防止局部故障拖垮全局。
距离最近的 GPU 因而不一定最快。近处引擎已经排队时,请求跨区发送到有余量的引擎,端到端延迟反而可能更低;同一会话在某个引擎上已有大量缓存时,保留粘性又可能比重新负载均衡更划算。所谓「最低成本路由」,本质是在延迟、容量、缓存、可靠性和约束之间不断求解。
9 月 24 日早报里的 GPT-6 提示缓存补上了应用侧证据。稳定前缀可以在约 30 分钟窗口内复用,缓存输入最高获得 90% 折扣。但只要工具定义、系统提示或输入顺序频繁变化,缓存键就可能失效。成本优化因此也是上下文工程:把稳定规则放在前面,把动态状态放在后面,减少无意义的工具描述漂移,往往比再换一个便宜模型更有效。
自我改进的短板是环境与评分器
MiMo-V2.6 把问题推回训练侧。小米把这次发布定义为递归自我改进路线的一步,但公开材料中更扎实的部分,是一套如何扩展智能体强化学习的工程账本。
不到 6 天的公开训练里,Flash 与 Pro 分别投入约 85 万美元和 262 万美元,各完成 30 轮参数更新,累计产生约 75 万条轨迹。每轮使用 1568 个样本,支持 100 万词元上下文,训练词元量达到 27 亿到 37 亿。团队同时扩大训练批次、任务与环境复杂度,并增加评分器算力,通过组内相对比较为长程任务提供更细的奖励信号。
这套扩展并非单纯堆卡。不同任务要使用统一的轨迹表示,训练和推理引擎要保持一致,多种运行框架需要支持高并发交互,混合训练批次中还要稳定各任务比例。模型既要学会完成任务,也要学会用更短路径、更少词元完成,否则训练出的只是更会消耗算力的智能体。
公开资源包括 7000 多个强化学习任务环境,覆盖软件工程、漏洞复现、知识工作和网页开发。90 亿参数的蒸馏模型在 11 项评测中都较监督微调基线提升,例如 SWE-bench Verified 从 61.1 升至 66.2,Terminal-Bench 2.1 从 37.1 升至 52.8。配套的轻量运行框架把系统提示、工具和上下文管理拆开,再通过多框架联合训练检查模型能否迁移到训练时未见过的环境。
Pro 与 Flash 还把 3D 空间推理、视觉感知和计算机操作纳入同一模型,演示从自然语言生成 Blender 资产、通过多视角画面控制机械臂等能力。这里的重点不在演示数量,而在训练环境已经从「给出文本答案」扩展到「在环境里行动并由外部信号验证」。
这些仍是官方基准测试与官方案例,不能据此宣布递归自我改进已经实现。一次强化学习也没有证明模型能独立改进自身的目标、数据和验证体系。更可靠的结论是:生成能力扩张以后,可执行环境、奖励设计和评分算力会同步变成稀缺资源。模型可以快速产生轨迹,但环境必须告诉它哪些轨迹真的有价值。
屠龙之术对 AICC 2026 的整理,把同一个机制延伸到芯片与算力层。文章把需求增长拆成任务次数、单任务词元消耗与多智能体协作三个乘数,并强调模型、推理框架和国产芯片需要在发布首日完成适配。报告中的长期算力缺口属于会议预测,不能当作已经发生的事实;但杰文斯悖论式的机制成立:单位智能越便宜,可被自动化的任务越多,总消耗未必下降。
第一条主线因此不只是「模型越来越便宜」。更准确的说法是:模型供给扩大,让过去不值得调用智能的环节开始调用智能;调用次数增加,又把成本压力传递给缓存、路由、环境、评分器、芯片适配和验证。任务经济之所以成为新尺子,是因为只有它能把这些分散的成本重新放回同一张账表。
→ 阅读原文:一夜三连发,Claude Opus 5.5、GPT-6 Sol 和 Luna 全部都来了
→ 阅读原文:推出 Claude Opus 5.5
→ 阅读原文:Grok 4.7 发布
→ 阅读原文:Xiaomi MiMo-V2.6:扩展强化学习,迈向自我提升
→ 阅读原文:生产环境中的 LLM 推理路由:从引擎信号到策略
→ 阅读原文:AI 进入生产阶段之后,智能、算力、芯片会走向哪里?
二、评测从收尾检查变成生产控制面
如果任务数量会随着智能降价而增加,下一个问题自然是:谁来判断这些任务有没有做对?人工抽查无法覆盖每一次智能体行动,通用大模型评估器又可能太慢、太贵、波动太大。评测必须从上线前偶尔进行的考试,变成运行期间持续工作的基础设施。
TypeSafe AI 创始人 Diogo Almeida 对这个问题的诊断很尖锐。他曾参与 InstructGPT、ChatGPT 与 GPT-4 研究,也是早期把 RLHF 推向大规模应用的研究者之一。离开 OpenAI 后,他选择了一条近乎相反的路线:不再训练一个更会生成文字的模型,而是训练一个只负责判断的模型。TypeSafe 隐身两年后发布 Jev,并宣布完成 4000 万美元种子轮融资。
他的出发点是 RLHF 的目标错位。RLHF 收集人类偏好,再让模型优化「人更喜欢哪个回答」。当用户持续参与决策时,这种目标很合理;当软件要在服务器后台自主运行时,讨人喜欢与做出稳定决策并不是同一件事。模型即使错得很离谱,也可能继续生成一段听起来很有把握的解释。
RLVR 解决了另一部分问题:数学、代码测试等任务有可验证答案,可以直接优化正确率。但客服分流、风险判断、工具选择与工作流控制,往往没有唯一答案,更需要校准过的概率与拒绝能力。TypeSafe 因此把后训练目标设为「经过校准的决策」。
Jev 不生成一段自由文本再等待程序解析,而是直接提供几类结构化结果:Choice 从预设选项里选择,Score 按有序标准打分,Noul 为一个判断返回概率。应用再根据置信度决定继续、停止、转交人工或调用哪个工具。这减少了所谓的「解码开销」:如果软件最终只需要判断继续还是停止,就没必要先让大模型生成几百个词元,再把它压缩成一个真假值。
这种设计也重新定义了评测器。智能体评测本质上是在给定状态与行为后做结构化判断。Jev 可以让多个细分问题共享同一份状态并行执行,例如分别判断事实准确性、工具选择和任务完成度。评测不再只给出一篇总评,而是生成一组程序可以直接使用的信号。
LangChain 随后把 Jev 接入 LangSmith Evals,并与 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 做了一轮天气智能体小样本实验。Jev 的单个样本平均方差是 0.0000149;Luna 高 433 倍,Terra 高 913 倍,Claude 高 92 倍。单次判断平均耗时 0.44 秒、成本 0.00035 美元;整轮实验 Jev 约花 0.34 美元,对照 Claude 约花 28.17 美元。
低成本真正改变的是覆盖率。评估器很贵时,团队只能抽查少量执行轨迹;足够便宜时,可以为每次智能体运行同时设置多个聚焦标准,对模型、提示词和工具的每次变更运行回归测试,还可以在置信度不足时重复判断。只有获得更密集的反馈信号,线上评测才可能进入日常开发循环。
边界必须同时写清。方差低表示结果稳定,不等于结果正确,一个模型完全可能稳定地犯错。LangChain 的测试规模小、领域窄,也没有证明 Jev 在医疗、金融或复杂代码任务上同样可靠。Jev 更适合作为便宜、一致、可校准的第一层判断,高风险任务仍需要代码规则、业务指标、更强的评估模型或人工复核。
评测规则也需要工程治理
大淘宝的智能体评测体系补上了工程治理这一侧。策略类智能体面对三个难题:真实反馈稀缺且存在延迟,多个业务目标之间需要动态权衡,离线看起来合理的策略上线后又可能被货盘、周期和流量变化打败。因此,团队没有先问「用哪个评估器」,而是先建立五层评测对象、四步质量归因和三阶段上线治理。
五层评测把问题从提示词约束一直拆到业务效果。上游不稳定会污染所有下游结论:格式与约束没有满足,后面的策略分数就没有意义;上下文召回错了,执行过程即使完全符合流程也会得到错误策略;离线判断全部通过、线上指标仍然下降,则说明评估器可能没有对齐真实业务目标。
四步归因要求评测结果必须能驱动行动:先分层诊断,再定位根因,然后选择提示词、数据、算法、工具或经验库的优化路径,最后回到回归集和线上实验验证。三阶段治理再把它接入准入、灰度和持续监控。评测不再只负责说「不及格」,还要回答错在哪一层、应该改什么、改完怎样证明有效。
AutoRubrics 用历史策略、专家经验和失败样本自动生成自然语言规则,再从数百条候选规则里筛出能区分业务效果的子集。这条路线的价值在于可解释:评估器给出低分时,团队能看到违反了哪条规则,而不是面对一个来源不明的总分。
文章最有价值的部分,是把失败过程完整写了出来。早期实验总把正面样本放在 A、失败样本放在 B,训练集准确率看起来达到 96%,换到验证集却只有 50%。模型学到的是位置偏好,没有学会判断策略质量。修复时必须随机调整 A、B 的位置,必要时正序、逆序各跑多次,只保留位置交换后仍一致的结论。
消除位置偏差后,团队从 330 条候选评测规则中做选择,又遇到过拟合:换一批样本,入选规则几乎完全不同。最终方案重复 200 次自助采样,每次抽取 70% 的偏好对,先按入选频率过滤不稳定规则,再用五折交叉验证逐步选择。高置信度数据集也要求同一偏好对独立判断 3 次并随机交换位置,只有方向正确且 3 次一致的样本才能进入。
即使如此,评估器仍会随数据分布变化而退化。文中一版规则评估器的准确率从测试集 86% 降到验证集 68%,再降到泛化集 55%。这提醒团队:评估器本身也是一个需要版本管理、回归测试、审计和淘汰机制的生产模型。未经校准的评估器提供的虚假确定性,可能比没有评估器更危险。
评测必须进入停止条件
大淘宝提出的「循环工程」,把评测重新接入持续执行过程。一个可以可靠运转的循环,至少包含读取外部状态、判断下一步、执行、验证、写回状态和检查停止条件 6 个动作。少了状态写回,它只是一段更长的聊天;少了停止条件,它就是一台会无限消耗词元的定时器。
文章进一步区分了 4 个常被混用的概念:提示词工程关心一句指令怎样写,上下文工程关心提供什么材料,运行框架工程设计工具、权限和运行环境,循环工程则负责这些部分何时被唤醒、怎样持续运转、由谁检查、状态放在哪里。
定时自动化、隔离工作目录、技能、插件、子智能体与外部记忆,也不是一张采购清单。自动化只负责按时唤醒;隔离工作目录负责避免任务彼此干扰;技能把项目知识保存在对话之外;插件和连接器接入真实系统;子智能体可以分离执行者与检查者;外部记忆则保证任务中断或上下文压缩以后,系统不会重复走同一条死路。
真正的控制面还包括权限和预算。只读观察、提出建议、经批准执行、有限自主应该逐级开放。每个循环都要定义最大轮次、最大词元用量、连续多久无进展必须停止,以及哪些迁移、安全、权限和生产配置必须交给人。验证结果也要保留命令、退出码和失败用例,不能允许智能体把长日志概括成一句「大部分测试已经通过」。
这正好解释了 Jev 与 AutoRubrics 应该放在哪里。便宜的评估器提供高频信号,结构化评测规则提供可解释标准,执行循环再把信号变成继续、重试、改换策略或转交人工的行动。只有三者连起来,评测才会从仪表盘变成控制系统。
科学发现展示了评测的终极边界
Claude 发现具有类 CRISPR 重复序列的新型酶系统,是一则很容易被写过头的故事。Anthropic 生命科学团队动用约 950 个 Claude 智能体,连续运行 21 小时,消耗约 2.1 亿词元,扫描 20 多万条逆转录酶序列。智能体自主比较不同逆转录酶家族、复核文献并提出候选,最终注意到一种异常逆转录酶基因旁边反复出现的 DNA 阵列。
团队后来把它称为「阵列关联逆转录酶」,简称 ART。这个系统主要存在于噬菌体中,由逆转录酶、相邻伙伴基因和规则间隔的重复序列组成。初步实验发现,ART 阵列会表达为一组不同的短 RNA,这使它看起来与 CRISPR 阵列有某种结构相似性。
但 ART 的主要功能仍未确定,研究还处于预印本阶段,关键湿实验由人类科学家完成。现有证据只能支持「智能体从大规模序列中发现了值得实验的异常模式」,不能支持「AI 已经发现一种可用的新 CRISPR 工具」。
这个案例的可迁移价值在工作流程:机器把 20 多万条序列压缩成少量候选与报告,科学家用专业判断决定实验优先级,湿实验再把漂亮但错误的解释挡在门外。智能体负责扩大假设空间,人类与物理世界负责建立事实。
在科学发现里,过剩的是候选假设,短板是实验能力、证据质量与科学品味。在软件系统里也是如此:智能体可以生成大量修复方案和策略,真正稀缺的是一套独立于生成者、能够及时拦住错误的验证机制。
因此,评测成为生产控制面,并不意味着给每个输出加一个模型分数。它意味着低成本在线信号、结构化归因、外置状态、权限分级、预算与停止条件共同组成闭环;也意味着系统始终承认,自己的评测可能错,需要接受业务结果、人工专家和现实世界的再次检验。
→ 阅读原文:Diogo Almeida:我为什么要做 Jev?
→ 阅读原文:Jev 能成为更好的智能体评估器吗?
→ 阅读原文:让智能体可评、可控、可迭代:业务效果导向的评测体系与场景实践
→ 阅读原文:循环工程:把智能体放进工程循环
→ 阅读原文:Claude 发现一种具有类 CRISPR 重复序列的新型酶系统
三、个体提速不等于组织吞吐
本期最锋利的一组数字来自网易:程序员使用 AI 编程工具后,个人效率提升 300% 到 500%;同类软件功能从需求到上线,却只从 20 天缩短到 17 天。一个环节快了数倍,整条价值流只快了 3 天。
AI 编程当然有价值;这里暴露的是局部速度与系统吞吐之间那条漫长的协作链。一个需求要经过澄清、设计、权限、数据准备、开发、联调、评审、测试、上线和反馈。代码写得再快,只要下一环节仍按原来的批次与节奏工作,新增产能就会堆成更多等待评审的合并请求。
阮良把个人使用与企业任务区分得很清楚。个人任务通常是短程闭环,一个人可以决定目标、提供上下文、验收结果;企业任务跨越角色、流程和系统,模型即使知道答案,也未必拥有调用数据、修改配置和推动决策的权限。企业知识库因而不能只是静态文档仓库,它还要保存经营数据、客户声音、流程约束与决策历史,并在智能体执行任务时提供可以直接调用的依据。
网易取消低效周会的实践很有代表性。参会者提前按模板把信息写入知识库,AI 负责汇总、发现冲突并生成可追问的报告,人只为真正需要讨论和拍板的问题开专项会。这里没有增加一个炫目的智能体产品,而是先重写信息流:同步信息交给机器,责任判断留给人。
阿里的《AI 原生研发范式实践手册》从更大的组织视角解释了同一落差。文章估计,需求理解、环境构建、测试验证与发布运维占据研发生命周期的 70% 到 80%。编程基准测试的分数上升,最多只能先压缩其中一段,无法自然转化为企业十倍效能。
手册把这段落差拆成 3 类:智能体是否拥有安全访问内部系统的基础设施,工作流程与历史知识能否提供可执行的上下文,组织文化、人才评价和协作方式能否适应新的分工。它又从真实业务提炼出环境与验证、平台升级、提效度量、数字员工和组织配套 5 类挑战。模型与运行框架只是起点,身份、权限、沙箱、可观测性、评测和激励机制,共同决定智能体能否进入生产环境。
先给变更建立正确性证书
Anthropic 的代码现代化准备指南,把抽象的组织问题落成 6 个步骤:确定目标,建立正确性证书,设计晋升策略,准备环境与组织条件,构建智能体工作流程,再从小范围端到端试点开始。
第一步就要求区分 3 种现代化:原地升级只更新依赖或运行环境;等价迁移会更换技术栈但保持行为不变,例如把 COBOL 改写成 Java;重新设计则同时改变架构和行为。三者需要的证据完全不同。等价迁移可以用生产流量回放、新旧版本差异和并行部署验证;重新设计没有稳定的旧行为可供对照,必须先让用户与业务团队共同确认新的行为规格。
「正确性证书」是一组每个变更都必须满足、且尽量可以自动检查的条件。原有测试套件、生产流量回放、新旧输出差异、对抗式审查、性能边界、安全扫描和业务规则,都可以成为证书的一部分。智能体负责持续修改,证书决定变更有没有资格继续前进。
证书的难点在于把隐性业务规则变成证据,写一个 YAML 配置文件远远不够。许多遗留系统测试覆盖不足、用例不稳定、遥测缺失,真正的边界藏在老员工记忆、异常工单和线上数据里。团队要先补测试、建立流量回放系统,或搭一套与生产环境并行运行的验证环境。AI 不会消灭这些前置工作,只会让过去没有写下来的约束更快暴露。
晋升策略则承认,人类不可能逐行审查智能体高速产生的所有代码差异。团队应按影响范围与智能体置信度分层,关键路径保留完整人工审查,低风险变化主要审查证书证据;反复出现的异常标记要修进工作流程或证书,而不是让专家每次手工处理。专家的时间从「读完每一处代码差异」,转向「定义标准、处理高风险例外、修正反复出现的系统性错误」。
指南还给出一个重要的成本判断:几个便宜模型的失败重试,可能比一次调用强模型更贵。机械批量工作可以交给成本与能力均衡的模型,困难转换和对抗评审使用更强模型,但最终仍应根据试点中的重试率与证书通过率选择,而不是依据模型价目表。
组织上下文要从文档变成可执行流程
LinkedIn 的实践说明,仅让智能体搜索文档还不够。它拥有约 1000 个代码仓库、数千个微服务和大量内部框架。早期团队给所有工程师开放编码助手,实际效果却不理想:智能体不知道依赖怎样安装、内部系统怎样调用、什么测试必须运行,工程师需要不停补充提示,最后不少人又回到手工编码。
第一步是用 MCP 接入代码搜索、文档、内部知识库、功能开关、任务系统、数据平台、日志与指标。工具解决了「信息在哪里」,却没有解决「怎样完成一项工作」。复杂任务仍会陷入 3 个问题:团队经验散落在资深工程师脑中,工具返回过多内容导致上下文过载,上下文压缩后智能体又忘记刚刚发现的东西。
LinkedIn 因此构建 CAPT,一套面向智能体的上下文操作手册与工具系统。操作手册把做事方法写成名称、描述、步骤、输入、工具和验收标准;智能体在需要完成某项任务时按需加载,而不是把所有组织资料一次塞进上下文。
好的操作手册有两个设计原则:一是自包含,一份手册只完成一件明确的工作;二是可组合,长流程可以引用更小的流程单元。这样既能复用,也能按需提供上下文。智能体只有执行到某一步时才读取对应细节,从而减少无关词元和频繁的上下文压缩。
实验清理是一个典型例子。实验结束后,工程师要找到所有相关代码路径,删除失败变体和过期开关,确认获胜方案成为默认行为,再完成验证和报告。过去需要熟悉内部实验平台的专家亲自操作;专家把流程写成操作手册后,其他团队即使不熟悉这套系统,也能沿着同样的步骤完成。
CAPT 已形成 600 多个工作流程和数千个工具。所有工具通过统一的 MCP 服务分发,首次使用时完成 OAuth 身份认证,凭据保存在系统的安全存储中;工具还要经过信息安全审查。系统区分跨仓库的中央操作手册与仓库内的本地操作手册,后者随代码一起进行版本管理。更新部署后,企业设备可以在约一小时内获得新版本。
工具太多本身也会拖累智能体。演讲提到,工具超过约 30 个后,上下文负担和选择成本就会明显增加。因此,CAPT 仍然需要按需发现和加载,而不是把数千个工具的定义全部放进提示词。更多上下文不等于更正确,准确、最新、足够精简的上下文才有价值。
操作手册也会过时。LinkedIn 鼓励智能体在执行结束时总结失效步骤和新发现,形成更新建议,再把修改提交回操作手册仓库。这建立了一条知识复利链:执行产生例外,例外被写进流程记忆,下一次遇到相同任务就不必重新探索。官方公布的采用规模说明这种机制已经进入组织,但不能据此断言生产率已经整体提升;真正值得复制的,是知识怎样从个人经验变成可进行版本管理、审计和调用的资产。
统一模型的价值来自统一系统
美团 MTFM 把组织统一问题映射到推荐系统。过去外卖首页、拼好饭等业务独立维护特征、行为序列和模型,小流量场景数据稀疏,基础设施又重复建设。MTFM 没有停在扩大模型规模,它重新定义了跨业务信息怎样表示、共享和计算。
异构特征编码器把输入分为 H、R、T 三类标记。H 表示跨业务长期行为,R 表示按时间排序的近实时行为,T 表示当前要预估的商家、商品或券包。共享行为可以进入统一的主干网络,各业务独有特征仍由独立编码器和任务塔处理,因此不用强行把不同业务的数据结构对齐成同一个模板。
动态掩码进一步控制信息的可见范围,防止跨时间和跨候选项泄漏。计算层没有对上千长度的序列反复执行全量注意力,而是按 3:1 交错使用目标注意力与全量注意力。16 层配置下,训练批次可以扩大 1.7 倍,样本吞吐达到全部使用全量注意力时的 2.9 倍。训练时按用户聚合同一用户当天在各业务中的曝光,让多个目标项共享开销最大的长序列计算;部署时只保留当前业务需要的任务塔,避免无效计算。
工程优化继续深入到计算算子。动态掩码的构建时间从约 22 毫秒降到 1 毫秒,部分注意力计算的前向、反向性能分别提高 128% 与 152%;团队还删掉近 500 个不影响效果的特征,使训练吞吐再提高 6%。这些细节说明,线上收益来自算法与基础设施的协同设计,而不是一个「推荐大模型」标签。
文章给出的官方线上口径是,最显著业务订单增长超过 6%,同时推理成本降低 24%。这是美团特定业务与实验条件下的结果,不能直接外推到其他推荐系统;但其中的机制具有普遍性:只有共享数据表示、样本组织、注意力架构、计算算子与业务目标一起改变,局部模型提升才会转化成端到端价值。
腾讯一位拥有 15 年经验的后台工程师转向大模型推理,也说明旧能力并没有整体失效。推理系统表面上出现了预填充、逐词生成、KV 缓存、连续批处理和推测解码等新概念,底层仍在权衡算力、显存、通信、吞吐、延迟和稳定性。分页注意力借鉴了虚拟内存的页表机制,分布式 KV 缓存需要生命周期与分片管理,智能体服务又从短请求、无状态的「小卖部」变成多轮、长时、有状态的「旅馆」。
越靠底层,共性越强、标准化程度越高;越靠业务层,状态、工具、权限和稳定性要求越具体。传统后台工程师的价值因此没有消失,而是迁移到长会话调度、状态持久化、记忆、沙箱、可观测性与效果评估。真正改变的是所解决问题的层级,而不是简单更换职位名称。
把这 6 篇内容放在一起,组织短板就不再抽象。证书把隐性正确性写成验收条件,操作手册把专家流程变成可复用的流程记忆,统一模型重新组织重复的数据与计算,知识库保存决策历史,权限和晋升策略控制风险,传统基础设施则保证长任务稳定运行。缺少其中任何一层,个人 3 到 5 倍的局部提速,都可能消失在 17 天的总周期里。
→ 阅读原文:MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践
→ 阅读原文:如何为 AI 驱动的代码现代化项目做好准备
→ 阅读原文:《AI 原生研发范式实践手册》发布
→ 阅读原文:腾讯 15 年资深后台工程师,转战大模型推理的抉择
→ 阅读原文:LinkedIn 的上下文工程:如何用 MCP 为 AI 智能体构建组织级上下文层
→ 阅读原文:当 AI 进入组织,那些从没人说过的真相
四、执行过剩以后,方向与人的成长成为短板
前三条主线解决了执行成本、结果判断和组织吞吐。可当这些系统真的开始工作,团队会遇到一个更靠前、也更难外包的问题:做什么。
Dan Shipper 与 Claire Vo 的两场分享从两个方向回答它。Dan 讨论怎样设计探索组织,Claire 讨论怎样改变产品承诺。前者防止新技术探索拖垮稳定产品,后者防止强大的执行机器把未经验证的想法全部做出来。
Dan 对产品团队的诊断是,探索和交付要求相反的工作方式。探索是发散的,要同时尝试多条路径并接受大部分失败;产品交付是收敛的,要持续说不,维护一致体验并兑现客户承诺。让同一支团队同时承担两种目标,探索会被路线图压缩,路线图又会被每次模型发布打乱。
Every 的解法是建立小型实验室。传统的「两张披萨团队」可能有 8 到 10 人,AI 时代则可以缩小为一两人的小组。一位像海盗,追着价值快速搭出大量粗糙实验;另一位像架构师,把已经显露价值的实验整理成可扩展系统。实验室预期会丢掉约 90% 的产出,产品团队只吸收约 10%。高淘汰率是探索工作的正常成本。
实验要尽量放进真实工作中检验。内部真实使用能缩短「做出来」到「知道有没有用」之间的距离;如果内部不是目标用户,就找少量早期客户共同测试。多条方案可以并行探索同一个问题,因为前沿能力快速变化时,团队首先需要绘制可能性地图,而不是过早押注唯一架构。
Every 为总编辑 Kate 自动修改文稿的案例,把这套抽象机制讲得很具体。Dan 多年来收集她的编辑修改,尝试让模型复现这种品味,早期实验一直不够好;模型能力到达临界点后,团队才把它做成 Kate Bench。架构师接手后建立仪表盘,记录建议接受率,以及智能体修改后 Kate 仍需完成的工作。系统迭代一个月后,Kate 在这类编辑上的工作量又下降约 12%。
这个数字不支持「AI 替代编辑」的结论。它表明实验终于拥有可持续测量的反馈:实验室先证明某种能力开始可用,产品化阶段再把它变成可观测、可改进、可扩展的系统。
研究管线决定实验何时晋升。Dan 给出 3 个启发式条件:是否有人持续回来使用,是否比现有方案好一个数量级,规模化后成本是否仍可接受。十倍更好不适用于所有产品,但它提供了一道必要的摩擦力,防止团队因为「新」而误判「有价值」。每周让实验室和产品团队共同查看管线,又能让主线团队提前理解正在接近成熟的能力,而不是在最后一刻被迫接盘。
实验室的 90% 失败也可以产生回报:沉淀为内容、早期客户计划、能力地图和内部经验。关键是失败必须减少下一次的不确定性。如果实验被丢弃后只留下一堆代码,它仍然是浪费;如果它留下对模型边界、用户行为和成本结构的新证据,探索就形成了复利。
路线图为什么会成为危险的传送带
Claire Vo 从另一端描述执行过剩。她的 AI 工厂拥有编程智能体、40 个 Grok 机器人和自动修复客诉问题的流程,合并请求数量增长到原来的 3 倍,ChatPRD 被重构 70 次,技术债也可以被迅速清理。机器完成了团队过去期待的一切,她却发现,能否构建与内心是否真正相信「这些代码有价值」之间的距离越来越远。
传统路线图诞生在工程资源稀缺的时代。产品经理用优先级和日期压缩需求,工程与设计资源构成了天然过滤器,排在优先级分界线以下的坏想法往往永远没有机会实现。如今执行成本骤降,这个偶然存在的过滤器消失了。需求清单里的每一项都变得可以构建,但可以构建并不等于值得构建。
Claire 把风险分成 3 个陷阱:
• 积压陷阱:清空需求列表被误认为业务进展,实际只证明机器能够消费列表
• 趋同陷阱:竞争者听相似客户、读相似数据、调用相似模型,越快执行越快做出同一种产品
• 流失陷阱:团队不断上线又不断放弃,没有留出时间观察、学习和继续投资
她把这种状态称为「路线图归零」。它指路线图上所有可见功能都变得可行,远不只是清空了列表;开发成本也不再能有效帮助排序。继续使用功能、影响、信心、成本一类旧公式,尤其把开发工作量当作关键变量,会让优先级计算看起来精确,却失去战略意义。
计划仍然必要,但决策起点要从「要构建什么」上移到「要证明什么」。团队先写出对未来的持久信念,再明确哪些证据会支持、削弱或推翻信念。功能只是与现实接触的可抛弃实验,不再天然获得长期维护资格。
对客户的承诺也要分层。探针是低成本尝试,用来确认问题是否存在;实验意味着团队愿意持续投入并收集证据;承诺才代表客户可以依赖、企业愿意长期维护。这个分层要求团队诚实表达当前的确信程度,避免把每次试验都包装成稳定产品,同时也不能把它当作随意下线功能的借口。
这与 Dan 的实验室机制刚好拼在一起。实验室提供高淘汰率的组织空间,信念式路线图提供实验晋升与承诺的语言。前者让大多数想法便宜地死掉,后者让少数经过现实验证的方向继续复利。
它们共同反对把输出量当作进展。代码行数、合并请求数和发布功能数,在执行稀缺时代或许能近似代表投入;执行过剩以后,这些指标反而可能奖励浪费。更有价值的指标是,团队每月运行了多少有野心的实验,多快发现一个信念不成立,是否通过失败减少下一轮盲区,以及什么证据让一个方向获得更多计算资源、时间与客户注意力。
前一章的评测解决「这次执行是否合格」,这一章的产品信念解决「这次执行是否值得」。缺少前者,团队会把正确方向做坏;缺少后者,团队会高质量地完成不该做的事情。
人的价值转向提出非默认问题
Replit 首席执行官 Amjad Masad 关于年轻人和教育的访谈,把方向问题扩展到个人成长。他认为,年轻人在社会中的重要作用,是质疑根深蒂固的信念,进行一段暂时看不出用途的支线探索。教育如果只训练人按标准答案完成任务,会把这种能力过早磨掉。
他用 Steve Jobs 在大学旁听书法课的故事说明,兴趣的价值常常只能事后连接。学习字体在当时没有清晰职业回报,后来却影响 Mac 的字体与界面。学校真正能提供的,不只是标准课程,也包括计算资源、实验室、同伴与一段可以追随好奇心的时间。
Amjad 理想中的学习环境不以毕业、成绩和出勤作为唯一目标。一个学生如果因为项目进入高度专注状态,学校应该提供空间、算力与导师,而不是先惩罚他偏离课表。项目式学习让知识与真实目标发生联系,也让人暴露自己是否真的理解,而非只会通过考试。
这并不等于鼓励所有年轻人退学创业。访谈明确反对把 18 岁就接受十年创业承诺当作普遍答案,也承认人际协作、伦理和人格成长是教育的重要部分。真正需要的平衡,是既能追随好奇心,也能与他人合作;足够不同意默认答案,但不能不同意到无法共同做事。
他评价年轻人才时,最看重一个人有没有沿着某条线索走得足够深,项目是否热门反而不重要。长期追踪一个没有即时奖励的问题,会暴露专注、内在动机和面对不确定性的能力。这些能力恰好很难通过更强的执行模型批量获得。
这是一组规范性观点,不是教育效果研究,不能从访谈直接推出某种学校制度更优。但它与本期主题形成了重要连接:当标准路径上的执行越来越便宜,提出一个不在需求清单里的问题、识别值得长期投入的方向、在没有外部奖励时持续探索,会成为更难复制的能力。
公司也面对同样的平衡。只奖励稳定交付、不允许探针失败,AI 会让组织更快复制过去;只奖励新东西、不要求证据和承诺,AI 会让组织更快制造噪音。探索阶段需要高淘汰率,承诺阶段需要高可靠性,两者之间必须有清晰的证据门槛。
因此,执行过剩以后,方向不能只是一句宏大愿景。它应该是一组可被证据支持或推翻的持久信念,一套让大多数候选安全退出的实验机制,一种区分探针、实验与承诺的客户语言,以及保护人的好奇心不被生产机器磨平的组织选择。
→ 阅读原文:在移动的 AI 前沿上做产品:用实验室机制驾驭技术变革
→ 阅读原文:最后一份路线图:当 AI 让执行过剩、信念成为稀缺品
→ 阅读原文:Replit 首席执行官 Amjad Masad 谈 AI 时代的年轻人应该学什么
本周关键词
任务经济。模型单价只是输入。上下文、缓存、路由、重试、升级、评测和失败恢复共同决定一次任务是否值得执行。团队应该按任务类型记录完成率、总耗时、总成本和人工介入,而不只比较价目表。
在线评测。评估不再是发布前打一张分。便宜的判断模型扩大覆盖范围,结构化评测规则负责解释原因,执行循环把结果接入权限、停止条件和下一轮学习,现实业务与人工专家则继续检查评测器本身。
组织上下文。个人快 3 到 5 倍,组织不会自动同步提速。行为规格、正确性证书、程序性记忆、工具权限、决策历史和跨角色流程,决定局部能力能否转化为端到端吞吐。
持久信念。任何功能都能快速实现时,能做不再等于该做。团队需要把探索与承诺分开,用真实使用和反证检验方向,让实验可以被丢弃,让获得承诺的产品继续复利。
这 4 个关键词是一条连续链:模型供给扩张,更多任务开始调用智能;任务增加,路由、算力和评测吃紧;评测建立后,组织上下文与协作等待暴露;执行链路打通,产品信念和人的判断成为最窄的一段。
因此,AI 转型不必寻找一套永远正确的终局架构。更实用的能力,是每次提速后重新观察:队列堆在哪里,错误从哪里进入,谁在等待谁,哪个指标已经失去意义,什么证据可以让当前方案停止。然后只改最窄的那一段。
🏷️ 标签:#AI模型 #智能体评测 #任务经济 #上下文工程 #AI原生组织 #产品战略 #个人成长
关于 BestBlogs
BestBlogs.dev 是 AI 驱动的私人阅读助手。它会从 RSS、订阅邮件、Twitter、YouTube、播客等来源中筛选高质量内容,结合你关注的来源、兴趣标签和阅读行为,把「我的早报」整理成每天真正适合你的阅读流。不论你关注的是技术、AI、产品、商业、研究、设计、投资、文化还是个人成长,都能从中发现值得花时间阅读的内容。
完成新用户三步引导即送 7 天 Pro 试用;现有 Pro 用户每邀请 1 位朋友,双方各得 7 天 Pro,单人上限 28 天。
发现真正适合你的高质量内容。欢迎来体验,也欢迎推荐给身边认真阅读的朋友。