https://x.com/i/article/2099162058822701056
BestBlogs 精选周刊|第 112 期:可托付的智能
🎧 本期也有播客版本:BestBlogs 周刊 第 112 期 · 可托付的智能,时长 28:20。在小宇宙搜索「BestBlogs 周刊」即可收听。
在线阅读和收听:https://www.bestblogs.dev/newsletter/issue112
过去几个月,我们已经很习惯看到模型完成过去做不到的事。它能写出可以运行的代码,操作浏览器,阅读数百份文件,也能把一个模糊问题拆成一连串动作。能力边界还在快速向外推,但一个更现实的问题随之出现:当系统说任务完成了,我们敢不敢把这个结果直接拿去用?
这个问题在演示中不明显。演示只需要成功一次,真实工作却会遇到过期数据、含糊需求、权限不足、工具失败、环境变化,以及人与人之间从未写下来的约定。一次回答看起来聪明,和一个任务可以放心交出去,中间隔着一整套工程、产品与组织条件。
第 110 期「新的稀缺」把注意力从模型供给转向环境、验证、信任和人的注意力;第 111 期「经验复利」讨论反馈、证据、版本与责任怎样让下一次工作变好。本期把两条线合在一起:稀缺资源建起来了,经验也进入循环了,最终还要经过一个更严格的检验——它们能否共同支撑一次真实托付。
我理解的「可托付」不是让 AI 完全自由行动,也不是每一步都要求人点击确认。它更像一份动态合同:系统知道目标是什么,能访问完成目标所需的事实与工具;行动范围与风险相匹配;结果有独立证据;失败时能停下、恢复或交回给人。更重要的是,最后有人知道自己为什么接受这个结果,也愿意为后果负责。
本周 7 份 BestBlogs 早报里,可验收 Harness、模型路由、可信任务委托、工程迁移与独立评测反复出现。入选的 20 篇内容可以整理成 4 条递进主线:能力变便宜以后,托付为什么仍然昂贵;运行时怎样构成托付合同;智能进入真实组织以后如何取得事实并接受验收;当商业单位从点击变成任务,人还要选择什么、承担什么。
一、能力变便宜以后,托付为什么仍然昂贵
DeepSeek V4.1 Flash 是本周最典型的供给侧变化。官方公布它采用 552B MoE,处理输入时激活 8B 参数,生成输出时激活 16B 参数。新的非对称 Causal-Encoder-Decoder 架构不要求输入与输出承担相同计算结构;相较上一代,它的 KV Cache 对 HBM 的需求降至 1/4,对 SSD 存储的需求降至 1/8,闲时 API 价格则是高峰的一半。
这些数字为什么和 Agent 有关?长程任务不会只生成一次答案。它会反复读取上下文、调用工具、写回观察,再继续规划。上下文越长,缓存越大,解析与存储越容易成为持续成本。DeepSeek 的变化不是简单把单个 token 再降一点价,而是在重算长上下文任务的基础设施负担。
官方还表示,新模型会承接旧版 Flash 与未来一段时间的 V4 Pro 请求,并同步开放权重与技术报告。这里需要保留口径:性能比较和成本优势来自官方测试,真实产品仍要把并发、缓存命中、工具开销、失败重试与人工核验放进同一本账。
→ 阅读原文:DeepSeek V4.1 Flash:更强、更快、更普惠
面壁智能的 MiniCPM5-2B 把智能密度推到设备侧。按官方发布,它以 2B 参数在 Artificial Analysis 的 4B 以下开源基座模型中排名第一,并开放 UltraData 数据、Meshy 强化学习框架和 JustRL II 策略。团队还与 Intel、瑞芯微、Arm 等平台完成首日适配,其中 Arm SME2 的 prefill 与 decode 分别报告约 1.7 倍和 1.2 倍提升。
榜单不能代替真实应用测试,尤其不同参数规模和部署精度会改变结果。更重要的信号是,越来越多任务可以在本地、边缘设备或更受控的私有环境中完成。低时延、隐私与离线能力,让托付开始发生在过去不适合调用大模型的地方;但部署位置不会替系统补上权限判断和结果验证。
→ 阅读原文:面壁智能开源 MiniCPM5-2B:端侧通用 Agent 能力的高智能密度路线
ChatGPT Images 2.5 从创作侧展示了「便宜」和「可信」之间的距离。OpenAI 表示,新版本相较 Images 2.0 延迟最高降低 50%,每周通过 ChatGPT Images 与 GPT-Image API 生成的图片已经超过 30 亿张。规模与速度之外,我更关注 Sketch、模板、直接图像评论,以及更可靠的参考主体保持和局部编辑。
创作者愿不愿意继续交出工作,不只看第一张图是否惊艳,还看第二次修改能不能保留已经确认的人物、构图和材质。可托付的创作系统需要尊重先前决定,而不是每改一处就重新抽奖。C2PA 元数据与隐形水印则补上来源识别,让结果离开生成界面后仍保留一部分证据。
→ 阅读原文:推出 ChatGPT Images 2.5
价格下降后,成本单位必须从 token 改成任务
The Pragmatic Engineer 汇总了几家公司的成本实践:
• Uber 在第一季度就用完全年 AI 预算,后来通过开放权重模型、提示词缓存、更便宜的子 Agent 和自动 token 压缩,把单请求成本降低 34%、单会话成本降低 52%
• Pinterest 报告开放模型的单次交易成本低于可比闭源模型的 8%
• AT&T 在部分任务上节省最高 56%,同时报告质量约下降 2%
这些数字来自不同公司、不同任务和不同计算口径,不能直接排列成谁最会省钱的榜单。它们共同说明,企业不再用一个最强模型处理所有问题。边界清楚、重复且易验证的子任务可以交给开放模型或本地模型;需要跨系统协调、模糊判断或高价值决策的任务,再升级到前沿模型。模型路由实际是在给任务分配预算和风险等级。
→ 阅读原文:The Pulse:科技公司转向开放 AI 模型
Ollama CEO Jeffrey Morgan 在 YC 的访谈中也强调混合模式。开放模型降低成本后,企业不必继续把 token 当作严格配给的资源,可以尝试更多工作流。不过,模型权重可下载不代表生产能力已经具备。推理引擎、开发框架、硬件支持、基准测试、云端容量和行为版本必须共同运营。
越多模型进入路由,团队越需要回答:一次请求经过了什么模型与版本,访问了哪些数据,为什么被升级到更昂贵的能力,失败后由谁接手?模型之上的长期价值,会逐渐落到连接企业上下文、管理状态与凭据、协调供应商并维持可靠运行的编排层。
→ 阅读原文:开源模型正在重塑企业 AI 的成本与基础设施
Anthropic 的成本优化指南把机制拆得更细。稳定的提示词前缀可以提高缓存命中;官方表示,较好的应用可达到 90% 至 99%。在一次迁移测试中,prompt-audit 平均降低 14.6% 成本,同时准确率提高 5.3%。缓存、提示词审计、批处理与努力程度调优组合使用,在 LegalBench、tau2-bench retail、OfficeQA Pro 和 SWE-bench Verified 等测试上报告 50% 至 73% 的成本降低。
比固定百分比更值得带走的,是一个反直觉判断:更便宜的模型不一定产生更便宜的任务,更强的模型也不一定产生更贵的任务。便宜模型若反复调用工具、持续重试,最后还要人修复,完整任务可能更贵;强模型若规划更好、轮次更少、一次通过验收,总成本反而更低。
团队应该优化的是每个合格结果的成本,而非每个 token 的价格。质量、时延、工具调用、失败重试、人工介入与基础设施都属于任务成本。
→ 阅读原文:利用 Claude 平台降低成本并提升性能
Spotify 的 Portal 实践为这套成本纪律提供了一个更小的外部样本。团队最初只把大文件路由规则写进 CLAUDE.md,模型有时会忽略;后来改用工具调用前的 hook 执行分流,并要求代码生成必须提供参考文件,避免得到脱离项目语境的实现。标题中的 90% 上下文节省只适用于这套工作方式,不能外推到所有 Claude Code 项目。真正可迁移的是:成本策略若只停留在建议里,就很难稳定执行;高频约束需要进入运行时。查看 Spotify Engineering 的实践
第一条主线由此落下:智能供给降低,让更多工作值得尝试;可托付则要求我们知道一次任务为什么值得调用、完成到什么程度才算合格,以及失败代价是否被算进来。成本账算清以后,下一步才是那份技术合同——Agent 为什么能够持续运行,它如何证明自己做对,又在哪些地方必须停下。
二、托付的技术合同:运行时、独立核验与可恢复性
腾讯技术工程从一次 LLM 调用讲到完整 Harness 的文章,为这份合同提供了一张地图。模型记不住历史,于是外部程序装配上下文;模型碰不到世界,于是增加工具;一步做不完,于是形成模型、动作、环境、观察再回到模型的循环;上下文装不下,于是需要压缩与记忆;任务产生副作用,于是出现权限与沙箱。
当运行时间跨过一次会话,还需要持久化事件、恢复状态、连接多个客户端并协调子 Agent。Harness 不是为了复杂而增加的层次,它是每次撞上单轮调用边界后留下的工程答案。
文章比较 Pi、OpenCode、Codex 与 Hermes,可以看到不同系统在成本、控制、恢复和长期学习之间的取舍:
• Pi 用极简工具与紧凑上下文降低运行负担
• OpenCode 用 Profile 与结构化事件支持多身份和可恢复状态
• Codex 围绕 Thread 生命周期与双层安全边界支持长任务监督
• Hermes 将注意力延伸到下一次任务,探索跨会话自我改进
团队需要先知道自己在优化速度、成本、控制、恢复还是长期学习,再决定增加哪一层。额外架构只有在解决真实失败时才有价值。
→ 阅读原文:从一次 LLM 调用到完整 Harness,Agent 到底经历了什么?
OpenAI 本周推出的 Agents API 把一部分共性运行时做成托管能力。准确状态是 public beta。开发者在一次 API 调用中定义模型、工具、环境和可选知识,平台负责上下文压缩、工具搜索、程序化工具调用、长时间运行和子 Agent 协调。执行环境可使用 OpenAI 托管沙箱、自建基础设施或合作伙伴沙箱。
它的意义并不是开发者以后无需关心 Harness。托管服务解决共性运行时,产品仍要决定给哪些工具、连接哪些知识、允许哪些动作,以及用户何时看到进度或介入。OpenAI 的产品说明也把边界留给开发者:平台提供 Harness,应用保留自己的环境、上下文、工作流与用户体验。
公测阶段还会快速迭代,客户提升数字也来自官方发布中的个案。把它视为成熟稳定层,会掩盖版本变化和供应商边界。更准确的观察是,Agent 产品的竞争正在从「能不能跑起来」转向「能不能把真实业务的工具、知识和权限讲清楚」。
→ 阅读原文:Agents API 正式发布
完成不能由执行者自己宣布
Claude Managed Agents 的创始人圆桌,给出了本期最实用的机制:把期望结果写成 rubric,再由拥有独立上下文的评估者检查。
一家会议产品希望在会前生成简报。系统不仅要找到名字相同的人,还要确认哪份 LinkedIn 资料属于本次参会者,补回邮件和日历里的历史,并把材料排成有人愿意阅读的顺序。认错人会让用户带着错误背景进入会议,因此团队宁可不展示不确定信息,也不提供看似完整的错误内容。
他们把用户体验拆成可检查标准。身份正确性可通过外部资料验证,归因要查看来源,篇幅与顺序也决定材料是否可用。评估者不沿用生成时的完整轨迹,而是用干净上下文独立判断,降低同一个错误假设同时污染生成与自评的概率。
另一家销售产品区分账户、个人和组织记忆。单个账户 Agent 长期理解客户,Watchtower 则跨数百个账户回答今天应该追哪 5 个客户、下季度该预测哪些交易。两类任务需要不同工具与记忆边界。把所有历史塞进一个共享池,既会增加噪音,也可能让不同账户的数据越界。
第三家产品分析公司读取客户代码并对照线上行为。源代码可能包含秘密,所以沙箱、工具限制和可执行动作是产品成立的前提。系统可以在 PR 出现时检查埋点,在上线后发现转化下降并寻找相关改动,有时还会提出修复。代码、产品数据与真实用户行为共同形成评测闭环。
Watchtower 约 2 周搭建等数据属于客户案例。圆桌也承认,有状态记忆和外部工具让离线评测容易漂移。用今天的 Slack 数据回放昨天的任务,可能得到不同结果。可靠做法需要记录输入、版本、工具响应与最终状态,并承认环境持续变化,明确哪些部分能够回放,哪些只能在线观察。
→ 阅读原文:创始人如何基于 Claude Managed Agents 构建产品
Roman Ugarte 讲 Grok Bot 时,把托付放回用户行为。用户不会因为产品自称自主,就立刻交出重要工作。更现实的路径,是从边界明确、结果可检查的任务开始,让用户看到角色、上下文、权限与进度。重复几次都能得到有用结果,委托上限才会逐渐提高。
一个 Bot 也不只是保存下来的 Prompt。它需要明确职责,知道可以访问什么,并在恰当时机让人介入。产品若每次都要求用户亲自补最后一段,用户只会确认系统仍需要被持续照看,信任不会由此增长。判断 Agent 产品是否越过演示阶段,可以观察用户是否愿意带着重要工作反复回来。
→ 阅读原文:Roman Ugarte:一个月打造 Grok Bot,如何让智能体成为可信赖的知识工作同事
权限不是一个总开关,思维链也不是完整证据
NIST 对 Agent 工具使用的工作坊总结提供了一把风险尺:权限可分为只读、受限写入和开放写入,环境则可分为可信与不可信。同样是浏览器,阅读资料与提交订单的风险不同;同样是代码执行,在隔离仓库和接触生产凭据的环境里也完全不同。
这解释了为什么「允许使用工具」不是充分设计。系统需要按副作用分层:能读什么,能建议什么,能写什么,哪一步需要批准,哪些资源永远不可见。权限还必须和身份、环境、任务类型与可恢复性共同定义。
Jakub Pachocki 的《异类心智》从更根本的角度提醒我们,模型更多是通过大规模优化被「培育」出来的,工程师能理解许多局部结构,却很难用一套完整理论解释它在陌生环境中的所有选择。容易测量的能力,可能比价值泛化与异常处理进步得更快。
文章区分目标对齐与价值对齐。前者关心系统是否努力完成眼前指令;后者关心它在目标含糊、冲突或超出训练分布时,能否仍按照更高层原则行动。真实委托经常处在后一种环境中,因为用户很少写出没有遗漏的规格,组织规则之间也可能冲突。
OpenAI 长期使用思维链监控观察模型推理,不过 Jakub 判断,这项工具的可靠性正受到复杂环境、模型自我操纵与非语言推理能力增强的挑战。这不表示思维链没有价值,而是说明模型自述不能成为唯一审计信号。工具调用、权限变化、文件差异、外部状态与最终结果都要进入证据链。
关于递归自我改进的节奏与未来风险,是作者的判断,不应改写为既成事实。对当前团队最直接的启发,是让执行面与控制面保持独立:执行 Agent 可以提出新动作、申请权限或建议修改规则,但不应同时拥有无限行动、自我解释和自我验收的全部权力。
→ 阅读原文:异类心智
METR 的长任务研究提供了另一种可靠性视角。它用人类专家完成任务所需时间,估计 Agent 在对应难度上达到 50% 或 80% 成功率的时间跨度。研究者特别提醒,50% 时间跨度并不表示系统能自动化所有相同时长的工作:任务主要来自软件工程、机器学习与网络安全,而且比真实工作更自包含、更容易自动评分;超过 16 小时的测量当前也不够可靠。
这组边界让「能完成」与「可托付」之间的区别更清楚。一个系统偶尔完成 8 小时难度的任务,和一家企业愿意让它每天处理 8 小时关键工作,是两种承诺。后者需要更高成功率、失败分布、可发现性和漏检代价。团队需要在具体可靠性阈值上决定可以交出哪类权限。查看 METR 的 Task-Completion Time Horizons
第二条主线给出的托付合同包括上下文、状态、工具、分级权限、独立核验、外部证据、停止和恢复。可这些部件一进入复杂组织,就会遇到另一堵墙:事实散落在代码、文档、配置、数据库和资深成员脑中。Agent 即使每一步执行正确,也可能建立在错误前提上。
三、把智能放进旧城:事实、验收与组织协作
阿里云的「架构师 Agent」实践把复杂存量系统的问题概括成:局部正确,整体错误。字段为什么不能删除,历史分支为什么保留,接口曾向哪个团队承诺过什么,往往不会同时出现在一份文档中。只让 Agent 搜索相似片段,它可能找到看起来最相关的材料,却漏掉作出完整工程判断所需的知识集合。
团队因此没有把 RAG 当作唯一骨架,而是先按领域建立强结构知识,明确业务、架构、系统和基础设施的阅读路径。运行时再渐进加载当前步骤需要的材料,最后由事实验证层检查方案。涉及业务取舍、跨团队接口承诺和合规等高风险决策时,Agent 应停止猜测并向人提问。
知识库也不能一次生成后永久可信。代码提交、PR 与发布触发日常增量维护,大促复盘等事件用于周期性校准,高风险知识变更仍需人工确认语义。人从资料收集者转向决策裁决者,而知识系统必须知道何时需要裁决。
→ 阅读原文:「架构师 Agent」系统化落地
蚂蚁数科的 Harness 工程把验收讲得更具体。Agent 一天可以完成过去数月的代码量,生产速度突然提高后,需求评审、Code Review 和测试准出的缺口会集中爆发。一个 60 万行 C++ 存量项目由于历史文档缺失、事实源不统一,AI 介入后缺陷率一度超过 20%。
团队没有立刻换更强模型,而是先让 AI 扫描代码和文档差异,重建唯一事实源,再逐步加入 CI 门禁与多视角 Review。Harness 被拆成约束层、对抗验证层与证据层:
• 约束层明确目标、事实来源与文档规范
• 硬门禁检查规则合规,软门禁由不同 Agent 从 Contract、减法与复用角度审查
• 证据层把测试路径做成可视化报告,揭示「100 个测试只覆盖两个状态之间跳转」的低质量模式
团队报告缺陷率随后降至个位数。这个结果来自特定组织和项目,不能承诺所有代码库得到同等收益;但机制值得迁移:验证数量不等于验证质量,覆盖了多少行代码也不等于覆盖了多少关键状态与失败路径。
所谓可验收,是让一个不参与生成的人看到证据后,可以判断目标是否完成、边界是否守住、风险是否仍存在。模型越强,工程师在目标澄清、边界识别、架构判断和结果验收上的要求反而越高。
→ 阅读原文:AI Coding 的下一步:让结果可验收
天猫技术的大型 AI 项目把个体 Harness 放大到团队协作。团队总结了从超级个体、加人提速、高速迭代到全员赋能的 4 个阶段。早期个人可以凭经验快速推进,人员与 Agent 数量增加后,上下文不一致、冲突和质量劣化便会成为新瓶颈。
他们用不超过 120 行的 AGENTS.md 只做导航,将 specs、changelog、architecture、runbook、vendor 与 wiki 交给 6 个 Skill 管理,并用 Git commit 作为统一关卡。业务站点地图成为任务认领单元,patch 支持并行提交,sunset 处理旧功能退出,双向指针则维持主文档与补丁之间的语义关系。
真实组织还有很多上下文位于代码仓库之外。提示词、配置、任务状态和线上数据可能在数据库或平台中。团队通过 MCP 提供只读通道,再由 Skill 说明何时、如何读取,把外部事实拉回 Agent 视野。技术哨兵机持续同步各仓库的最新 release 分支,模拟预发合并态,检查单个分支正常、组合后却出现的隐形冲突。
→ 阅读原文:天猫技术大型 AI 项目的研发协同实践
软件生命周期开始可编程,工程纪律却没有过期
Thariq Shihipar 建议把前沿模型当作思考伙伴,先共享目标与上下文,再让它探索细节。承重部分仍然很具体:权限、Auto mode、工作流、数据访问、schema 与验证共同组成 Harness。Claude Code 擅长实现代码,Artifacts 与 Agent 循环则可覆盖规划、评审、事故处理和反馈加工,软件生命周期本身开始变得可编程。
有效循环和定时调用有明显区别。定时任务只是重复发出请求,循环需要读取上次结果、分流反馈、实施变更,再观察是否改善。循环运行越久,越需要 Skill、检查点与停止条件,否则持续工作只会让错误更快积累。
→ 阅读原文:Anthropic 如何构建产品,以及工程工作将如何改变
Tibo Sottiaux 讲 Codex 时强调了另一组选择。团队采用 Rust,看重的是正确性、安全、效率与规模,并没有把模型最熟悉的语言当作唯一标准。模型能够加快贡献速度,清晰模块边界和可演进架构反而更重要;许多 Agent 同时修改代码库时,一个含糊接口会比过去更快扩散影响。
人仍决定优先级,判断取舍,维护长期方向,并为软件负责。Agent 拓宽了一个工程师可以完成的范围,快速反馈、安全发布、审慎审查和真实用户使用,仍然决定代码能否成为产品。
→ 阅读原文:Tibo Sottiaux 谈 Codex:从研究工具到软件工程智能体
Shopify 回到原生开发,是本周最能说明旧决定需要重算的一篇。2020 年,React Native 帮助 Shopify 只实现一次功能,让没有移动开发背景的人参与,并减少双平台追赶。2025 年,团队仍公开表示会继续投入。这些判断在当时都有充分理由。后来编码模型能够参考 iOS 实现 Android,也能反向迁移,跨平台共享实现的成本优势被重新计算,Swift 与 Kotlin 更接近平台能力的优势重新变重。
Shop 应用从概念验证到原生版本上架用了 12 周,但这不是让模型一次性重写。Shopify 明确表示,one-shot 只会产生不可维护、不能上线的代码。团队构建 Helix,将一个页面拆成数分钟内可审查的小检查点,每一步都必须:
• 通过自动测试
• 与运行中的应用完成视觉审查
• 经受两轮对抗性代码审查
• 获得人的确认后才提交并进入下一步
反馈会进入后续循环,系统随着迁移逐渐提高自主程度。团队还把业务逻辑与 UI 解耦,让它能在桌面环境无界面运行,再通过 CLI 向 Agent 暴露状态、导航与动作。过去操作模拟器、读取可访问性树和截图需要数分钟,许多核心反馈现在可以在毫秒级返回。模型写得快以后,环境反馈速度成为新的工程约束。
Shopify 主应用拥有 300 多个页面,目前仍在迁移。这条边界需要明确:Shop 应用的成功不等于所有大型迁移已经被证明,也不意味着 React Native 对所有团队失效。这个案例的价值,是展示一种可托付的决策方式:承认旧决定曾经正确,明确哪个核心假设发生变化,用原型验证新成本结构,再通过小检查点和质量门推进。
→ 阅读原文:原生开发已成为 Shopify 移动端的未来
第三条主线说明,事实不是一份专门给模型准备的大文档。它是一套有入口、有来源、有版本、有读取条件,并能在决策发生时自动出现的系统。可托付的组织也不追求一次加载所有知识,而是保证系统在作出某类决定前,一定经过对应事实与验收门。
当这些机制开始稳定交付,商业问题便随之出现:企业购买的还是软件,还是一项完成任务的能力?
四、谁选择下一座山:任务经济与最终责任
腾讯研究院用「单 token 通缩、单任务通胀」描述正在发生的成本变化。每个 token 的价格不断下降,Agent 承担的任务却越来越长。规划、读取文件、调用工具、自我校验与失败重试,会把一次任务的消耗从数百 token 推到数十万。效率提高后,人们反而愿意交出更多工作,总账单未必同步下降。
这是一套分析框架,不是已经稳定的市场事实,但它解释了为什么低价模型与成本治理会在同一周同时升温。互联网过去的商业单位常常是曝光、点击和 seat。平台分发信息的边际成本很低,用户旅程越长,越多位置可以放入广告。Agent 接受的则是任务,需要理解目标、选择工具、读取数据、执行动作并校验结果。
用户可能不再打开 10 个页面比较,而是直接要求系统筛选 3 家供应商、比较报价并预约沟通。掌握任务入口的一方,便可能影响工具调用顺序、数据源优先级、商业推荐与交易闭环。广告也面临更严格的信任边界:替用户作判断的系统若在不透明情况下被商业利益左右,会直接损害它作为受托者的地位。
文章进一步推演,SaaS 可能分化为保存客户、订单、财务与库存等核心数据的 System of Record,以及代表用户调用系统并完成任务的 System of Action。界面型软件可能退到后台,收费方式则从卖坐席转向卖结果。平台格局、费率与利润分配尚未稳定,但「任务由谁理解、由谁完成、由谁为错误买单」已经比点击量更接近 Agent 产品的经济核心。
→ 阅读原文:从流量逻辑到任务逻辑,AI Agent 正在终结互联网的免费午餐
Anish Acharya 对企业循环的描述,把人的位置说得很形象。未来的工程、增长、销售、客服与法务,可能被重组为一层层相互连接的 Agent 循环。每个循环围绕可衡量目标持续执行,遇到阻塞时,人补充缺失的上下文、洞察或方向。循环恢复后,人的注意力可以移到下一处。
他把人的工作概括为「选择下一座山」。自动化系统擅长在已定义方向上逼近局部最优,新的战略目标、异常情况与分布外判断仍然需要人。模型预算也应该和任务潜在收益匹配:药物发现等回报上限很高的任务,可以合理使用昂贵前沿能力;边界清楚、结果可验证、额外智能不再增加经济价值的任务,更适合便宜的专用或开放模型。
选择山不只是提出一个宏大目标,还包括决定为什么值得让别人一起投入,沿途愿意牺牲什么,失败时怎样退出,到达后谁获得价值。循环可以优化数字,组织仍然需要解释数字背后的目的。
→ 阅读原文:企业为何正演变为一系列循环
陈安妮讲快看与新产品 Livo 的长访谈,把问题放进真实创业经历。行业很容易形成一项技术共识:AI 会带来更沉浸的虚拟世界。她追问的却是,用户进入以后到底体验什么。她给出的答案是「命运」,即用户选择会影响内容与 AI 共同编织的剧情,而非站在旁边观看一群自主 NPC 运行。
这个判断把模型能力重新放回人的需求。能生成更多角色、对白与世界,只代表供给增加;用户是否愿意进入、停留和付费,取决于体验有没有情感重量,选择有没有后果,作品有没有品味。她甚至反过来判断,AI 时代可能回到精品内容:运行一个 AI 世界有真实成本,商业上更需要足够好的内容,而不是无限堆量。
她对快看的复盘也说明责任不会因为效率提高而消失。团队曾主动清理流量导向内容,短期数据下降 30%,多年后 IP 衍生收入占比过半。她把商业化视为保护理想产品持续存在的条件,也把员工和行业创作者的生活放进 CEO 的责任。群体讨论可以开放,关键时刻仍要有人行使决策权并承担后果。
系统可以提供选项、模拟后果、运行循环,也可以接过大量执行。什么结果值得追求,什么代价不能接受,什么时候应该为长期价值承受短期下降,不能只由已有指标自动推出。人的位置不只来自机器暂时做不到什么,目标、价值与责任本来就需要主体。
→ 阅读原文:对谈陈安妮:决定在 AI 时代继续冒险
本周关键词:任务、证据、权限、恢复与责任
把 4 条主线合在一起,我会用 5 个词记住本期:
• 任务:不要只看模型分数与 token 单价,要看一个合格结果的完整成本与成功率
• 证据:模型解释有助于理解,验收还要落到文件差异、测试路径、外部来源和真实业务状态
• 权限:只读、受限写入与开放写入必须和环境风险匹配,执行者不应同时拥有无限行动和自我批准
• 恢复:长程系统一定会遇到工具失败、上下文变化与错误假设;能保存状态、停止副作用并交回给人,才适合承担更长工作
• 责任:循环可以持续优化,人仍要选择目标、处理例外、解释取舍,并为接受的结果负责
如果想把「可托付」带回团队,可以先选择一个每周重复、边界清楚、失败可恢复的任务。写下结果标准,列出系统真正需要的事实与最小权限,再安排一个不共享原始推理的独立检查。连续记录几次人工接管,区分问题来自模型、工具、数据还是验收。
这个小实验往往会暴露真正的委托上限:某个组织常识还没有成为系统,单独修改 Prompt 补不上它;团队尚未定义什么证据足以接受结果,Agent 持续工作也无法自行补齐。把这些缺口逐步变成可读取的事实、可执行的门禁与可恢复的状态,信任才会随着重复成功慢慢增长。
下一周值得继续观察两个方向。第一,长程任务会不会开始用更明确的可靠性分布报告能力,而不只展示最好一次的完成结果。第二,任务定价与模型路由是否会出现更清晰的行业计量方式,让产品可以同时比较价值、风险与总成本。
关于 BestBlogs
BestBlogs.dev 是 AI 驱动的私人阅读助手。它会从 RSS、Newsletter、Twitter、YouTube、Podcast 等来源中筛选高质量内容,结合你关注的源、兴趣标签和阅读行为,把「我的早报」整理成每天真正适合你的阅读流——不论你关注的是技术、AI、产品、商业、研究、设计、投资、文化还是个人成长。
完成新用户三步引导即送 7 天 Pro 试用;现有 Pro 用户每邀请 1 位朋友双方各得 7 天 Pro,单人上限 28 天。
发现真正适合你的高质量内容——欢迎来体验,也欢迎推荐给身边认真阅读的朋友。