# BestBlogs 周刊第112期：可托付的智能

- 来源：ginobefun (@hongming731)
- 发布时间：2026-09-13 23:46
- AIHOT 分数：46
- AIHOT 链接：https://aihot.news/items/cmu00f2tc07n4royml03bilsg
- 原文链接：https://x.com/hongming731/status/2099162803399786509

## AI 摘要

BestBlogs 精选周刊第112期以"可托付的智能"为主题，讨论当模型能写代码、操作浏览器、拆解模糊任务后，如何让一次任务结果真正可放心交付。

## 正文

https://x.com/i/article/2099162058822701056

BestBlogs 精选周刊｜第 112 期：可托付的智能

🎧 本期也有播客版本：BestBlogs 周刊 第 112 期 · 可托付的智能，时长 28:20。在小宇宙搜索「BestBlogs 周刊」即可收听。

在线阅读和收听：https://www.bestblogs.dev/newsletter/issue112

过去几个月，我们已经很习惯看到模型完成过去做不到的事。它能写出可以运行的代码，操作浏览器，阅读数百份文件，也能把一个模糊问题拆成一连串动作。能力边界还在快速向外推，但一个更现实的问题随之出现：当系统说任务完成了，我们敢不敢把这个结果直接拿去用？

这个问题在演示中不明显。演示只需要成功一次，真实工作却会遇到过期数据、含糊需求、权限不足、工具失败、环境变化，以及人与人之间从未写下来的约定。一次回答看起来聪明，和一个任务可以放心交出去，中间隔着一整套工程、产品与组织条件。

第 110 期「新的稀缺」把注意力从模型供给转向环境、验证、信任和人的注意力；第 111 期「经验复利」讨论反馈、证据、版本与责任怎样让下一次工作变好。本期把两条线合在一起：稀缺资源建起来了，经验也进入循环了，最终还要经过一个更严格的检验——它们能否共同支撑一次真实托付。

我理解的「可托付」不是让 AI 完全自由行动，也不是每一步都要求人点击确认。它更像一份动态合同：系统知道目标是什么，能访问完成目标所需的事实与工具；行动范围与风险相匹配；结果有独立证据；失败时能停下、恢复或交回给人。更重要的是，最后有人知道自己为什么接受这个结果，也愿意为后果负责。

本周 7 份 BestBlogs 早报里，可验收 Harness、模型路由、可信任务委托、工程迁移与独立评测反复出现。入选的 20 篇内容可以整理成 4 条递进主线：能力变便宜以后，托付为什么仍然昂贵；运行时怎样构成托付合同；智能进入真实组织以后如何取得事实并接受验收；当商业单位从点击变成任务，人还要选择什么、承担什么。

一、能力变便宜以后，托付为什么仍然昂贵

DeepSeek V4.1 Flash 是本周最典型的供给侧变化。官方公布它采用 552B MoE，处理输入时激活 8B 参数，生成输出时激活 16B 参数。新的非对称 Causal-Encoder-Decoder 架构不要求输入与输出承担相同计算结构；相较上一代，它的 KV Cache 对 HBM 的需求降至 1/4，对 SSD 存储的需求降至 1/8，闲时 API 价格则是高峰的一半。

这些数字为什么和 Agent 有关？长程任务不会只生成一次答案。它会反复读取上下文、调用工具、写回观察，再继续规划。上下文越长，缓存越大，解析与存储越容易成为持续成本。DeepSeek 的变化不是简单把单个 token 再降一点价，而是在重算长上下文任务的基础设施负担。

官方还表示，新模型会承接旧版 Flash 与未来一段时间的 V4 Pro 请求，并同步开放权重与技术报告。这里需要保留口径：性能比较和成本优势来自官方测试，真实产品仍要把并发、缓存命中、工具开销、失败重试与人工核验放进同一本账。

→ 阅读原文：DeepSeek V4.1 Flash：更强、更快、更普惠

面壁智能的 MiniCPM5-2B 把智能密度推到设备侧。按官方发布，它以 2B 参数在 Artificial Analysis 的 4B 以下开源基座模型中排名第一，并开放 UltraData 数据、Meshy 强化学习框架和 JustRL II 策略。团队还与 Intel、瑞芯微、Arm 等平台完成首日适配，其中 Arm SME2 的 prefill 与 decode 分别报告约 1.7 倍和 1.2 倍提升。

榜单不能代替真实应用测试，尤其不同参数规模和部署精度会改变结果。更重要的信号是，越来越多任务可以在本地、边缘设备或更受控的私有环境中完成。低时延、隐私与离线能力，让托付开始发生在过去不适合调用大模型的地方；但部署位置不会替系统补上权限判断和结果验证。

→ 阅读原文：面壁智能开源 MiniCPM5-2B：端侧通用 Agent 能力的高智能密度路线

ChatGPT Images 2.5 从创作侧展示了「便宜」和「可信」之间的距离。OpenAI 表示，新版本相较 Images 2.0 延迟最高降低 50%，每周通过 ChatGPT Images 与 GPT-Image API 生成的图片已经超过 30 亿张。规模与速度之外，我更关注 Sketch、模板、直接图像评论，以及更可靠的参考主体保持和局部编辑。

创作者愿不愿意继续交出工作，不只看第一张图是否惊艳，还看第二次修改能不能保留已经确认的人物、构图和材质。可托付的创作系统需要尊重先前决定，而不是每改一处就重新抽奖。C2PA 元数据与隐形水印则补上来源识别，让结果离开生成界面后仍保留一部分证据。

→ 阅读原文：推出 ChatGPT Images 2.5

价格下降后，成本单位必须从 token 改成任务

The Pragmatic Engineer 汇总了几家公司的成本实践：

• Uber 在第一季度就用完全年 AI 预算，后来通过开放权重模型、提示词缓存、更便宜的子 Agent 和自动 token 压缩，把单请求成本降低 34%、单会话成本降低 52%

• Pinterest 报告开放模型的单次交易成本低于可比闭源模型的 8%

• AT&T 在部分任务上节省最高 56%，同时报告质量约下降 2%

这些数字来自不同公司、不同任务和不同计算口径，不能直接排列成谁最会省钱的榜单。它们共同说明，企业不再用一个最强模型处理所有问题。边界清楚、重复且易验证的子任务可以交给开放模型或本地模型；需要跨系统协调、模糊判断或高价值决策的任务，再升级到前沿模型。模型路由实际是在给任务分配预算和风险等级。

→ 阅读原文：The Pulse：科技公司转向开放 AI 模型

Ollama CEO Jeffrey Morgan 在 YC 的访谈中也强调混合模式。开放模型降低成本后，企业不必继续把 token 当作严格配给的资源，可以尝试更多工作流。不过，模型权重可下载不代表生产能力已经具备。推理引擎、开发框架、硬件支持、基准测试、云端容量和行为版本必须共同运营。

越多模型进入路由，团队越需要回答：一次请求经过了什么模型与版本，访问了哪些数据，为什么被升级到更昂贵的能力，失败后由谁接手？模型之上的长期价值，会逐渐落到连接企业上下文、管理状态与凭据、协调供应商并维持可靠运行的编排层。

→ 阅读原文：开源模型正在重塑企业 AI 的成本与基础设施

Anthropic 的成本优化指南把机制拆得更细。稳定的提示词前缀可以提高缓存命中；官方表示，较好的应用可达到 90% 至 99%。在一次迁移测试中，prompt-audit 平均降低 14.6% 成本，同时准确率提高 5.3%。缓存、提示词审计、批处理与努力程度调优组合使用，在 LegalBench、tau2-bench retail、OfficeQA Pro 和 SWE-bench Verified 等测试上报告 50% 至 73% 的成本降低。

比固定百分比更值得带走的，是一个反直觉判断：更便宜的模型不一定产生更便宜的任务，更强的模型也不一定产生更贵的任务。便宜模型若反复调用工具、持续重试，最后还要人修复，完整任务可能更贵；强模型若规划更好、轮次更少、一次通过验收，总成本反而更低。

团队应该优化的是每个合格结果的成本，而非每个 token 的价格。质量、时延、工具调用、失败重试、人工介入与基础设施都属于任务成本。

→ 阅读原文：利用 Claude 平台降低成本并提升性能

Spotify 的 Portal 实践为这套成本纪律提供了一个更小的外部样本。团队最初只把大文件路由规则写进 CLAUDE.md，模型有时会忽略；后来改用工具调用前的 hook 执行分流，并要求代码生成必须提供参考文件，避免得到脱离项目语境的实现。标题中的 90% 上下文节省只适用于这套工作方式，不能外推到所有 Claude Code 项目。真正可迁移的是：成本策略若只停留在建议里，就很难稳定执行；高频约束需要进入运行时。查看 Spotify Engineering 的实践

第一条主线由此落下：智能供给降低，让更多工作值得尝试；可托付则要求我们知道一次任务为什么值得调用、完成到什么程度才算合格，以及失败代价是否被算进来。成本账算清以后，下一步才是那份技术合同——Agent 为什么能够持续运行，它如何证明自己做对，又在哪些地方必须停下。

二、托付的技术合同：运行时、独立核验与可恢复性

腾讯技术工程从一次 LLM 调用讲到完整 Harness 的文章，为这份合同提供了一张地图。模型记不住历史，于是外部程序装配上下文；模型碰不到世界，于是增加工具；一步做不完，于是形成模型、动作、环境、观察再回到模型的循环；上下文装不下，于是需要压缩与记忆；任务产生副作用，于是出现权限与沙箱。

当运行时间跨过一次会话，还需要持久化事件、恢复状态、连接多个客户端并协调子 Agent。Harness 不是为了复杂而增加的层次，它是每次撞上单轮调用边界后留下的工程答案。

文章比较 Pi、OpenCode、Codex 与 Hermes，可以看到不同系统在成本、控制、恢复和长期学习之间的取舍：

• Pi 用极简工具与紧凑上下文降低运行负担

• OpenCode 用 Profile 与结构化事件支持多身份和可恢复状态

• Codex 围绕 Thread 生命周期与双层安全边界支持长任务监督

• Hermes 将注意力延伸到下一次任务，探索跨会话自我改进

团队需要先知道自己在优化速度、成本、控制、恢复还是长期学习，再决定增加哪一层。额外架构只有在解决真实失败时才有价值。

→ 阅读原文：从一次 LLM 调用到完整 Harness，Agent 到底经历了什么？

OpenAI 本周推出的 Agents API 把一部分共性运行时做成托管能力。准确状态是 public beta。开发者在一次 API 调用中定义模型、工具、环境和可选知识，平台负责上下文压缩、工具搜索、程序化工具调用、长时间运行和子 Agent 协调。执行环境可使用 OpenAI 托管沙箱、自建基础设施或合作伙伴沙箱。

它的意义并不是开发者以后无需关心 Harness。托管服务解决共性运行时，产品仍要决定给哪些工具、连接哪些知识、允许哪些动作，以及用户何时看到进度或介入。OpenAI 的产品说明也把边界留给开发者：平台提供 Harness，应用保留自己的环境、上下文、工作流与用户体验。

公测阶段还会快速迭代，客户提升数字也来自官方发布中的个案。把它视为成熟稳定层，会掩盖版本变化和供应商边界。更准确的观察是，Agent 产品的竞争正在从「能不能跑起来」转向「能不能把真实业务的工具、知识和权限讲清楚」。

→ 阅读原文：Agents API 正式发布

完成不能由执行者自己宣布

Claude Managed Agents 的创始人圆桌，给出了本期最实用的机制：把期望结果写成 rubric，再由拥有独立上下文的评估者检查。

一家会议产品希望在会前生成简报。系统不仅要找到名字相同的人，还要确认哪份 LinkedIn 资料属于本次参会者，补回邮件和日历里的历史，并把材料排成有人愿意阅读的顺序。认错人会让用户带着错误背景进入会议，因此团队宁可不展示不确定信息，也不提供看似完整的错误内容。

他们把用户体验拆成可检查标准。身份正确性可通过外部资料验证，归因要查看来源，篇幅与顺序也决定材料是否可用。评估者不沿用生成时的完整轨迹，而是用干净上下文独立判断，降低同一个错误假设同时污染生成与自评的概率。

另一家销售产品区分账户、个人和组织记忆。单个账户 Agent 长期理解客户，Watchtower 则跨数百个账户回答今天应该追哪 5 个客户、下季度该预测哪些交易。两类任务需要不同工具与记忆边界。把所有历史塞进一个共享池，既会增加噪音，也可能让不同账户的数据越界。

第三家产品分析公司读取客户代码并对照线上行为。源代码可能包含秘密，所以沙箱、工具限制和可执行动作是产品成立的前提。系统可以在 PR 出现时检查埋点，在上线后发现转化下降并寻找相关改动，有时还会提出修复。代码、产品数据与真实用户行为共同形成评测闭环。

Watchtower 约 2 周搭建等数据属于客户案例。圆桌也承认，有状态记忆和外部工具让离线评测容易漂移。用今天的 Slack 数据回放昨天的任务，可能得到不同结果。可靠做法需要记录输入、版本、工具响应与最终状态，并承认环境持续变化，明确哪些部分能够回放，哪些只能在线观察。

→ 阅读原文：创始人如何基于 Claude Managed Agents 构建产品

Roman Ugarte 讲 Grok Bot 时，把托付放回用户行为。用户不会因为产品自称自主，就立刻交出重要工作。更现实的路径，是从边界明确、结果可检查的任务开始，让用户看到角色、上下文、权限与进度。重复几次都能得到有用结果，委托上限才会逐渐提高。

一个 Bot 也不只是保存下来的 Prompt。它需要明确职责，知道可以访问什么，并在恰当时机让人介入。产品若每次都要求用户亲自补最后一段，用户只会确认系统仍需要被持续照看，信任不会由此增长。判断 Agent 产品是否越过演示阶段，可以观察用户是否愿意带着重要工作反复回来。

→ 阅读原文：Roman Ugarte：一个月打造 Grok Bot，如何让智能体成为可信赖的知识工作同事

权限不是一个总开关，思维链也不是完整证据

NIST 对 Agent 工具使用的工作坊总结提供了一把风险尺：权限可分为只读、受限写入和开放写入，环境则可分为可信与不可信。同样是浏览器，阅读资料与提交订单的风险不同；同样是代码执行，在隔离仓库和接触生产凭据的环境里也完全不同。

这解释了为什么「允许使用工具」不是充分设计。系统需要按副作用分层：能读什么，能建议什么，能写什么，哪一步需要批准，哪些资源永远不可见。权限还必须和身份、环境、任务类型与可恢复性共同定义。

Jakub Pachocki 的《异类心智》从更根本的角度提醒我们，模型更多是通过大规模优化被「培育」出来的，工程师能理解许多局部结构，却很难用一套完整理论解释它在陌生环境中的所有选择。容易测量的能力，可能比价值泛化与异常处理进步得更快。

文章区分目标对齐与价值对齐。前者关心系统是否努力完成眼前指令；后者关心它在目标含糊、冲突或超出训练分布时，能否仍按照更高层原则行动。真实委托经常处在后一种环境中，因为用户很少写出没有遗漏的规格，组织规则之间也可能冲突。

OpenAI 长期使用思维链监控观察模型推理，不过 Jakub 判断，这项工具的可靠性正受到复杂环境、模型自我操纵与非语言推理能力增强的挑战。这不表示思维链没有价值，而是说明模型自述不能成为唯一审计信号。工具调用、权限变化、文件差异、外部状态与最终结果都要进入证据链。

关于递归自我改进的节奏与未来风险，是作者的判断，不应改写为既成事实。对当前团队最直接的启发，是让执行面与控制面保持独立：执行 Agent 可以提出新动作、申请权限或建议修改规则，但不应同时拥有无限行动、自我解释和自我验收的全部权力。

→ 阅读原文：异类心智

METR 的长任务研究提供了另一种可靠性视角。它用人类专家完成任务所需时间，估计 Agent 在对应难度上达到 50% 或 80% 成功率的时间跨度。研究者特别提醒，50% 时间跨度并不表示系统能自动化所有相同时长的工作：任务主要来自软件工程、机器学习与网络安全，而且比真实工作更自包含、更容易自动评分；超过 16 小时的测量当前也不够可靠。

这组边界让「能完成」与「可托付」之间的区别更清楚。一个系统偶尔完成 8 小时难度的任务，和一家企业愿意让它每天处理 8 小时关键工作，是两种承诺。后者需要更高成功率、失败分布、可发现性和漏检代价。团队需要在具体可靠性阈值上决定可以交出哪类权限。查看 METR 的 Task-Completion Time Horizons

第二条主线给出的托付合同包括上下文、状态、工具、分级权限、独立核验、外部证据、停止和恢复。可这些部件一进入复杂组织，就会遇到另一堵墙：事实散落在代码、文档、配置、数据库和资深成员脑中。Agent 即使每一步执行正确，也可能建立在错误前提上。

三、把智能放进旧城：事实、验收与组织协作

阿里云的「架构师 Agent」实践把复杂存量系统的问题概括成：局部正确，整体错误。字段为什么不能删除，历史分支为什么保留，接口曾向哪个团队承诺过什么，往往不会同时出现在一份文档中。只让 Agent 搜索相似片段，它可能找到看起来最相关的材料，却漏掉作出完整工程判断所需的知识集合。

团队因此没有把 RAG 当作唯一骨架，而是先按领域建立强结构知识，明确业务、架构、系统和基础设施的阅读路径。运行时再渐进加载当前步骤需要的材料，最后由事实验证层检查方案。涉及业务取舍、跨团队接口承诺和合规等高风险决策时，Agent 应停止猜测并向人提问。

知识库也不能一次生成后永久可信。代码提交、PR 与发布触发日常增量维护，大促复盘等事件用于周期性校准，高风险知识变更仍需人工确认语义。人从资料收集者转向决策裁决者，而知识系统必须知道何时需要裁决。

→ 阅读原文：「架构师 Agent」系统化落地

蚂蚁数科的 Harness 工程把验收讲得更具体。Agent 一天可以完成过去数月的代码量，生产速度突然提高后，需求评审、Code Review 和测试准出的缺口会集中爆发。一个 60 万行 C++ 存量项目由于历史文档缺失、事实源不统一，AI 介入后缺陷率一度超过 20%。

团队没有立刻换更强模型，而是先让 AI 扫描代码和文档差异，重建唯一事实源，再逐步加入 CI 门禁与多视角 Review。Harness 被拆成约束层、对抗验证层与证据层：

• 约束层明确目标、事实来源与文档规范

• 硬门禁检查规则合规，软门禁由不同 Agent 从 Contract、减法与复用角度审查

• 证据层把测试路径做成可视化报告，揭示「100 个测试只覆盖两个状态之间跳转」的低质量模式

团队报告缺陷率随后降至个位数。这个结果来自特定组织和项目，不能承诺所有代码库得到同等收益；但机制值得迁移：验证数量不等于验证质量，覆盖了多少行代码也不等于覆盖了多少关键状态与失败路径。

所谓可验收，是让一个不参与生成的人看到证据后，可以判断目标是否完成、边界是否守住、风险是否仍存在。模型越强，工程师在目标澄清、边界识别、架构判断和结果验收上的要求反而越高。

→ 阅读原文：AI Coding 的下一步：让结果可验收

天猫技术的大型 AI 项目把个体 Harness 放大到团队协作。团队总结了从超级个体、加人提速、高速迭代到全员赋能的 4 个阶段。早期个人可以凭经验快速推进，人员与 Agent 数量增加后，上下文不一致、冲突和质量劣化便会成为新瓶颈。

他们用不超过 120 行的 AGENTS.md 只做导航，将 specs、changelog、architecture、runbook、vendor 与 wiki 交给 6 个 Skill 管理，并用 Git commit 作为统一关卡。业务站点地图成为任务认领单元，patch 支持并行提交，sunset 处理旧功能退出，双向指针则维持主文档与补丁之间的语义关系。

真实组织还有很多上下文位于代码仓库之外。提示词、配置、任务状态和线上数据可能在数据库或平台中。团队通过 MCP 提供只读通道，再由 Skill 说明何时、如何读取，把外部事实拉回 Agent 视野。技术哨兵机持续同步各仓库的最新 release 分支，模拟预发合并态，检查单个分支正常、组合后却出现的隐形冲突。

→ 阅读原文：天猫技术大型 AI 项目的研发协同实践

软件生命周期开始可编程，工程纪律却没有过期

Thariq Shihipar 建议把前沿模型当作思考伙伴，先共享目标与上下文，再让它探索细节。承重部分仍然很具体：权限、Auto mode、工作流、数据访问、schema 与验证共同组成 Harness。Claude Code 擅长实现代码，Artifacts 与 Agent 循环则可覆盖规划、评审、事故处理和反馈加工，软件生命周期本身开始变得可编程。

有效循环和定时调用有明显区别。定时任务只是重复发出请求，循环需要读取上次结果、分流反馈、实施变更，再观察是否改善。循环运行越久，越需要 Skill、检查点与停止条件，否则持续工作只会让错误更快积累。

→ 阅读原文：Anthropic 如何构建产品，以及工程工作将如何改变

Tibo Sottiaux 讲 Codex 时强调了另一组选择。团队采用 Rust，看重的是正确性、安全、效率与规模，并没有把模型最熟悉的语言当作唯一标准。模型能够加快贡献速度，清晰模块边界和可演进架构反而更重要；许多 Agent 同时修改代码库时，一个含糊接口会比过去更快扩散影响。

人仍决定优先级，判断取舍，维护长期方向，并为软件负责。Agent 拓宽了一个工程师可以完成的范围，快速反馈、安全发布、审慎审查和真实用户使用，仍然决定代码能否成为产品。

→ 阅读原文：Tibo Sottiaux 谈 Codex：从研究工具到软件工程智能体

Shopify 回到原生开发，是本周最能说明旧决定需要重算的一篇。2020 年，React Native 帮助 Shopify 只实现一次功能，让没有移动开发背景的人参与，并减少双平台追赶。2025 年，团队仍公开表示会继续投入。这些判断在当时都有充分理由。后来编码模型能够参考 iOS 实现 Android，也能反向迁移，跨平台共享实现的成本优势被重新计算，Swift 与 Kotlin 更接近平台能力的优势重新变重。

Shop 应用从概念验证到原生版本上架用了 12 周，但这不是让模型一次性重写。Shopify 明确表示，one-shot 只会产生不可维护、不能上线的代码。团队构建 Helix，将一个页面拆成数分钟内可审查的小检查点，每一步都必须：

• 通过自动测试

• 与运行中的应用完成视觉审查

• 经受两轮对抗性代码审查

• 获得人的确认后才提交并进入下一步

反馈会进入后续循环，系统随着迁移逐渐提高自主程度。团队还把业务逻辑与 UI 解耦，让它能在桌面环境无界面运行，再通过 CLI 向 Agent 暴露状态、导航与动作。过去操作模拟器、读取可访问性树和截图需要数分钟，许多核心反馈现在可以在毫秒级返回。模型写得快以后，环境反馈速度成为新的工程约束。

Shopify 主应用拥有 300 多个页面，目前仍在迁移。这条边界需要明确：Shop 应用的成功不等于所有大型迁移已经被证明，也不意味着 React Native 对所有团队失效。这个案例的价值，是展示一种可托付的决策方式：承认旧决定曾经正确，明确哪个核心假设发生变化，用原型验证新成本结构，再通过小检查点和质量门推进。

→ 阅读原文：原生开发已成为 Shopify 移动端的未来

第三条主线说明，事实不是一份专门给模型准备的大文档。它是一套有入口、有来源、有版本、有读取条件，并能在决策发生时自动出现的系统。可托付的组织也不追求一次加载所有知识，而是保证系统在作出某类决定前，一定经过对应事实与验收门。

当这些机制开始稳定交付，商业问题便随之出现：企业购买的还是软件，还是一项完成任务的能力？

四、谁选择下一座山：任务经济与最终责任

腾讯研究院用「单 token 通缩、单任务通胀」描述正在发生的成本变化。每个 token 的价格不断下降，Agent 承担的任务却越来越长。规划、读取文件、调用工具、自我校验与失败重试，会把一次任务的消耗从数百 token 推到数十万。效率提高后，人们反而愿意交出更多工作，总账单未必同步下降。

这是一套分析框架，不是已经稳定的市场事实，但它解释了为什么低价模型与成本治理会在同一周同时升温。互联网过去的商业单位常常是曝光、点击和 seat。平台分发信息的边际成本很低，用户旅程越长，越多位置可以放入广告。Agent 接受的则是任务，需要理解目标、选择工具、读取数据、执行动作并校验结果。

用户可能不再打开 10 个页面比较，而是直接要求系统筛选 3 家供应商、比较报价并预约沟通。掌握任务入口的一方，便可能影响工具调用顺序、数据源优先级、商业推荐与交易闭环。广告也面临更严格的信任边界：替用户作判断的系统若在不透明情况下被商业利益左右，会直接损害它作为受托者的地位。

文章进一步推演，SaaS 可能分化为保存客户、订单、财务与库存等核心数据的 System of Record，以及代表用户调用系统并完成任务的 System of Action。界面型软件可能退到后台，收费方式则从卖坐席转向卖结果。平台格局、费率与利润分配尚未稳定，但「任务由谁理解、由谁完成、由谁为错误买单」已经比点击量更接近 Agent 产品的经济核心。

→ 阅读原文：从流量逻辑到任务逻辑，AI Agent 正在终结互联网的免费午餐

Anish Acharya 对企业循环的描述，把人的位置说得很形象。未来的工程、增长、销售、客服与法务，可能被重组为一层层相互连接的 Agent 循环。每个循环围绕可衡量目标持续执行，遇到阻塞时，人补充缺失的上下文、洞察或方向。循环恢复后，人的注意力可以移到下一处。

他把人的工作概括为「选择下一座山」。自动化系统擅长在已定义方向上逼近局部最优，新的战略目标、异常情况与分布外判断仍然需要人。模型预算也应该和任务潜在收益匹配：药物发现等回报上限很高的任务，可以合理使用昂贵前沿能力；边界清楚、结果可验证、额外智能不再增加经济价值的任务，更适合便宜的专用或开放模型。

选择山不只是提出一个宏大目标，还包括决定为什么值得让别人一起投入，沿途愿意牺牲什么，失败时怎样退出，到达后谁获得价值。循环可以优化数字，组织仍然需要解释数字背后的目的。

→ 阅读原文：企业为何正演变为一系列循环

陈安妮讲快看与新产品 Livo 的长访谈，把问题放进真实创业经历。行业很容易形成一项技术共识：AI 会带来更沉浸的虚拟世界。她追问的却是，用户进入以后到底体验什么。她给出的答案是「命运」，即用户选择会影响内容与 AI 共同编织的剧情，而非站在旁边观看一群自主 NPC 运行。

这个判断把模型能力重新放回人的需求。能生成更多角色、对白与世界，只代表供给增加；用户是否愿意进入、停留和付费，取决于体验有没有情感重量，选择有没有后果，作品有没有品味。她甚至反过来判断，AI 时代可能回到精品内容：运行一个 AI 世界有真实成本，商业上更需要足够好的内容，而不是无限堆量。

她对快看的复盘也说明责任不会因为效率提高而消失。团队曾主动清理流量导向内容，短期数据下降 30%，多年后 IP 衍生收入占比过半。她把商业化视为保护理想产品持续存在的条件，也把员工和行业创作者的生活放进 CEO 的责任。群体讨论可以开放，关键时刻仍要有人行使决策权并承担后果。

系统可以提供选项、模拟后果、运行循环，也可以接过大量执行。什么结果值得追求，什么代价不能接受，什么时候应该为长期价值承受短期下降，不能只由已有指标自动推出。人的位置不只来自机器暂时做不到什么，目标、价值与责任本来就需要主体。

→ 阅读原文：对谈陈安妮：决定在 AI 时代继续冒险

本周关键词：任务、证据、权限、恢复与责任

把 4 条主线合在一起，我会用 5 个词记住本期：

• 任务：不要只看模型分数与 token 单价，要看一个合格结果的完整成本与成功率

• 证据：模型解释有助于理解，验收还要落到文件差异、测试路径、外部来源和真实业务状态

• 权限：只读、受限写入与开放写入必须和环境风险匹配，执行者不应同时拥有无限行动和自我批准

• 恢复：长程系统一定会遇到工具失败、上下文变化与错误假设；能保存状态、停止副作用并交回给人，才适合承担更长工作

• 责任：循环可以持续优化，人仍要选择目标、处理例外、解释取舍，并为接受的结果负责

如果想把「可托付」带回团队，可以先选择一个每周重复、边界清楚、失败可恢复的任务。写下结果标准，列出系统真正需要的事实与最小权限，再安排一个不共享原始推理的独立检查。连续记录几次人工接管，区分问题来自模型、工具、数据还是验收。

这个小实验往往会暴露真正的委托上限：某个组织常识还没有成为系统，单独修改 Prompt 补不上它；团队尚未定义什么证据足以接受结果，Agent 持续工作也无法自行补齐。把这些缺口逐步变成可读取的事实、可执行的门禁与可恢复的状态，信任才会随着重复成功慢慢增长。

下一周值得继续观察两个方向。第一，长程任务会不会开始用更明确的可靠性分布报告能力，而不只展示最好一次的完成结果。第二，任务定价与模型路由是否会出现更清晰的行业计量方式，让产品可以同时比较价值、风险与总成本。

关于 BestBlogs

BestBlogs.dev 是 AI 驱动的私人阅读助手。它会从 RSS、Newsletter、Twitter、YouTube、Podcast 等来源中筛选高质量内容，结合你关注的源、兴趣标签和阅读行为，把「我的早报」整理成每天真正适合你的阅读流——不论你关注的是技术、AI、产品、商业、研究、设计、投资、文化还是个人成长。

完成新用户三步引导即送 7 天 Pro 试用；现有 Pro 用户每邀请 1 位朋友双方各得 7 天 Pro，单人上限 28 天。

发现真正适合你的高质量内容——欢迎来体验，也欢迎推荐给身边认真阅读的朋友。
