# BestBlogs 早报：Parag Agrawal 谈智能体搜索与内容补偿，长程智能体需要实验

- 来源：ginobefun (@hongming731)
- 发布时间：2026-09-27 08:18
- AIHOT 分数：31
- AIHOT 链接：https://aihot.news/items/cmuj3d0v30j98rohy05na89dm
- 原文链接：https://x.com/hongming731/status/2104002680675065907

## AI 摘要

前 Twitter CEO、Parallel 创始人 Parag Agrawal 提出为智能体建搜索基础设施，并按贡献为内容付费的"智能体版 AdSense"设想。Supercell 的 Erina Karati 主张用可重复场景与完整轨迹评测长程智能体，Roland Gavrilescu 则提出把工作、验证与反馈循环当作智能体产品本身。

## 正文

https://x.com/i/article/2104001914140864512

BestBlogs 早报·09-27｜前Twitter CEO 谈智能体搜索与内容补偿，长程智能体需要实验，智能体产品的改进循环

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容，如果你希望它基于你的兴趣和阅读习惯整理，可以体验「我的早报」。

导语

当智能体替人持续监测网页，它要在什么时刻搜索、怎样判断找到的信息值得付费，又怎样确认长期运行没有把传闻当成事实？这些问题分别落在信息入口、行为评测和产品反馈上。本期的三篇精讲沿着这一条实践路径展开，却来自三个不同的讲述场景：Parallel 创始人的访谈、Supercell 游戏智能体实验，以及智能体产品团队的方法分享。

第一篇帮助理解搜索为何要随调用模型、任务时限与内容供给改变；第二篇把一次漂亮的回复放回完整运行，检验角色究竟记住了什么；第三篇讨论真实产品如何从轨迹、评测和用户判断中形成可复用的改动。若你正在做智能体，可以按自己的瓶颈选择阅读顺序。后面的七条速览则把评测与反馈带到科学计算、飞行系统、数据库、模型优化和机器人部署等更具体的场景。

★ 精讲一：Parag Agrawal 谈智能体搜索、内容补偿与未来网络入口

来源：20VC with Harry Stebbings · BestBlogs 评分：90

前 Twitter CEO、Parallel 创始人 Parag Agrawal 在 20VC 访谈中，用一句面向产品的说法介绍公司：为智能体建立类似搜索引擎的基础设施。他预计，智能体调用网络的频率会远高于人类。这个预测尚待市场验证，但已经足以提出一个清楚的工程问题：如果每个智能体都照搬人的搜索流程，检索、抓取和模型推理的总成本能否承受？

人往往输入简短关键词，查看搜索结果，再自行打开网页。智能体可把任务写成完整请求，却未必需要十条链接；它可能需要可直接送入模型的文本、附有来源的证据，或供后续步骤使用的文件。任务时限也分化得更厉害：语音助手背后有人等待，后台研究任务则可能愿意多等一会儿，换取更完整的答案。Agrawal 说，Parallel 因而提供不同速度和深度的搜索模式，开发者可按应用选择，也可以让系统知道结果将交给哪一种模型处理。

这背后的取舍不是让搜索永远更快，而是协调搜索和模型各自花多少计算。检索系统先用便宜的筛选缩小网页范围，再对较小的一批候选投入更复杂的排序，最终只把最有用的信息交给模型。如果后续模型价格昂贵，多做一点检索可能减少模型读无关文字的费用；如果模型更便宜，另一套信息压缩方式可能更划算。应比较的是整个任务的质量、等待时间和总成本，而非单次搜索调用的标价。Agrawal 提到的计算成本优势属于 Parallel 自身估计，不能据此断言其他服务在所有任务上都会更贵。

搜索的另一半是内容从哪里来。靠广告支持的网站通常从人的访问中获得收入；智能体读取页面、提取内容后离开，可能不产生可见的广告回报。Agrawal 提出为内容所有者建立类似智能体版 AdSense 的补偿方式，按信息给任务带来的贡献支付。他举出一个用于思考定价的例子：如果少了某份数据，智能体必须多花推理资源才能达到类似质量，这份数据就创造了可以衡量的价值。这是他正在推进的商业方案，贡献如何测量、内容所有者如何议价、不同搜索服务如何共同遵守，访谈并没有给出现成答案。

这个问题尤其关系到独特数据。受访者用投资人结合商业数据库、个人笔记与公开信息的工作说明，按人头售卖数据的模式未必能直接覆盖代人工作的智能体。若内容提供者只能选择封锁，智能体可能失去关键材料；若使用方可以按贡献付费，双方才可能维持开放访问。内容补偿与检索效率其实是一笔账的两面：前者决定好信息能否进入系统，后者决定系统能否以合理成本使用它。不能因为现有广告格式不适合智能体，就推断广告业务已经消失。

Agrawal 还描述了一个从查询转向事件的入口。现在的后台智能体常按固定时间反复搜索，再比较有没有新结果。Parallel 的 Monitor API 尝试持续监测网页变化，先判断变化是否与用户关注的事件相关，必要时才调用更深入的分析。访谈中的示例是跟踪新登记公司，等符合条件的信息出现再通知用户。这样能避免为了确认「还没有变化」而反复做完整推理。节省幅度依赖事件频率与任务设计，不能直接套用到所有监测工作。

这篇访谈适合用来重画智能体搜索的评估表：一次结果是否有用只是第一格，还要看不同任务的时延、搜索与模型合计的计算量、内容所有者是否愿意持续提供材料，以及持续运行时能否从轮询转成有意义的事件响应。访谈者也谈到安全和社会信任，但与今天的主题最直接相关的，是开放网络能否同时满足访问者与提供者的激励。这个判断还需要产品运行和商业合作继续验证。

★ 精讲二：长时程智能体需要实验，而不只是提示词 — Erina Karati

来源：AI Engineer · BestBlogs 评分：90

一个游戏角色能记住刚才的对话、走到约定地点、拿起点心，这样的演示很容易让人相信它已经拥有稳定的社会行为。Erina Karati 在 AI Engineer 的分享把时间拉长：当一条消息经过几个人转述，又被后续事件打断，角色还能说清谁告诉了它什么、哪些只是猜测、应该怎样更新计划吗？她曾参与 Supercell AI Innovation Lab 的 Project Paradox，这套框架把自主角色放进能与玩家及彼此互动的游戏村庄。

村庄里的角色有各自的记忆空间，还会根据事件更新情绪、信任和对他人的看法。记忆被检索出来，影响下一次对话或行动；重要事件也会被优先保留。这些设计让短期互动看起来连贯，却不能保证长期一致性。Karati 举出芒果促销传闻：消息在角色之间传播后，回答者可能只剩模糊印象，记不起来源；转述过程还可能把「听说有促销」变成「确定有促销」。另一个常见失败是记住事实却没有在安排动作时使用它。

她提出把改进智能体的工作转成自动化实验。先设计可控场景，例如一位角色得知面包店即将关门，观察消息怎样传给其他人；或让一个角色听到某人可能离村，看不确定性会不会逐步消失；再或者让计划中的路线被堵住，检查角色是否重新规划并通知同伴。场景有起点、预期和可观察的过程，团队便能判断行为有没有真正改善，而不是凭一个剪辑后的片段作决定。

每次运行都会留下轨迹：角色看到了什么、与谁说话、写下什么记忆、取回什么材料、信任度怎样变化、最后做了什么。评测层可以读取完整轨迹与场景设定，对照角色的实际行动；角色本身仍只拥有局部视角。这个区分很关键：如果测试时偷偷给角色一份共享的全知记忆，原本要测的信息传播能力就被跳过了。评估单位从一句回复变成整段运行，可让传闻失真和行动脱节这类问题显现出来。

评分也不能只剩一个模糊的「智能体质量」。信息传播得快，是一个维度；知道消息的人能否记住来源，是另一个；传闻是否保留不确定性、角色有没有误报、能否及时重新规划、私人信息是否被不当传播，都需要分别看。只奖励传播，角色可能过度分享；只奖励记忆量，检索又会被噪声淹没。多维评分让团队看见一次优化在别处付出了什么代价。

Karati 建议冻结测试场景和评分方式，只让研究循环修改一小块策略，例如记忆写入格式、检索规则、沟通提示，或者触发重新规划的条件。若来源不断丢失，可以在记忆中保留讲述者；若传闻逐渐变成事实，可以记录信息是一手观察还是转述，以及确信程度。改动后重跑相同场景，只有整体评分改善、护栏仍成立时才保留，否则回滚。她报告，芒果促销案例在较长循环之后出现了更合适的回答；她没有把这次改善宣称为系统的普遍提升。

游戏村庄只是便于观察的实验场。客服智能体要处理政策的新旧版本，个人助手要记住用户更改过的承诺，研究智能体要保留假设和引用来源，编程智能体要在变动的需求之间维持上下文。它们并非共享同一套现成场景，但都面临状态随时间改变的问题。读者可以从这篇带走一套顺序：先描述具体失败，再设计可重复场景，记录足够完整的轨迹，用多维指标评估，最后只开放可回滚的有限改动。这样才能知道系统是在变好，还是只是换了一个更会表演的演示。

★ 精讲三：「循环才是产品」：Roland Gavrilescu 谈智能体产品如何持续进化

来源：AI Engineer · BestBlogs 评分：90

实验发现智能体会犯错，下一步是让这种发现改变产品。Roland Gavrilescu 在 AI Engineer 演讲中提出，把工作、验证与反馈的持续循环视为智能体产品本身。他与联合创始人曾在 xAI 从事智能体基础设施工作，演讲谈的是他们正在探索的产品方法，而非一个已在所有行业验证的结果。它与上一篇的共同点是重视完整运行；侧重点则从游戏角色行为，转向团队如何保存并迭代对「好工作」的判断。

他把执行任务的智能体视为内层循环。智能体调用工具、观察环境、提交结果，同时留下轨迹、文件和用户反馈。外层循环查看这些材料：反复出现的错误，可变成下一轮必须通过的评测；持续有效的做法，可写成可复用技能或提示词；用户的抱怨，可能要求修改工具、记忆或运行环境。这一步被他称作系统蒸馏。关键并非让模型凭空自我改进，而是将一次工作的经验整理为下一次能检验的改变。

为承载这些改变，他提出可版本化的智能体 recipe。它不只是一组提示词，还可记录所用模型、运行框架、工具、评测、资源以及人的判断标准。版本历史使团队能追问：这项改动从哪种失败出发，为什么被接受，换了模型或供应商以后是否仍然成立？他希望方案可由使用方掌握，避免产品经验只留在某家模型供应商或某次运行里。演讲介绍了早期 recipe 实现，但可移植程度与维护成本还需要在真实客户工作中检验。

招聘案例说明「人的判断」如何进入循环。假设一个人才搜寻智能体总是接触大型科技公司的员工，因为这些履历显眼；招聘方真正想找的，却是不易被常规名单发现的合适人选。团队先从执行轨迹里找出这个模式，再让评测判断候选人是否符合寻找隐藏人才的方向。人需要校准评测：这个偏好是否真是招聘方的选择，评测是否把偏好表达准确。人不一定亲手写完每条测试，但不能把取舍完全交给自动生成的指标。

通过离线评测还不够。产品团队要继续看用户是否认可新结果，必要时用线上实验比较不同方案。如果设计者觉得候选人更有意思，实际招聘者却不满意，产品仍然没有改对。只有离线判断与真实使用形成一致反馈，改动才有理由晋升为下一版 recipe。这个例子展示的是建议中的流程；演讲没有给出跨公司、跨岗位的受控数据，不能据此声称所有招聘任务都已受益。

最后，他提出衡量「每单位计算资源产生的有价值工作」。这句话包含两个不同问题：结果对客户是否有价值，完成同等价值需要花多少成本。一个演示可能很惊艳，却依赖过高的推理费用；另一个系统可能便宜，但结果不被用户信任。把质量、用户偏好和成本放在同一循环里，才更接近可持续产品的判断。这里没有现成的通用公式，不同垂直领域得先定义自己的有效工作，再建立可靠评测。

将这篇与 Karati 的实验放在一起，能看见反馈循环的两个层次：前者研究长时程角色能否保留来源、处理不确定性；这篇研究团队能否把失败与用户偏好变成可追溯的产品版本。两者都需要知道自己测量的究竟是什么。对于正在打造垂直智能体的团队，一个可操作的问题是：当用户说结果不好，你们能否从轨迹定位原因，提出有限改动，并在真实使用中证明新版本更受认可？

速览

Claude 计算出 N=4 超杨-米尔斯理论中的九圈振幅

来源：Anthropic Research · BestBlogs 评分：86

Anthropic Research 刊登的客座文章记录了一次理论物理挑战：Claude Science 采用已有的 bootstrap 与 form-factor 方法，计算出 N=4 超杨-米尔斯理论的九圈振幅。物理学家 Lance Dixon 独立核验了结果。文章聚焦的是人工智能能否在较少外部科学指导下完成复杂计算，而非宣称找到新的物理定律。

任务难在要把多步符号推导、计算策略和最终结果持续保持一致。这里计算的是 N=4 的玩具模型；文中提到的暗物质猜想用的是 N=1 超对称，不能混为现实物理的新结论。作者强调，方法本身没有突破原有计算极限；另一研究团队也在相近时间取得相关结果。把这个细节放回报道，能看清模型的贡献更像执行复杂研究工作的能力，而不是凭空创造无人知道的数学捷径。

它给研究工具一个较务实的评价方式：看模型完成了哪一段计算，哪些结果可被独立复核，研究者在任务定义与核验中扮演什么角色。这样既能认真对待成果，也能避免只凭一个惊人的数字判断科学研究已被替代。

一名操作员，多架无人机：深入 Skydio 自主飞行技术栈 — Suchet Bargoti，Skydio

来源：AI Engineer · BestBlogs 评分：87

Skydio 的技术分享展示一名操作员同时操作三架无人机。讲者把多机任务拆成若干需要协同的能力：视觉感知、目标跟踪、地图式世界模型、飞行决策，以及让人员能够介入的任务控制。演示的价值在于呈现多机操作所需的系统组合。

其中一个困难是遮挡。目标暂时离开摄像头视野，系统仍要利用已有状态推测位置，并在重新出现时恢复跟踪。飞行数据回流又让团队持续分析失败场景；边缘计算负责现场响应，云端能力提供更复杂的理解和协作。所谓自主，并不等于操作员从任务中完全消失。

判断这类系统是否可靠，应继续看它怎样处理目标丢失、环境变化和人工接管，而不只看同框飞行的画面。把能力按感知、决策、协作和恢复拆开，也能帮助读者理解无人机从演示走向日常部署的工程门槛。

Perplexity 自研 CobbleDB 取代 DynamoDB，查询延迟降低 5 倍并削减云存储成本

来源：InfoQ · BestBlogs 评分：85

Perplexity 将核心搜索服务中的 DynamoDB 替换为自己用 Rust 编写的分布式键值存储 CobbleDB。根据其工程数据，批量读取延迟约降至原来的五分之一，整体存储费用至少减少百分之二十。这是特定访问模式与负载下的工程收益，不是所有应用迁移数据库的通用预测。

搜索请求对读取延迟、吞吐和成本都敏感。托管数据库减少日常运维负担，却未必总能精准匹配规模化后的访问路径。Perplexity 的选择表明，当查询形态相对稳定、资源消耗已经足够大时，团队可以重新比较通用服务的便利与自建系统的长期维护成本。

这篇适合与智能体搜索的成本讨论对照：用户只看到一次回答，后台却有检索、存储、模型推理多笔费用。真正有参考价值的做法是先量出自己的瓶颈和负载，再决定是否值得承担专用基础设施的复杂度。

用反思击败强化学习：GEPA 与 Optimize Anything

来源：AI Engineer · BestBlogs 评分：89

AI Engineer 的分享介绍 GEPA 和 Optimize Anything，讨论如何把执行轨迹中的文字反馈用于改进提示词、智能体运行框架，以及其他有可评分结果的产物。讲者强调，相比只给一个最终奖励，具体的文字反馈能指出失败发生在哪一步、下一轮可能改什么。

这类方法的关键不只是让模型「自我反思」，而是反馈必须绑定可观察的运行过程和能检验的目标。若评测只给出模糊好坏，优化会失去方向；若指标过窄，系统又可能学会讨好评分。来源提出较高的样例效率，但实际收益仍与任务、反馈质量和评测设置有关。

它为前面的实验循环补上一块具体工具：设计好的场景能揭示失败，文字反馈帮助定位可修改的策略，下一次运行再检验是否真的改善。读者可据此检查自己的评测是否只会打分，还是也能解释分数从何而来。

自动化研究如何让模型提速 3 倍：Morph 的 GPU 优化实践｜Tejas Bhakta

来源：AI Engineer · BestBlogs 评分：88

Morph 的工程分享将自动化研究用于 GPU 计算内核优化。讲者先由人确定优化方向，补足目标硬件和模型的具体背景，再让智能体搜索不同实现。演讲者报告，成功的内核实现与裸机优化叠加后，在所述实践中带来三倍提速。

速度数字背后有一套必要的验证：基准测试既要确认结果正确，也要测出性能；目标设计过窄，智能体可能只针对指标投机，而没有改善真实任务。硬件条件、输入形态与模型结构都会影响结论。因此，这里的提速应理解为该任务条件下的报告结果。

可复用的方法是把人擅长的方向选择和系统背景交给人，把受控的实现搜索交给智能体，并让可靠基准决定是否保留改动。它与长时程智能体的实验分享一样，说明循环的质量取决于评测能否约束真实目标。

机器人演示容易，可靠落地很难——Dyna Robotics 如何训练商用级通用机器人策略

来源：AI Engineer · BestBlogs 评分：86

Dyna Robotics 联合创始人介绍机器人策略训练中的数据金字塔、推理模型、世界动作模型，以及结合奖励模型与人工参与的主动学习。其微调后的 Dyna-1 在餐巾折叠的二十四小时试验中达到百分之九十九点四成功率；这个数字属于特定任务和试验条件。

分享还分别谈到餐厅部署、经任务微调的洗衣店毛巾折叠、陌生环境演示和活动现场应用。这些场景对物体形态、操作节奏和失败恢复的要求不同，不能把一个任务的成功率直接推广成所有工作的可靠性。数据选择和人类反馈也会影响机器人学到哪些动作。

读者可把演示与部署分开评价：先问系统在哪个任务、持续多久、面对哪些变化，再问出错以后如何处理。这样看，机器人进步并不只体现为一次流畅动作，也体现为在真实场景里反复完成有价值的工作。

为 Agent 而生，千问 AI 平台发布全新服务方式

来源：阿里云开发者 · BestBlogs 评分：85

千问 AI 平台在云栖大会介绍面向 Agent 的新服务方式，包含 Qwen 共创计划、AI Arena、Skills、命令行工具，以及与支付宝合作的安全支付机制。平台希望让云服务更容易被 Agent 理解、调用和管理，同时从真实任务收集改进反馈。

共创计划与 AI Arena 分别从模型能力和完整任务表现出发，让行业经验进入模型与系统改进。工具和命令行入口则服务于开发与调用；支付机制回应 Agent 执行交易时的授权问题。它们分别解决能力、反馈、工具使用和安全支付，不能只用一个「更智能」的标签概括。

后续可观察这些部件是否形成清楚的工作流：谁授权 Agent、它能调用哪些服务、支付如何受控、结果怎样核验。对开发者而言，平台发布的新入口有价值，但真正的体验仍取决于这些环节能否在实际任务里顺畅接起来。

今日小结

回顾今天的内容，Parallel 创始人把搜索成本、内容补偿和持续监测放在一张账上；Supercell 的村庄实验让长期记忆、来源与不确定性成为可测行为；Roland Gavrilescu 则讨论怎样把运行反馈沉淀为可追溯的产品方案。七条速览提示我们，相似的评测与反馈问题也会出现在科学计算、基础设施和物理世界的应用中。

如果只留几分钟，做搜索或数据产品可以先读第一篇；负责智能体评测，可以从第二篇的场景和多维评分入手；正在迭代垂直产品，可以看第三篇如何把人类判断与用户反馈接起来。对成本、科研和机器人更感兴趣的读者，再从速览进入具体案例。

欢迎分享你正在解决的一个具体问题：长期运行的智能体最容易在哪一步丢失可信信息？当评测显示进步，而实际用户并不满意时，你会优先修改测试、产品规则，还是任务定义？这些问题会影响智能体能否从一次好演示，走向稳定可用的服务。

👉 近期早报

• BestBlogs 早报 · 09-26

• BestBlogs 早报 · 09-25

• BestBlogs 早报 · 09-24

• BestBlogs.dev 第 114 期：过剩与短板

• BestBlogs.dev 第 113 期：模型之外的尺子

• BestBlogs.dev 第 112 期：可托付的智能

BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
