BestBlogs 早报:Parag Agrawal 谈智能体搜索与内容补偿,长程智能体需要实验

ginobefun · @hongming731 · X·2026-09-27 08:18·3小时前
AI 导读

前 Twitter CEO、Parallel 创始人 Parag Agrawal 提出为智能体建搜索基础设施,并按贡献为内容付费的"智能体版 AdSense"设想。Supercell 的 Erina Karati 主张用可重复场景与完整轨迹评测长程智能体,Roland Gavrilescu 则提出把工作、验证与反馈循环当作智能体产品本身。

ginobefun@hongming731
31AI 编辑部评分,满分 100

BestBlogs 早报:Parag Agrawal 谈智能体搜索与内容补偿,长程智能体需要实验

2026-09-27 08:18· 3小时前
AI 导读

前 Twitter CEO、Parallel 创始人 Parag Agrawal 提出为智能体建搜索基础设施,并按贡献为内容付费的"智能体版 AdSense"设想。Supercell 的 Erina Karati 主张用可重复场景与完整轨迹评测长程智能体,Roland Gavrilescu 则提出把工作、验证与反馈循环当作智能体产品本身。

https://x.com/i/article/2104001914140864512

BestBlogs 早报·09-27|前Twitter CEO 谈智能体搜索与内容补偿,长程智能体需要实验,智能体产品的改进循环

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

当智能体替人持续监测网页,它要在什么时刻搜索、怎样判断找到的信息值得付费,又怎样确认长期运行没有把传闻当成事实?这些问题分别落在信息入口、行为评测和产品反馈上。本期的三篇精讲沿着这一条实践路径展开,却来自三个不同的讲述场景:Parallel 创始人的访谈、Supercell 游戏智能体实验,以及智能体产品团队的方法分享。

第一篇帮助理解搜索为何要随调用模型、任务时限与内容供给改变;第二篇把一次漂亮的回复放回完整运行,检验角色究竟记住了什么;第三篇讨论真实产品如何从轨迹、评测和用户判断中形成可复用的改动。若你正在做智能体,可以按自己的瓶颈选择阅读顺序。后面的七条速览则把评测与反馈带到科学计算、飞行系统、数据库、模型优化和机器人部署等更具体的场景。

★ 精讲一:Parag Agrawal 谈智能体搜索、内容补偿与未来网络入口

来源:20VC with Harry Stebbings · BestBlogs 评分:90

前 Twitter CEO、Parallel 创始人 Parag Agrawal 在 20VC 访谈中,用一句面向产品的说法介绍公司:为智能体建立类似搜索引擎的基础设施。他预计,智能体调用网络的频率会远高于人类。这个预测尚待市场验证,但已经足以提出一个清楚的工程问题:如果每个智能体都照搬人的搜索流程,检索、抓取和模型推理的总成本能否承受?

人往往输入简短关键词,查看搜索结果,再自行打开网页。智能体可把任务写成完整请求,却未必需要十条链接;它可能需要可直接送入模型的文本、附有来源的证据,或供后续步骤使用的文件。任务时限也分化得更厉害:语音助手背后有人等待,后台研究任务则可能愿意多等一会儿,换取更完整的答案。Agrawal 说,Parallel 因而提供不同速度和深度的搜索模式,开发者可按应用选择,也可以让系统知道结果将交给哪一种模型处理。

这背后的取舍不是让搜索永远更快,而是协调搜索和模型各自花多少计算。检索系统先用便宜的筛选缩小网页范围,再对较小的一批候选投入更复杂的排序,最终只把最有用的信息交给模型。如果后续模型价格昂贵,多做一点检索可能减少模型读无关文字的费用;如果模型更便宜,另一套信息压缩方式可能更划算。应比较的是整个任务的质量、等待时间和总成本,而非单次搜索调用的标价。Agrawal 提到的计算成本优势属于 Parallel 自身估计,不能据此断言其他服务在所有任务上都会更贵。

搜索的另一半是内容从哪里来。靠广告支持的网站通常从人的访问中获得收入;智能体读取页面、提取内容后离开,可能不产生可见的广告回报。Agrawal 提出为内容所有者建立类似智能体版 AdSense 的补偿方式,按信息给任务带来的贡献支付。他举出一个用于思考定价的例子:如果少了某份数据,智能体必须多花推理资源才能达到类似质量,这份数据就创造了可以衡量的价值。这是他正在推进的商业方案,贡献如何测量、内容所有者如何议价、不同搜索服务如何共同遵守,访谈并没有给出现成答案。

这个问题尤其关系到独特数据。受访者用投资人结合商业数据库、个人笔记与公开信息的工作说明,按人头售卖数据的模式未必能直接覆盖代人工作的智能体。若内容提供者只能选择封锁,智能体可能失去关键材料;若使用方可以按贡献付费,双方才可能维持开放访问。内容补偿与检索效率其实是一笔账的两面:前者决定好信息能否进入系统,后者决定系统能否以合理成本使用它。不能因为现有广告格式不适合智能体,就推断广告业务已经消失。

Agrawal 还描述了一个从查询转向事件的入口。现在的后台智能体常按固定时间反复搜索,再比较有没有新结果。Parallel 的 Monitor API 尝试持续监测网页变化,先判断变化是否与用户关注的事件相关,必要时才调用更深入的分析。访谈中的示例是跟踪新登记公司,等符合条件的信息出现再通知用户。这样能避免为了确认「还没有变化」而反复做完整推理。节省幅度依赖事件频率与任务设计,不能直接套用到所有监测工作。

这篇访谈适合用来重画智能体搜索的评估表:一次结果是否有用只是第一格,还要看不同任务的时延、搜索与模型合计的计算量、内容所有者是否愿意持续提供材料,以及持续运行时能否从轮询转成有意义的事件响应。访谈者也谈到安全和社会信任,但与今天的主题最直接相关的,是开放网络能否同时满足访问者与提供者的激励。这个判断还需要产品运行和商业合作继续验证。

★ 精讲二:长时程智能体需要实验,而不只是提示词 — Erina Karati

来源:AI Engineer · BestBlogs 评分:90

一个游戏角色能记住刚才的对话、走到约定地点、拿起点心,这样的演示很容易让人相信它已经拥有稳定的社会行为。Erina Karati 在 AI Engineer 的分享把时间拉长:当一条消息经过几个人转述,又被后续事件打断,角色还能说清谁告诉了它什么、哪些只是猜测、应该怎样更新计划吗?她曾参与 Supercell AI Innovation Lab 的 Project Paradox,这套框架把自主角色放进能与玩家及彼此互动的游戏村庄。

村庄里的角色有各自的记忆空间,还会根据事件更新情绪、信任和对他人的看法。记忆被检索出来,影响下一次对话或行动;重要事件也会被优先保留。这些设计让短期互动看起来连贯,却不能保证长期一致性。Karati 举出芒果促销传闻:消息在角色之间传播后,回答者可能只剩模糊印象,记不起来源;转述过程还可能把「听说有促销」变成「确定有促销」。另一个常见失败是记住事实却没有在安排动作时使用它。

她提出把改进智能体的工作转成自动化实验。先设计可控场景,例如一位角色得知面包店即将关门,观察消息怎样传给其他人;或让一个角色听到某人可能离村,看不确定性会不会逐步消失;再或者让计划中的路线被堵住,检查角色是否重新规划并通知同伴。场景有起点、预期和可观察的过程,团队便能判断行为有没有真正改善,而不是凭一个剪辑后的片段作决定。

每次运行都会留下轨迹:角色看到了什么、与谁说话、写下什么记忆、取回什么材料、信任度怎样变化、最后做了什么。评测层可以读取完整轨迹与场景设定,对照角色的实际行动;角色本身仍只拥有局部视角。这个区分很关键:如果测试时偷偷给角色一份共享的全知记忆,原本要测的信息传播能力就被跳过了。评估单位从一句回复变成整段运行,可让传闻失真和行动脱节这类问题显现出来。

评分也不能只剩一个模糊的「智能体质量」。信息传播得快,是一个维度;知道消息的人能否记住来源,是另一个;传闻是否保留不确定性、角色有没有误报、能否及时重新规划、私人信息是否被不当传播,都需要分别看。只奖励传播,角色可能过度分享;只奖励记忆量,检索又会被噪声淹没。多维评分让团队看见一次优化在别处付出了什么代价。

Karati 建议冻结测试场景和评分方式,只让研究循环修改一小块策略,例如记忆写入格式、检索规则、沟通提示,或者触发重新规划的条件。若来源不断丢失,可以在记忆中保留讲述者;若传闻逐渐变成事实,可以记录信息是一手观察还是转述,以及确信程度。改动后重跑相同场景,只有整体评分改善、护栏仍成立时才保留,否则回滚。她报告,芒果促销案例在较长循环之后出现了更合适的回答;她没有把这次改善宣称为系统的普遍提升。

游戏村庄只是便于观察的实验场。客服智能体要处理政策的新旧版本,个人助手要记住用户更改过的承诺,研究智能体要保留假设和引用来源,编程智能体要在变动的需求之间维持上下文。它们并非共享同一套现成场景,但都面临状态随时间改变的问题。读者可以从这篇带走一套顺序:先描述具体失败,再设计可重复场景,记录足够完整的轨迹,用多维指标评估,最后只开放可回滚的有限改动。这样才能知道系统是在变好,还是只是换了一个更会表演的演示。

★ 精讲三:「循环才是产品」:Roland Gavrilescu 谈智能体产品如何持续进化

来源:AI Engineer · BestBlogs 评分:90

实验发现智能体会犯错,下一步是让这种发现改变产品。Roland Gavrilescu 在 AI Engineer 演讲中提出,把工作、验证与反馈的持续循环视为智能体产品本身。他与联合创始人曾在 xAI 从事智能体基础设施工作,演讲谈的是他们正在探索的产品方法,而非一个已在所有行业验证的结果。它与上一篇的共同点是重视完整运行;侧重点则从游戏角色行为,转向团队如何保存并迭代对「好工作」的判断。

他把执行任务的智能体视为内层循环。智能体调用工具、观察环境、提交结果,同时留下轨迹、文件和用户反馈。外层循环查看这些材料:反复出现的错误,可变成下一轮必须通过的评测;持续有效的做法,可写成可复用技能或提示词;用户的抱怨,可能要求修改工具、记忆或运行环境。这一步被他称作系统蒸馏。关键并非让模型凭空自我改进,而是将一次工作的经验整理为下一次能检验的改变。

为承载这些改变,他提出可版本化的智能体 recipe。它不只是一组提示词,还可记录所用模型、运行框架、工具、评测、资源以及人的判断标准。版本历史使团队能追问:这项改动从哪种失败出发,为什么被接受,换了模型或供应商以后是否仍然成立?他希望方案可由使用方掌握,避免产品经验只留在某家模型供应商或某次运行里。演讲介绍了早期 recipe 实现,但可移植程度与维护成本还需要在真实客户工作中检验。

招聘案例说明「人的判断」如何进入循环。假设一个人才搜寻智能体总是接触大型科技公司的员工,因为这些履历显眼;招聘方真正想找的,却是不易被常规名单发现的合适人选。团队先从执行轨迹里找出这个模式,再让评测判断候选人是否符合寻找隐藏人才的方向。人需要校准评测:这个偏好是否真是招聘方的选择,评测是否把偏好表达准确。人不一定亲手写完每条测试,但不能把取舍完全交给自动生成的指标。

通过离线评测还不够。产品团队要继续看用户是否认可新结果,必要时用线上实验比较不同方案。如果设计者觉得候选人更有意思,实际招聘者却不满意,产品仍然没有改对。只有离线判断与真实使用形成一致反馈,改动才有理由晋升为下一版 recipe。这个例子展示的是建议中的流程;演讲没有给出跨公司、跨岗位的受控数据,不能据此声称所有招聘任务都已受益。

最后,他提出衡量「每单位计算资源产生的有价值工作」。这句话包含两个不同问题:结果对客户是否有价值,完成同等价值需要花多少成本。一个演示可能很惊艳,却依赖过高的推理费用;另一个系统可能便宜,但结果不被用户信任。把质量、用户偏好和成本放在同一循环里,才更接近可持续产品的判断。这里没有现成的通用公式,不同垂直领域得先定义自己的有效工作,再建立可靠评测。

将这篇与 Karati 的实验放在一起,能看见反馈循环的两个层次:前者研究长时程角色能否保留来源、处理不确定性;这篇研究团队能否把失败与用户偏好变成可追溯的产品版本。两者都需要知道自己测量的究竟是什么。对于正在打造垂直智能体的团队,一个可操作的问题是:当用户说结果不好,你们能否从轨迹定位原因,提出有限改动,并在真实使用中证明新版本更受认可?

速览

Claude 计算出 N=4 超杨-米尔斯理论中的九圈振幅

来源:Anthropic Research · BestBlogs 评分:86

Anthropic Research 刊登的客座文章记录了一次理论物理挑战:Claude Science 采用已有的 bootstrap 与 form-factor 方法,计算出 N=4 超杨-米尔斯理论的九圈振幅。物理学家 Lance Dixon 独立核验了结果。文章聚焦的是人工智能能否在较少外部科学指导下完成复杂计算,而非宣称找到新的物理定律。

任务难在要把多步符号推导、计算策略和最终结果持续保持一致。这里计算的是 N=4 的玩具模型;文中提到的暗物质猜想用的是 N=1 超对称,不能混为现实物理的新结论。作者强调,方法本身没有突破原有计算极限;另一研究团队也在相近时间取得相关结果。把这个细节放回报道,能看清模型的贡献更像执行复杂研究工作的能力,而不是凭空创造无人知道的数学捷径。

它给研究工具一个较务实的评价方式:看模型完成了哪一段计算,哪些结果可被独立复核,研究者在任务定义与核验中扮演什么角色。这样既能认真对待成果,也能避免只凭一个惊人的数字判断科学研究已被替代。

一名操作员,多架无人机:深入 Skydio 自主飞行技术栈 — Suchet Bargoti,Skydio

来源:AI Engineer · BestBlogs 评分:87

Skydio 的技术分享展示一名操作员同时操作三架无人机。讲者把多机任务拆成若干需要协同的能力:视觉感知、目标跟踪、地图式世界模型、飞行决策,以及让人员能够介入的任务控制。演示的价值在于呈现多机操作所需的系统组合。

其中一个困难是遮挡。目标暂时离开摄像头视野,系统仍要利用已有状态推测位置,并在重新出现时恢复跟踪。飞行数据回流又让团队持续分析失败场景;边缘计算负责现场响应,云端能力提供更复杂的理解和协作。所谓自主,并不等于操作员从任务中完全消失。

判断这类系统是否可靠,应继续看它怎样处理目标丢失、环境变化和人工接管,而不只看同框飞行的画面。把能力按感知、决策、协作和恢复拆开,也能帮助读者理解无人机从演示走向日常部署的工程门槛。

Perplexity 自研 CobbleDB 取代 DynamoDB,查询延迟降低 5 倍并削减云存储成本

来源:InfoQ · BestBlogs 评分:85

Perplexity 将核心搜索服务中的 DynamoDB 替换为自己用 Rust 编写的分布式键值存储 CobbleDB。根据其工程数据,批量读取延迟约降至原来的五分之一,整体存储费用至少减少百分之二十。这是特定访问模式与负载下的工程收益,不是所有应用迁移数据库的通用预测。

搜索请求对读取延迟、吞吐和成本都敏感。托管数据库减少日常运维负担,却未必总能精准匹配规模化后的访问路径。Perplexity 的选择表明,当查询形态相对稳定、资源消耗已经足够大时,团队可以重新比较通用服务的便利与自建系统的长期维护成本。

这篇适合与智能体搜索的成本讨论对照:用户只看到一次回答,后台却有检索、存储、模型推理多笔费用。真正有参考价值的做法是先量出自己的瓶颈和负载,再决定是否值得承担专用基础设施的复杂度。

用反思击败强化学习:GEPA 与 Optimize Anything

来源:AI Engineer · BestBlogs 评分:89

AI Engineer 的分享介绍 GEPA 和 Optimize Anything,讨论如何把执行轨迹中的文字反馈用于改进提示词、智能体运行框架,以及其他有可评分结果的产物。讲者强调,相比只给一个最终奖励,具体的文字反馈能指出失败发生在哪一步、下一轮可能改什么。

这类方法的关键不只是让模型「自我反思」,而是反馈必须绑定可观察的运行过程和能检验的目标。若评测只给出模糊好坏,优化会失去方向;若指标过窄,系统又可能学会讨好评分。来源提出较高的样例效率,但实际收益仍与任务、反馈质量和评测设置有关。

它为前面的实验循环补上一块具体工具:设计好的场景能揭示失败,文字反馈帮助定位可修改的策略,下一次运行再检验是否真的改善。读者可据此检查自己的评测是否只会打分,还是也能解释分数从何而来。

自动化研究如何让模型提速 3 倍:Morph 的 GPU 优化实践|Tejas Bhakta

来源:AI Engineer · BestBlogs 评分:88

Morph 的工程分享将自动化研究用于 GPU 计算内核优化。讲者先由人确定优化方向,补足目标硬件和模型的具体背景,再让智能体搜索不同实现。演讲者报告,成功的内核实现与裸机优化叠加后,在所述实践中带来三倍提速。

速度数字背后有一套必要的验证:基准测试既要确认结果正确,也要测出性能;目标设计过窄,智能体可能只针对指标投机,而没有改善真实任务。硬件条件、输入形态与模型结构都会影响结论。因此,这里的提速应理解为该任务条件下的报告结果。

可复用的方法是把人擅长的方向选择和系统背景交给人,把受控的实现搜索交给智能体,并让可靠基准决定是否保留改动。它与长时程智能体的实验分享一样,说明循环的质量取决于评测能否约束真实目标。

机器人演示容易,可靠落地很难——Dyna Robotics 如何训练商用级通用机器人策略

来源:AI Engineer · BestBlogs 评分:86

Dyna Robotics 联合创始人介绍机器人策略训练中的数据金字塔、推理模型、世界动作模型,以及结合奖励模型与人工参与的主动学习。其微调后的 Dyna-1 在餐巾折叠的二十四小时试验中达到百分之九十九点四成功率;这个数字属于特定任务和试验条件。

分享还分别谈到餐厅部署、经任务微调的洗衣店毛巾折叠、陌生环境演示和活动现场应用。这些场景对物体形态、操作节奏和失败恢复的要求不同,不能把一个任务的成功率直接推广成所有工作的可靠性。数据选择和人类反馈也会影响机器人学到哪些动作。

读者可把演示与部署分开评价:先问系统在哪个任务、持续多久、面对哪些变化,再问出错以后如何处理。这样看,机器人进步并不只体现为一次流畅动作,也体现为在真实场景里反复完成有价值的工作。

为 Agent 而生,千问 AI 平台发布全新服务方式

来源:阿里云开发者 · BestBlogs 评分:85

千问 AI 平台在云栖大会介绍面向 Agent 的新服务方式,包含 Qwen 共创计划、AI Arena、Skills、命令行工具,以及与支付宝合作的安全支付机制。平台希望让云服务更容易被 Agent 理解、调用和管理,同时从真实任务收集改进反馈。

共创计划与 AI Arena 分别从模型能力和完整任务表现出发,让行业经验进入模型与系统改进。工具和命令行入口则服务于开发与调用;支付机制回应 Agent 执行交易时的授权问题。它们分别解决能力、反馈、工具使用和安全支付,不能只用一个「更智能」的标签概括。

后续可观察这些部件是否形成清楚的工作流:谁授权 Agent、它能调用哪些服务、支付如何受控、结果怎样核验。对开发者而言,平台发布的新入口有价值,但真正的体验仍取决于这些环节能否在实际任务里顺畅接起来。

今日小结

回顾今天的内容,Parallel 创始人把搜索成本、内容补偿和持续监测放在一张账上;Supercell 的村庄实验让长期记忆、来源与不确定性成为可测行为;Roland Gavrilescu 则讨论怎样把运行反馈沉淀为可追溯的产品方案。七条速览提示我们,相似的评测与反馈问题也会出现在科学计算、基础设施和物理世界的应用中。

如果只留几分钟,做搜索或数据产品可以先读第一篇;负责智能体评测,可以从第二篇的场景和多维评分入手;正在迭代垂直产品,可以看第三篇如何把人类判断与用户反馈接起来。对成本、科研和机器人更感兴趣的读者,再从速览进入具体案例。

欢迎分享你正在解决的一个具体问题:长期运行的智能体最容易在哪一步丢失可信信息?当评测显示进步,而实际用户并不满意时,你会优先修改测试、产品规则,还是任务定义?这些问题会影响智能体能否从一次好演示,走向稳定可用的服务。

👉 近期早报

• BestBlogs 早报 · 09-26

• BestBlogs 早报 · 09-25

• BestBlogs 早报 · 09-24

• BestBlogs.dev 第 114 期:过剩与短板

• BestBlogs.dev 第 113 期:模型之外的尺子

• BestBlogs.dev 第 112 期:可托付的智能

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

来源:ginobefun· x.com