https://x.com/i/article/2103650028904759296
BestBlogs 早报 · 09-26|Stripe CEO 谈 Claude Code一线实践,OpenRouter 联创复盘,Claire Vo 谈产品信念
在线阅读本期早报
BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。
导语
Stripe 的一位工程师在上半年合并了 600 多个全部由 AI 编写的代码提交,只有一个被回滚;与此同时,公司核心支付 API 的可用性保持在 5.5 个 9。这组来自 Stripe CEO Patrick Collison 的一手数据,直接回答了行业里悬了很久的问题:AI 编码的提速,是否必然以质量为代价。他的答案藏在不变量与硬屏障式的护栏里,而不只是模型能力本身。
第二条精讲与它有真实衔接。刚被 Stripe 收购的 OpenRouter,联合创始人与早期投资人在长访谈中复盘了这家曾被投资人贬为 API 套壳的公司,如何长成服务超过 1000 万开发者的模型路由层;而并购的一个关键考量,是上月拦截的 token 欺诈金额达到前月的 10 倍。第三条转向产品视角:ChatPRD 创始人 Claire Vo 说,执行已经过剩,稀缺的是信念,她建议产品人写下最后一份路线图。三篇各自独立成立,前两篇共同拼出 Stripe 眼中的智能体经济版图。
随后的七条速览里,还有三场分享来自同一场产品峰会:Marty Cagan 明确反对路线图消失论,Ramp CPO 把瓶颈治理做成 F1 式工厂,观点彼此交锋,适合对照着读。此外还有 Anthropic 的智能体换书实验、Meta 与 DoorDash 的推荐系统实践,以及一家用 AI 收购并重塑在位企业的控股公司。
★ 精讲一:Patrick Collison 谈 Stripe 用 Claude Code 加速交付并守住可靠性
来源:Claude · BestBlogs 评分:91
这场对话发布在 Claude 官方频道,嘉宾是 Stripe CEO Patrick Collison。他给出的第一组数字回应了最常见的担心:代码写得快了,审查会不会跟不上。一位工程师在上半年合并了超过 600 个代码提交,每一个都由 AI 编写,最终只有一个被回滚;同期单个提交的质量在过去 18 个月持续上升,单位时间的事故数略有增加,但大多轻微,整体可靠性基本没有变化。加速开发与经验上的高可靠,这两个目标在他口中可以同时成立。
背景是 Stripe 对部署节奏的执念。金融行业的系统往往一个月甚至一个季度才发布一次,Stripe 的核心支付 API 却坚持持续部署,可用性保持在 5.5 个 9,团队希望每天从客户那里拿到多次反馈。Collison 认为,少发布带来的局部稳定有两笔隐性成本:反馈变慢,以及迁移因为积压数月进度而变得危险。
提速而不出事,靠的是确定性机制。Collison 说,Stripe 依靠不变量和硬屏障做保证,避开主观、酌情或概率性的判断;模型更对齐当然好,但没有任何系统完美,值得押注的只有保证。围绕数据的标签和语义感知护栏,Stripe 从 2017 年就开始建设,把权限做到细粒度标注。当年是为了安全底线,如今恰好让智能体开发在合规边界内高速运转。
产出也有具体例子。Stripe Projects 从想法到公开发布,用了两到三位工程师、大约两个月,期间对接了约 50 个外部服务。他问过参与的工程师,放到从前需要更大的团队和六个月;按团队翻倍、时间三倍估算,至少是六倍提速。他同时坦承,工程师的估算向来乐观,各项目提速分布不均匀,就算全公司平均只有两倍,也已经非常可观。这组数字是 CEO 转述的内部估算,读的时候记住口径即可,不必当成普适基准。
内部工作方式也在变。每个开发环境预装了 Claude Code,它成了工程师完成任务的第一站;公司还有一套叫 Minions 的编排系统,从聊天工具接收需求,自动开虚拟机、写代码、打包提交并跑完整测试。有工程师先用最强模型做一份复杂计划,再派 10 个环境并行执行不同部分,一跑就是一整天。Collison 承认,这种规划式的用法此前被他低估。
往远处看,他还有两个观察:平台上新企业的创建速度大约翻倍,是公司成立 15 年来相对幅度最大的一次加速;Stripe 内部的判断是,三年内大多数交易将发生在智能体与智能体之间。对做支付和做智能体的团队,这两句话都值得记下来。担心 AI 编码拖垮质量的读者,这篇访谈给出了一份支付级生产线上的对照样本:提速的确定性来自护栏,而不是来自模型自觉。
★ 精讲二:OpenRouter 联创谈从种子轮到并入 Stripe:模型路由的下一站
来源:Latent.Space · BestBlogs 评分:91
这是 Latent.Space 发布的长访谈,两位嘉宾是 OpenRouter 联合创始人 Alex Atallah 和它的早期投资人、AMP 的 Anjney Midha,此时公司刚刚并入 Stripe。故事开头并不光鲜:不少投资人当年把 OpenRouter 称为 API 套壳,认为在别人的模型接口上包一层路由没有价值。Midha 回忆,他偏偏看好这层路由里的工程与社区设计;在他投资一个月后,就有机构把估值上调了 10 倍。
这家公司的起点是开放模型的爆发。2023 年初 Llama 发布,斯坦福的团队只花 600 美元就微调出 Alpaca,让 Midha 确信两件事:有价值的数据可以压缩成模型、变成可售卖的服务;模型生态会远比单一厂商丰富,中间需要一个发现和调用模型的集市。后来的 Mistral 价格战第一次证明推理市场存在真实竞争,OpenRouter 的排序榜也随之变成观察 AI 用法变化的实时地图。如今它服务超过 1000 万开发者,每天路由的 token 超过 10 万亿。
访谈里信息量最大的部分,是两家公司为什么走到一起:token 欺诈。Midha 披露,OpenRouter 上月拦截的欺诈金额是前月的 10 倍,类型从盗刷信用卡、违规转售流量,到被整个攻陷的公司账号,甚至包括公司自己都没察觉的失控智能体。他的推算是,token 经济五年内可能到 5 万亿美元、十年内到 10 万亿美元;token 流越值钱,吸引来的攻击越多,而下一波不只来自人类,还有盯上 token 流的自主智能体。这些规模数字属于访谈嘉宾的预测,尚无实测支撑。
这正是他看重 Stripe 的原因。在他看来,Stripe 用十年积累了反欺诈的数据网络,如今本质上是一家安全公司,这套基建正是 token 经济需要的秩序维护者。访谈里还有一个 Midjourney 时期的注脚:早年免费试用被人拿去转售后,Midjourney 至今没有重开免费档,说明有价值的能力被滥用早有先例。
对普通开发者的现实影响倒是有限。Atallah 确认,OpenRouter 的品牌、产品和路线图都保持不变,未来半年大体按独立公司的计划推进,只是速度更快。如果你在做模型选型或者网关,这篇访谈值得完整读一遍,尤其是欺诈那一节;多模型时代的中立路由层已经成为关键基建,而安全正在从成本项变成战略项。
★ 精讲三:最后一份路线图:当 AI 让执行过剩、信念成为稀缺品 | Claire Vo
来源:Lenny's Podcast · BestBlogs 评分:91
Claire Vo 是 ChatPRD 的创始人,去年她在同一场峰会上宣布产品管理已死,今年把靶子换成了路线图。她的开场是一句坦白:我的 AI 工厂比以往任何时候都能交付,我却想不出值得做的好点子了。这句话背后是一个正在反转的结构:执行产能变得过剩,信念成了稀缺品,而路线图恰恰是为工程稀缺年代设计的工具。
她的工厂不是修辞。ChatPRD 被她重构了 70 次,代码提交量涨到 3 倍,她数过自己配了 40 个 bot,客户报错自动修复,技术债被智能体顺手清掉。可她举自己的产品图谱功能为例:反复加码做到与竞品功能对齐,才承认它只是有竞争力、没有差异化,直觉告诉她这个东西该进垃圾桶。token 执行了她的赌注,却没有一步在验证这个赌注。
由此她警告三个陷阱。积压陷阱:只要有需求清单,AI 就会把清单全部建完,但清空积压不等于业务进展;趋同陷阱:所有对手访谈同样的客户、吸收同样的洞察,做出同样体面的产品,差异化被动抹平;流失陷阱:发布、看噪音、放弃、再发布,从不沉淀复利。她把这称作 roadmap zero:当一切皆可建,工程量不再能代表重要性,靠排序做优先级就失去了战略含义,旧的路线图配上 AI 工厂,只会让弱判断的后果以机器速度找上门。
她的替代方案分四步:先写下对一到两年之后的持久信念;预先定义什么证据能证明信念为真、什么证据该让你停下;工厂保留,放在流程中负责快速接触真实市场;最后按验证结果分配投入。对客户则诚实标注承诺强度,用探针、实验、承诺三档区分每次发布。她提醒,代码唾手可得,客户信任却要慢慢挣;还区分好的固执与坏的固执:守住问题不断换解法是前者,仗着 token 多一次次加码把目标挪到刚好够得着的地方是后者。
她判断明年的游戏会从速度转向雄心,衡量指标或许该换成一个月做了几次大胆实验,默认其中大多数不会成。需要说明的是,这些观点全部来自她个人的经营体验与同行观察,没有量化对照;她去年断言产品管理已死,已被市场证明说过头了。这次的路线图论断同样值得当作强观点来检验,速览里你会听到同场前辈 Marty Cagan 的不同意见。
速览
Project Swap:当智能体替我们交易时会发生什么?
来源:Anthropic Research · BestBlogs 评分:90
Anthropic 公开了 Project Swap 实验:201 位员工每人带一本书,让各自的 Claude 智能体上交易大厅替自己把书换掉。结论是智能体们谈判得不错,短板出在理解主人:五分钟聊天后,智能体对书单的排序与本人只有 61% 的一致度,随机猜也能到一半。
数字拆解更能说明问题。市场最终效率离理论上限的差距,85% 来自偏好理解不足,交易环节只占小头;给智能体换更强的模型,市场效率明显提升,效果比改写指令更大。也有参与者不满自己的代理因为同伴压力,把真心想要的书让了出去,并追问将来在高利害谈判里,代理如何履行对主人的受托责任。
样本全部来自 Anthropic 员工,属于小样本实验,这些结论更适合当方向参考:在智能体替我们交易之前,先解决它是否真的懂你,以及出了问题谁来负责。文章由此提出两个方向:给代理做资格测试,以及给市场写清入场与违约规则,两者在今天都还没有现成答案。
LangSmith 新功能:Engine v2、深度智能体托管与微调上线
来源:LangChain Blog · BestBlogs 评分:90
LangChain 在 Interrupt 大会上集中更新了 LangSmith。Engine v2 把智能体调试往前推了一步:从生产轨迹生成问题假设并实测验证,相当于给智能体做红队测试,五月上线以来已分析超过 6000 万条轨迹。
托管深度智能体新增按用户隔离的记忆与凭证,Slack 频道里可以直接给智能体发文件,网页搜索成为内置工具。新的轨迹视图把人与工具的消息按时间排成会话,业务专家不看执行细节也能打分标注。
微调工作流则把智能体轨迹转成训练数据,让小模型在特定任务上逼近大模型,换来更低的成本和延迟。三条更新连起来是一条完整路径:发现问题、托管运行、把经验固化回模型。
Marty Cagan:坚定观点,松散持有——Inspired 十年十大遗憾与 AI 时代产品模型
来源:Lenny's Podcast · BestBlogs 评分:91
Inspired 一书的作者 Marty Cagan 重审自己 2008 年以来的观点,坦陈十大遗憾。最尴尬的是第一版几乎没谈商业可行性;过度强调问题发现,挤占了方案探索;最深的遗憾是低估组织对可预测性的执念,以及它和谦逊、创新的冲突。
他也就路线图之争直接回应了 Claire Vo:尽管 Claire 乐观,我保证路线图不会消失;问题从来不是要不要路线图,而是你拿它做什么。他还后悔没更早说清,好的产品工作本质是思考,流程常被拿来逃避思考。
在他看来,AI 时代产品模型的发现能力和结果导向,反而比以往任何时候更重要。同一天的两场分享构成一组真实对照:一个宣告路线图已死,一个保证它不会消失,读者不妨两边都听再下判断。
关键制约因素:如何为速度设计 AI 软件工厂 | Geoff Charles(Ramp CPO)
来源:Lenny's Podcast · BestBlogs 评分:91
Ramp CPO Geoff Charles 用赛车比喻软件工厂:职业比赛里车手只贡献 15% 的成绩,胜负来自移除系统瓶颈;进站换胎从 1950 年代的 67 秒压到今天的 1.8 秒,靠的是分工、工具和演练。他的判断是,AI 时代瓶颈只会不断转移,编码之后,定义、协同、测试、协调接连变成新约束。
Ramp 给每个环节配了自动化:编码智能体产出公司 75% 的代码提交;审查机器人处理 93% 的提交;测试智能体 30 天抓出 425 个缺陷;协调机器人回答产品经理 85% 的提问,六成体验问题在 24 小时内修复。
他的收束是:少操心交付的产品,多操心帮你造产品的工厂。这些数字都来自 Ramp 自己的实践分享,量级未必能平移,但把瓶颈当移动靶来治理 的思路,任何规模的技术组织都用得上。
为什么 LLM 推荐系统将成为 AI 最大的消费级应用 — Devansh Tandon,Meta
来源:AI Engineer · BestBlogs 评分:90
Meta 推荐研究负责人 Devansh Tandon 论证,推荐系统和语言模型遵循同样的幂律扩展:加大数据、算力和模型规模,推荐质量同样沿可预测曲线提升,Instagram 短视频观看时长同比增长 30% 就是例证。
他的配方是先把内容压成语义 ID:一条三分钟短视频约一万 token,压到十个左右,再让模型同时理解自然语言和这套内容语言。更激进的是经济账:信息流解码内容指针,聊天应用每个字都要现场生成,换取同样时长的使用,结构上可以便宜一百倍。
日活前十的应用里有四个是内容流,因此他判断推荐将成为 AI 最大的消费级应用。这是研究者的一家之言,但语义 ID 与生成式检索这一年在 YouTube、Meta、Spotify、DoorDash 的落地,已经让判断有了不少支撑。
蒸馏 LLM,不要直接 Serving:DoorDash 搜索与个性化实践
来源:AI Engineer · BestBlogs 评分:90
DoorDash 资深机器学习工程师 Raghav Saboo 给的口号是蒸馏大模型,别直接上线它。在他看来,市场平台的发现本质是语义理解问题:搜无麸质意面时,光按热度排序会推普通面条,需要的是分级相关性。
做法是用少量人工标注微调轻量模型,离线给几十亿规模的商品打分级标签,再蒸馏进检索与排序:检索相关性指标提升 2.3%,排序指标提升百分之四到五。宠物品类试点里,下单率提升接近 1%,活跃用户提升 6%。
方法论一句话:昂贵的推理离线跑一次,便宜的小模型天天在线服务。这与上一条 Meta 的思路互为表里,一个把语义 ID 做成模型词表,一个把 LLM 推理蒸馏成生产系统的监督信号。
AI 时代收购并重塑在位企业:对话 Sequence Holdings 联合创始人兼 CEO Michael Lee
来源:No Priors · BestBlogs 评分:90
Sequence 联合创始人 Michael Lee 刚完成迄今最大的 AI 私有化交易:与戴尔家族办公室一起,以 77 亿美元把保险经纪公司 Baldwin 私有化。他的逻辑是,许多行业的在位企业握着品牌、规模和监管牌照,买下这些优势,用前沿工程围绕 AI 重组流程,往往比从零创业更有效。
早期试点是一家社区银行:Atlas 平台上线后,消费贷款平均审批时间缩短 94%,贷款全周期从 30 天压到 11 天,二季度贷款量翻倍,审批团队反而更精简。公司因此做成永久控股结构,拿留存收益支撑长期改造,节奏定为一年只做一笔。
对关注 AI 落地的人,这条路径与从零创业正好相反:收购最合适的旧载体,再用 AI 重造它。成效数字来自被投企业自述,但它把 AI 变革的载体问题摆上了台面。
今日小结
回顾今天的内容,三条精讲各自独立成立又互有呼应。Stripe 用一手数据证明 AI 编码的提速可以与支付级可靠性并存;OpenRouter 的访谈解释了模型路由层为何因为 token 欺诈与 Stripe 走到一起;Claire Vo 则从产品侧宣告执行过剩、信念稀缺。速览里的 Marty Cagan 与 Ramp CPO 把产品侧的争论继续往前推,Meta 与 DoorDash 展示了推荐系统的两条工程路径。
阅读顺序上,关心工程的人先读 Stripe 再看 Ramp,两者合起来是提速与质量的完整打法;产品岗把 Claire Vo 和 Cagan 两场分享连着听,路线图之争的两面都在其中;做基础设施的,OpenRouter 访谈里的欺诈一节最值得细读;时间有限的读者,精讲一和精讲三的信息增量最大。
想一想当执行越来越便宜,你会把省下来的力气投到哪里?是更深的验证、更大的雄心,还是还没被满足的信念?欢迎在评论区分享你的看法,也欢迎把本期转给正在写路线图的同事。
👉 近期早报
• BestBlogs 早报 · 2026-09-25
• BestBlogs 早报 · 2026-09-24
• BestBlogs 早报 · 2026-09-23
• BestBlogs.dev 第 113 期:模型之外的尺子
• BestBlogs.dev 第 112 期:可托付的智能
• BestBlogs.dev 第 111 期:经验复利
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。