# Stripe CEO 谈 Claude Code 一线实践：AI 写码 600 次提交仅 1 次回滚

- 来源：ginobefun (@hongming731)
- 发布时间：2026-09-26 08:59
- AIHOT 分数：44
- AIHOT 链接：https://aihot.news/items/cmuhozpma0h3trojndyvu1ina
- 原文链接：https://x.com/hongming731/status/2103650677839016444

## AI 摘要

Stripe CEO Patrick Collison 披露，一位工程师上半年合并超 600 个全部由 AI 编写的代码提交，仅 1 个被回滚，同期核心支付 API 可用性保持 5.5 个 9。刚被 Stripe 收购的 OpenRouter 已服务超 1000 万开发者，每天路由 token 超 10 万亿，上月拦截的 token 欺诈金额达前月 10 倍。

## 正文

https://x.com/i/article/2103650028904759296

BestBlogs 早报 · 09-26｜Stripe CEO 谈 Claude Code一线实践，OpenRouter 联创复盘，Claire Vo 谈产品信念

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容，如果你希望它基于你的兴趣和阅读习惯整理，可以体验「我的早报」。

导语

Stripe 的一位工程师在上半年合并了 600 多个全部由 AI 编写的代码提交，只有一个被回滚；与此同时，公司核心支付 API 的可用性保持在 5.5 个 9。这组来自 Stripe CEO Patrick Collison 的一手数据，直接回答了行业里悬了很久的问题：AI 编码的提速，是否必然以质量为代价。他的答案藏在不变量与硬屏障式的护栏里，而不只是模型能力本身。

第二条精讲与它有真实衔接。刚被 Stripe 收购的 OpenRouter，联合创始人与早期投资人在长访谈中复盘了这家曾被投资人贬为 API 套壳的公司，如何长成服务超过 1000 万开发者的模型路由层；而并购的一个关键考量，是上月拦截的 token 欺诈金额达到前月的 10 倍。第三条转向产品视角：ChatPRD 创始人 Claire Vo 说，执行已经过剩，稀缺的是信念，她建议产品人写下最后一份路线图。三篇各自独立成立，前两篇共同拼出 Stripe 眼中的智能体经济版图。

随后的七条速览里，还有三场分享来自同一场产品峰会：Marty Cagan 明确反对路线图消失论，Ramp CPO 把瓶颈治理做成 F1 式工厂，观点彼此交锋，适合对照着读。此外还有 Anthropic 的智能体换书实验、Meta 与 DoorDash 的推荐系统实践，以及一家用 AI 收购并重塑在位企业的控股公司。

★ 精讲一：Patrick Collison 谈 Stripe 用 Claude Code 加速交付并守住可靠性

来源：Claude · BestBlogs 评分：91

这场对话发布在 Claude 官方频道，嘉宾是 Stripe CEO Patrick Collison。他给出的第一组数字回应了最常见的担心：代码写得快了，审查会不会跟不上。一位工程师在上半年合并了超过 600 个代码提交，每一个都由 AI 编写，最终只有一个被回滚；同期单个提交的质量在过去 18 个月持续上升，单位时间的事故数略有增加，但大多轻微，整体可靠性基本没有变化。加速开发与经验上的高可靠，这两个目标在他口中可以同时成立。

背景是 Stripe 对部署节奏的执念。金融行业的系统往往一个月甚至一个季度才发布一次，Stripe 的核心支付 API 却坚持持续部署，可用性保持在 5.5 个 9，团队希望每天从客户那里拿到多次反馈。Collison 认为，少发布带来的局部稳定有两笔隐性成本：反馈变慢，以及迁移因为积压数月进度而变得危险。

提速而不出事，靠的是确定性机制。Collison 说，Stripe 依靠不变量和硬屏障做保证，避开主观、酌情或概率性的判断；模型更对齐当然好，但没有任何系统完美，值得押注的只有保证。围绕数据的标签和语义感知护栏，Stripe 从 2017 年就开始建设，把权限做到细粒度标注。当年是为了安全底线，如今恰好让智能体开发在合规边界内高速运转。

产出也有具体例子。Stripe Projects 从想法到公开发布，用了两到三位工程师、大约两个月，期间对接了约 50 个外部服务。他问过参与的工程师，放到从前需要更大的团队和六个月；按团队翻倍、时间三倍估算，至少是六倍提速。他同时坦承，工程师的估算向来乐观，各项目提速分布不均匀，就算全公司平均只有两倍，也已经非常可观。这组数字是 CEO 转述的内部估算，读的时候记住口径即可，不必当成普适基准。

内部工作方式也在变。每个开发环境预装了 Claude Code，它成了工程师完成任务的第一站；公司还有一套叫 Minions 的编排系统，从聊天工具接收需求，自动开虚拟机、写代码、打包提交并跑完整测试。有工程师先用最强模型做一份复杂计划，再派 10 个环境并行执行不同部分，一跑就是一整天。Collison 承认，这种规划式的用法此前被他低估。

往远处看，他还有两个观察：平台上新企业的创建速度大约翻倍，是公司成立 15 年来相对幅度最大的一次加速；Stripe 内部的判断是，三年内大多数交易将发生在智能体与智能体之间。对做支付和做智能体的团队，这两句话都值得记下来。担心 AI 编码拖垮质量的读者，这篇访谈给出了一份支付级生产线上的对照样本：提速的确定性来自护栏，而不是来自模型自觉。

★ 精讲二：OpenRouter 联创谈从种子轮到并入 Stripe：模型路由的下一站

来源：Latent.Space · BestBlogs 评分：91

这是 Latent.Space 发布的长访谈，两位嘉宾是 OpenRouter 联合创始人 Alex Atallah 和它的早期投资人、AMP 的 Anjney Midha，此时公司刚刚并入 Stripe。故事开头并不光鲜：不少投资人当年把 OpenRouter 称为 API 套壳，认为在别人的模型接口上包一层路由没有价值。Midha 回忆，他偏偏看好这层路由里的工程与社区设计；在他投资一个月后，就有机构把估值上调了 10 倍。

这家公司的起点是开放模型的爆发。2023 年初 Llama 发布，斯坦福的团队只花 600 美元就微调出 Alpaca，让 Midha 确信两件事：有价值的数据可以压缩成模型、变成可售卖的服务；模型生态会远比单一厂商丰富，中间需要一个发现和调用模型的集市。后来的 Mistral 价格战第一次证明推理市场存在真实竞争，OpenRouter 的排序榜也随之变成观察 AI 用法变化的实时地图。如今它服务超过 1000 万开发者，每天路由的 token 超过 10 万亿。

访谈里信息量最大的部分，是两家公司为什么走到一起：token 欺诈。Midha 披露，OpenRouter 上月拦截的欺诈金额是前月的 10 倍，类型从盗刷信用卡、违规转售流量，到被整个攻陷的公司账号，甚至包括公司自己都没察觉的失控智能体。他的推算是，token 经济五年内可能到 5 万亿美元、十年内到 10 万亿美元；token 流越值钱，吸引来的攻击越多，而下一波不只来自人类，还有盯上 token 流的自主智能体。这些规模数字属于访谈嘉宾的预测，尚无实测支撑。

这正是他看重 Stripe 的原因。在他看来，Stripe 用十年积累了反欺诈的数据网络，如今本质上是一家安全公司，这套基建正是 token 经济需要的秩序维护者。访谈里还有一个 Midjourney 时期的注脚：早年免费试用被人拿去转售后，Midjourney 至今没有重开免费档，说明有价值的能力被滥用早有先例。

对普通开发者的现实影响倒是有限。Atallah 确认，OpenRouter 的品牌、产品和路线图都保持不变，未来半年大体按独立公司的计划推进，只是速度更快。如果你在做模型选型或者网关，这篇访谈值得完整读一遍，尤其是欺诈那一节；多模型时代的中立路由层已经成为关键基建，而安全正在从成本项变成战略项。

★ 精讲三：最后一份路线图：当 AI 让执行过剩、信念成为稀缺品 | Claire Vo

来源：Lenny's Podcast · BestBlogs 评分：91

Claire Vo 是 ChatPRD 的创始人，去年她在同一场峰会上宣布产品管理已死，今年把靶子换成了路线图。她的开场是一句坦白：我的 AI 工厂比以往任何时候都能交付，我却想不出值得做的好点子了。这句话背后是一个正在反转的结构：执行产能变得过剩，信念成了稀缺品，而路线图恰恰是为工程稀缺年代设计的工具。

她的工厂不是修辞。ChatPRD 被她重构了 70 次，代码提交量涨到 3 倍，她数过自己配了 40 个 bot，客户报错自动修复，技术债被智能体顺手清掉。可她举自己的产品图谱功能为例：反复加码做到与竞品功能对齐，才承认它只是有竞争力、没有差异化，直觉告诉她这个东西该进垃圾桶。token 执行了她的赌注，却没有一步在验证这个赌注。

由此她警告三个陷阱。积压陷阱：只要有需求清单，AI 就会把清单全部建完，但清空积压不等于业务进展；趋同陷阱：所有对手访谈同样的客户、吸收同样的洞察，做出同样体面的产品，差异化被动抹平；流失陷阱：发布、看噪音、放弃、再发布，从不沉淀复利。她把这称作 roadmap zero：当一切皆可建，工程量不再能代表重要性，靠排序做优先级就失去了战略含义，旧的路线图配上 AI 工厂，只会让弱判断的后果以机器速度找上门。

她的替代方案分四步：先写下对一到两年之后的持久信念；预先定义什么证据能证明信念为真、什么证据该让你停下；工厂保留，放在流程中负责快速接触真实市场；最后按验证结果分配投入。对客户则诚实标注承诺强度，用探针、实验、承诺三档区分每次发布。她提醒，代码唾手可得，客户信任却要慢慢挣；还区分好的固执与坏的固执：守住问题不断换解法是前者，仗着 token 多一次次加码把目标挪到刚好够得着的地方是后者。

她判断明年的游戏会从速度转向雄心，衡量指标或许该换成一个月做了几次大胆实验，默认其中大多数不会成。需要说明的是，这些观点全部来自她个人的经营体验与同行观察，没有量化对照；她去年断言产品管理已死，已被市场证明说过头了。这次的路线图论断同样值得当作强观点来检验，速览里你会听到同场前辈 Marty Cagan 的不同意见。

速览

Project Swap：当智能体替我们交易时会发生什么？

来源：Anthropic Research · BestBlogs 评分：90

Anthropic 公开了 Project Swap 实验：201 位员工每人带一本书，让各自的 Claude 智能体上交易大厅替自己把书换掉。结论是智能体们谈判得不错，短板出在理解主人：五分钟聊天后，智能体对书单的排序与本人只有 61% 的一致度，随机猜也能到一半。

数字拆解更能说明问题。市场最终效率离理论上限的差距，85% 来自偏好理解不足，交易环节只占小头；给智能体换更强的模型，市场效率明显提升，效果比改写指令更大。也有参与者不满自己的代理因为同伴压力，把真心想要的书让了出去，并追问将来在高利害谈判里，代理如何履行对主人的受托责任。

样本全部来自 Anthropic 员工，属于小样本实验，这些结论更适合当方向参考：在智能体替我们交易之前，先解决它是否真的懂你，以及出了问题谁来负责。文章由此提出两个方向：给代理做资格测试，以及给市场写清入场与违约规则，两者在今天都还没有现成答案。

LangSmith 新功能：Engine v2、深度智能体托管与微调上线

来源：LangChain Blog · BestBlogs 评分：90

LangChain 在 Interrupt 大会上集中更新了 LangSmith。Engine v2 把智能体调试往前推了一步：从生产轨迹生成问题假设并实测验证，相当于给智能体做红队测试，五月上线以来已分析超过 6000 万条轨迹。

托管深度智能体新增按用户隔离的记忆与凭证，Slack 频道里可以直接给智能体发文件，网页搜索成为内置工具。新的轨迹视图把人与工具的消息按时间排成会话，业务专家不看执行细节也能打分标注。

微调工作流则把智能体轨迹转成训练数据，让小模型在特定任务上逼近大模型，换来更低的成本和延迟。三条更新连起来是一条完整路径：发现问题、托管运行、把经验固化回模型。

Marty Cagan：坚定观点，松散持有——Inspired 十年十大遗憾与 AI 时代产品模型

来源：Lenny's Podcast · BestBlogs 评分：91

Inspired 一书的作者 Marty Cagan 重审自己 2008 年以来的观点，坦陈十大遗憾。最尴尬的是第一版几乎没谈商业可行性；过度强调问题发现，挤占了方案探索；最深的遗憾是低估组织对可预测性的执念，以及它和谦逊、创新的冲突。

他也就路线图之争直接回应了 Claire Vo：尽管 Claire 乐观，我保证路线图不会消失；问题从来不是要不要路线图，而是你拿它做什么。他还后悔没更早说清，好的产品工作本质是思考，流程常被拿来逃避思考。

在他看来，AI 时代产品模型的发现能力和结果导向，反而比以往任何时候更重要。同一天的两场分享构成一组真实对照：一个宣告路线图已死，一个保证它不会消失，读者不妨两边都听再下判断。

关键制约因素：如何为速度设计 AI 软件工厂 | Geoff Charles（Ramp CPO）

来源：Lenny's Podcast · BestBlogs 评分：91

Ramp CPO Geoff Charles 用赛车比喻软件工厂：职业比赛里车手只贡献 15% 的成绩，胜负来自移除系统瓶颈；进站换胎从 1950 年代的 67 秒压到今天的 1.8 秒，靠的是分工、工具和演练。他的判断是，AI 时代瓶颈只会不断转移，编码之后，定义、协同、测试、协调接连变成新约束。

Ramp 给每个环节配了自动化：编码智能体产出公司 75% 的代码提交；审查机器人处理 93% 的提交；测试智能体 30 天抓出 425 个缺陷；协调机器人回答产品经理 85% 的提问，六成体验问题在 24 小时内修复。

他的收束是：少操心交付的产品，多操心帮你造产品的工厂。这些数字都来自 Ramp 自己的实践分享，量级未必能平移，但把瓶颈当移动靶来治理 的思路，任何规模的技术组织都用得上。

为什么 LLM 推荐系统将成为 AI 最大的消费级应用 — Devansh Tandon，Meta

来源：AI Engineer · BestBlogs 评分：90

Meta 推荐研究负责人 Devansh Tandon 论证，推荐系统和语言模型遵循同样的幂律扩展：加大数据、算力和模型规模，推荐质量同样沿可预测曲线提升，Instagram 短视频观看时长同比增长 30% 就是例证。

他的配方是先把内容压成语义 ID：一条三分钟短视频约一万 token，压到十个左右，再让模型同时理解自然语言和这套内容语言。更激进的是经济账：信息流解码内容指针，聊天应用每个字都要现场生成，换取同样时长的使用，结构上可以便宜一百倍。

日活前十的应用里有四个是内容流，因此他判断推荐将成为 AI 最大的消费级应用。这是研究者的一家之言，但语义 ID 与生成式检索这一年在 YouTube、Meta、Spotify、DoorDash 的落地，已经让判断有了不少支撑。

蒸馏 LLM，不要直接 Serving：DoorDash 搜索与个性化实践

来源：AI Engineer · BestBlogs 评分：90

DoorDash 资深机器学习工程师 Raghav Saboo 给的口号是蒸馏大模型，别直接上线它。在他看来，市场平台的发现本质是语义理解问题：搜无麸质意面时，光按热度排序会推普通面条，需要的是分级相关性。

做法是用少量人工标注微调轻量模型，离线给几十亿规模的商品打分级标签，再蒸馏进检索与排序：检索相关性指标提升 2.3%，排序指标提升百分之四到五。宠物品类试点里，下单率提升接近 1%，活跃用户提升 6%。

方法论一句话：昂贵的推理离线跑一次，便宜的小模型天天在线服务。这与上一条 Meta 的思路互为表里，一个把语义 ID 做成模型词表，一个把 LLM 推理蒸馏成生产系统的监督信号。

AI 时代收购并重塑在位企业：对话 Sequence Holdings 联合创始人兼 CEO Michael Lee

来源：No Priors · BestBlogs 评分：90

Sequence 联合创始人 Michael Lee 刚完成迄今最大的 AI 私有化交易：与戴尔家族办公室一起，以 77 亿美元把保险经纪公司 Baldwin 私有化。他的逻辑是，许多行业的在位企业握着品牌、规模和监管牌照，买下这些优势，用前沿工程围绕 AI 重组流程，往往比从零创业更有效。

早期试点是一家社区银行：Atlas 平台上线后，消费贷款平均审批时间缩短 94%，贷款全周期从 30 天压到 11 天，二季度贷款量翻倍，审批团队反而更精简。公司因此做成永久控股结构，拿留存收益支撑长期改造，节奏定为一年只做一笔。

对关注 AI 落地的人，这条路径与从零创业正好相反：收购最合适的旧载体，再用 AI 重造它。成效数字来自被投企业自述，但它把 AI 变革的载体问题摆上了台面。

今日小结

回顾今天的内容，三条精讲各自独立成立又互有呼应。Stripe 用一手数据证明 AI 编码的提速可以与支付级可靠性并存；OpenRouter 的访谈解释了模型路由层为何因为 token 欺诈与 Stripe 走到一起；Claire Vo 则从产品侧宣告执行过剩、信念稀缺。速览里的 Marty Cagan 与 Ramp CPO 把产品侧的争论继续往前推，Meta 与 DoorDash 展示了推荐系统的两条工程路径。

阅读顺序上，关心工程的人先读 Stripe 再看 Ramp，两者合起来是提速与质量的完整打法；产品岗把 Claire Vo 和 Cagan 两场分享连着听，路线图之争的两面都在其中；做基础设施的，OpenRouter 访谈里的欺诈一节最值得细读；时间有限的读者，精讲一和精讲三的信息增量最大。

想一想当执行越来越便宜，你会把省下来的力气投到哪里？是更深的验证、更大的雄心，还是还没被满足的信念？欢迎在评论区分享你的看法，也欢迎把本期转给正在写路线图的同事。

👉 近期早报

• BestBlogs 早报 · 2026-09-25

• BestBlogs 早报 · 2026-09-24

• BestBlogs 早报 · 2026-09-23

• BestBlogs.dev 第 113 期：模型之外的尺子

• BestBlogs.dev 第 112 期：可托付的智能

• BestBlogs.dev 第 111 期：经验复利

BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
