# InstructGPT 前成员 Diogo Almeida 谈离开 OpenAI 与不聊天模型 Jev 的由来

- 来源：Frank Wang 玉伯 (@lifesinger)
- 发布时间：2026-09-23 22:18
- AIHOT 分数：59
- AIHOT 链接：https://aihot.news/items/cmue7lu9z0q15rogh48n8uirl
- 原文链接：https://x.com/lifesinger/status/2102764610109813192

## AI 摘要

TypeSafe 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中讲述其离开 OpenAI 的经历，他参与过 InstructGPT 和 RLHF 早期工作，但认为优化方向过度面向人而公司难以转向为代码服务的智能，遂创业开发非聊天的大 型可编程模型 Jev（System One）。

## 正文

https://x.com/i/article/2102764478530252800

Jev：离开 OpenAI 后，他做了一个不跟人聊天的 AI

一个参与过 InstructGPT 的人，为什么离开 OpenAI，去做一个不跟人聊天的模型。

Jev 发布后，Diogo Almeida 来到 Latent Space 的演播室。主持人 swyx 问他，现在感觉怎么样。

他的回答分成两半。

身体和情绪，糟透了。事情太多，他是个技术型 CEO，到处都有火要灭。可另一半，他兴奋得不行。他觉得自己念叨了好多年的事情，开发者终于听懂了。

他甚至闹了个笑话。他在 Twitter 上发帖，感叹三个热搜都是自己。有人提醒，那只是他的个人信息流。

这个不太会看热搜的人，有一个很不符合热搜气质的愿望。

他想把自己的公司做得像 VISA 一样无聊。到了那一天，大家照常生活，不必想起他的模型，他也不用再穿粉色西装。

不过，要走到那个未来，他先得反对眼前不少热闹的东西。

本文依据 Latent Space 的 swyx 对话 TypeSafe 联合创始人兼 CEO Diogo Almeida 的对谈记录。文中有关行业、公司和技术路线的评价，均按嘉宾个人观点呈现，不等于独立验证的结论。

一、他参与造出了好学生，却开始怀疑考试

Diogo 不是站在场外批评聊天模型的人。

在 OpenAI，他参与过 InstructGPT 和指令遵循方向的早期工作。按他的回忆，为了让早期版本尽快上线，他甚至用过自己写的、没有公开的训练算法。当时他的想法很直接：这东西太好用了，必须赶紧交到用户手里。

他也欣赏早期 ChatGPT 团队。他们在做一件 AI 研究员往往不擅长的事：死抠产品体验。

但后来，一个反差越来越刺眼。

模型看起来那么聪明，真正落地的用途却大量集中在写文案。它能给出令人惊叹的回答，很多基础、机械、枯燥的工作却仍然离不开人。

他开始回头审视自己参与推动的方向，RLHF。

这个缩写听着复杂，直白地说，就是用人的反馈来训练模型，让人更喜欢它的回答。这当然带来了进步，但 Diogo 怀疑，讨人喜欢和帮助人做对事情，并不总是一回事。

流畅、自信、说得头头是道，容易得到好评。说出罕见的可能性，承认自己拿不准，却未必那么讨喜。

按他的解释，训练可能让模型压低那些不常见的答案，偏向更熟悉、更稳妥的表达。它看上去更会说话了，输出的概率却未必更忠实于不确定性。这涉及两个相关但不同的问题：模式丢失，以及校准失真。

对普通人来说，不必记住术语。记住这个区别就够了：

你觉得它说得对，和它真的判断得对，是两回事。

Diogo 想要的不是一个永远显得很懂的模型。他想要的是，它在没把握的时候，不要把自己包装成很有把握。

二、Sam 说很好，但公司仍然朝另一个方向走

真正改变他的，是一个很简单的倒推。

假如 AI 最终承担了大量有经济价值的工作，那么调用 AI 的，主要会是人，还是代码。

他的答案是代码。

一个人一天能问多少次。一个程序一旦运行起来，可以不停地处理信息、作出判断，再把结果传给下一个程序。

可他看到的优化方向，几乎全都朝着人。怎样让回答更好听，怎样让对话更自然，怎样把 ChatGPT 放进更多东西里。

他把想法写成文档，找 Sam 聊。按他的回忆，Sam 觉得这个想法很好，让他去做。

所以，这不是一个老板听不懂天才的故事。

困难在于，赞成一个想法，和让一个组织围绕它工作，是不同的事。Diogo 想要给程序用的智能，身边讨论的却仍是怎样把聊天产品做得更好。

这种分歧会落到极小的接口细节上。他希望开发者能直接调整某个函数被选择的倾向，拿到类似概率或置信度的控制手段。可现实中，开发者往往只能往提示词里多写几句，恳求模型多用这个工具、少用那个工具。

他受不了这种感觉。

程序员本该拿到一个能控制的接口，却像在劝说一位不太听话的同事。

后来，他去找其他公司，讨论能不能为这个方向建立一个实验室。他问，在大公司里做和自己创业，哪一个更快。对方告诉他，创业更快。

他决定离开。

有趣的是，他原本以为这个项目一周就能做完。后来花了好多年。访谈里，他为自己当初的轻率向 OpenAI 的同事道歉。

三、不是再造一个天才，而是把直觉接到代码上

离开之后，他造出来的东西叫 Jev。

它不是聊天机器人。Diogo 更愿意叫它 System One，系统一模型，也叫大型可编程模型。

可以把系统一粗略理解为直觉式判断。不是坐下来写一长串推理，而是面对一份信息，迅速识别、分类、比较，判断该走哪一步。

直觉不等于死板的条件反射。它仍然需要理解语境，只是不必把思考过程写成一篇文章。

Diogo 认为，这正是语言模型已经拥有、却没有被充分利用的能力。

他的目标不是让 Jev 包办所有难题。他承认，有些任务它就是做不好。有时，聪明的答案应该是低置信度，甚至是不知道。系统一的边界也不是命名时画好的一条线，要靠实际使用去摸索。

关键是，软件里有太多地方，并不需要一个长篇大论的天才。

它需要从几个选项里挑一个，需要排一下顺序，需要判断一个条件是否成立。Jev 把这些能力做成代码可以直接使用的输出。

于是，软件的组织方式也可能跟着变。

过去，我们把一大堆材料和要求塞进提示词，让一个大模型从头做到尾。Diogo 希望把这团东西重新拆开：代码管理流程，模型在需要理解和判断的地方介入。

他尤其讨厌巨型系统消息。那像一个什么都往里装的全局变量。你写上不能读取某个目录、不能泄露密钥，再寄希望于模型一直记住。

他的主张更朴素：该用程序限制的，就用程序限制；必须依靠智能判断的，就拆成清楚的小问题，分别测试。

不是把整个软件交给 AI，而是让软件的每个必要环节，都能用上 AI。

四、一个名字，藏着一门反直觉的生意

Jev 这个名字，来自杰文斯悖论。

它讲的是一种反直觉的可能：资源用起来越高效，单次使用越省，总消耗反而可能上升。

原因不神秘。便宜之后，原本用不起的人开始用了，原本不值得做的事也开始做了。只要新增需求足够大，就会超过效率提升带来的节省。

这不是说降价一定能带来更多收入。它有一个前提：价格下降后，真的会释放出足够多的新需求。

Diogo 把这个判断放进了模型的名字。

他的目标不是单纯替客户省下一点今天的 AI 账单。他想让智能便宜到一种程度，使人开始在过去根本不会考虑的地方调用它。

但便宜还不够。

他反复强调一个指标：单位美元智力。说白了，一块钱到底买到了多少有用的判断能力。

一个模型即使便宜得惊人，如果做出的判断不能用，也没有意义。反过来，一个模型偶尔能展示惊人的聪明，但太贵、太慢、不稳定，也很难成为软件里随处可用的零件。

所以他要的是便宜又可靠。

实时场景还多一层要求：快。按他的解释，如果一次判断耗时减半，同样的等待时间里就能多做一次判断，或者把两次判断串起来。这时速度不只是等待体验，它会改变产品能做什么。

Jev 这个看着随意的名字，实际上给团队定了一条纪律：能力提高了，性价比也得站得住。

五、别拿成绩单来，让它去值夜班

融资时，投资人想看跑分。

Diogo 不愿意按这套方式证明自己。按他的回忆，这让融资吃了不少苦头。

他对公开评测的态度很激烈。问题不只是有人会作弊，而是只要一个分数成了目标，整个组织就会围着它转。即使没有直接拿考题训练，也可以大量寻找长得像考题的数据。

最后，大家都在变得更会考试。

他不是反对测量。TypeSafe 自己也做内部评测，否则无法判断不同成本下，哪个模型更好。他反对的是把一个公开分数，变成智能的替身。

在他看来，真正重要的评测发生在工作流里。把它放到你要解决的事情里，看它在哪些情况下会错，概率能不能信，能否长期稳定地运行。

公开榜单问它考得多好，工作流评测问你敢不敢把活交给它。

他举过一种很小的测试：往提示词里加一个没有实际意义的 UUID，也就是一串标识符。问题的意思没有改变，答案就不该因此大幅变化。

这比同一个问题问两次得到同一个答案，更接近他在意的可靠性。现实里的输入总会稍有不同，模型不能一碰到无关变化就失常。

他对业务的观察也类似。有人来试几次，不能让他特别兴奋。真正让他兴奋的是，大半夜仍有程序持续调用。

那意味着有人开始把它放进后台，让它值夜班。

当然，反对刷榜并不能替代证明。Jev 在客户自己的任务里是否足够可靠，仍然需要一项项测出来。Diogo 自己也承认，模型还会犯很多错，离像数据库一样让人放心，尚有很长的路。

六、他不要你的训练数据，却想处理你舍不得处理的数据

谈到数据，Diogo 说了一句很反行业惯性的话。

即使可以要求用户交出数据，他们也不想拿它来训练。

他的理由是，真实世界的数据偏差太大。大量用户反复问同样的问题，模型就可能越来越擅长最常见的那一小片，而忽略其他地方。

如果目标是服务今天的热门需求，这也许有效。但他想做的是未来的软件基础设施，要接住那些今天还没人想到的用途。

在他的判断里，即使拿到了当下所有数据，也可能只是把模型训练得更适应当下。

因此，他很看重合成训练数据。但不是随便让另一个模型生成一堆文本。任务是什么、能力缺口在哪里、如何覆盖那些少见却重要的情况，都需要有人细细设计。

他把这些数据人员比作艺术家，也比作做手术的人。他们寻找模型能力参差不齐的地方，然后尝试修补。

而在客户一侧，他特别看好另一类数据：暗数据，dark data。

这是企业已经积攒下来，却因为分析成本太高而没有充分利用的数据。过去，拿大模型把它们全部跑一遍，账单太吓人。判断能力足够便宜之后，这些数据才可能被重新拿出来处理。

这里有个容易混淆的区别。

合成数据是他拿来训练模型的。暗数据是客户希望模型去处理的。

他不是要用暗数据替代用户数据训练。恰恰相反，他想先把一个通用模型做好，再让客户拿它处理各自的材料。

七、用户说不需要，后来又来借 GPU

创业初期，有一段日子很不体面。

按 Diogo 的回忆，上线前几乎没有营收。团队里的非技术人员很担心，觉得大家根本听不懂他们在卖什么。

它像维生素，不像止痛药。

试用者里，有一半以上没理解这个东西。理解的人觉得很酷，接着又问，公司采购流程怎么走。

于是，那个创业者熟悉的词出现了：PMF，产品与市场的匹配。

照当时的反馈看，他们似乎还离它很远。

发布之后，反馈却突然变了。开发者开始做出团队自己都没想到的用法。有人要求更高的调用额度，甚至提出能不能借 GPU 给他们，因为现有算力不够用。

这让 Diogo 开始质疑对 PMF 的某些理解。

东西在那里，市场也在那里。但在有人把可能性做出来之前，很多人没办法回答它对自己有什么用。

对于一种新的基础能力，需求未必会以完整、清晰的句子，提前出现在用户访谈里。有人先用它做出东西，别人才认出来，原来自己也需要。

这段经历不等于用户反馈无用，更不意味着每个没人买的产品都藏着巨大市场。

它更像一个提醒：有时用户不买账，是产品不行；有时，是新能力还没有变成一个人们看得懂的用途。两者很难区分，Diogo 也说自己当时非常害怕。

八、刚开了一家实验室，他就劝别人别开实验室

swyx 问他，会怎样建议那些在大公司里拿不到资源、感到沮丧的研究员。

照这个故事的发展，他应该鼓励大家勇敢出走。

但他没有。

他反而批评了许多 neo lab，也就是新成立的 AI 实验室。他觉得其中不少团队没有清晰方向，只是想拿一笔钱，继续做研究。重新搭一遍大实验室已有的东西，真正推进前沿的机会却未必有多大。

他的区分不在于创业还是打工，而在于有没有一个值得坚持的任务。

如果只是想自由地做实验，大实验室可能更合适。如果有一个明确、重要、现有组织又不愿全力去做的方向，那就应该出来做。

这也是他对自己的解释。

他并不喜欢初创公司，从没想过当 CEO，也无法想象有人愿意创业第二次。刚开始融资，有投资人问他崇拜哪些 CEO，他甚至不理解自己为什么要崇拜那些人。

他离开，是因为想把一件事做到底，而不是因为想拥有一家实验室。

从这个角度看，他对研究员光环的冷淡并不矛盾。他需要研究员，但更在意他们究竟想解决什么。

九、他想保持纯粹，却已经不能只写代码

访谈后半段，话题转向安全、监管和政治。

Diogo 明显不舒服。

他担心的是，技术圈为了一个自认为正确的大局，开始把不确定的判断说得过于确定，再借助权威说服公众接受。

他不愿那样做。他知道公司变大后，有些事情可能躲不开，但仍想尽量保持一个纯粹的技术人。

这种纯粹，在他的叙述里，也体现在很具体的选择上。

发布最忙的时候，他仍想留出精力和开发者社区说话。对他来说，如果密密麻麻的日程里只有重要人物，没有实际使用产品的人，会很不自在。

他也请听众监督自己。不要等公司做大，转身只顾大客户，把最早支持他的开发者放到一边。

但纯粹不代表这家公司由他一个人说了算。

访谈里，他反复提到自己写了文章，团队还没让发；有些东西想公开，得先让同事看。他甚至说，员工并不怎么表现出对他的尊敬，会拿他开玩笑，他把这当成好文化的标志。

这个到处爆粗口、说自己品牌是混乱的人，也在学习一件很普通的事：放权。

他想守住技术人的原则，却必须学会不再只做一个技术人。

十、SaaS 不一定会死，聊天框可能才只是开头

关于软件的未来，Diogo 的判断同样逆着热闹走。

当许多人谈论 AI 会让 SaaS 走向末日，他期待的却是一场反向的 SaaS 末日。

他的观察是，AI 已经这么强，很多软件却仍然像过去一样。区别只是侧边栏多了一个聊天框。

聊天框能回答问题，可企业不敢轻易让它作出真正影响业务的决定。于是软件有了一个能说话的附件，内部流程却没有发生同样大的变化。

如果便宜、可靠的判断能力能深入这些流程，情况就不同了。

那些原本只负责保存、展示和传递信息的软件，可以进一步处理信息，帮助完成更多工作。不是让每个人多聊几轮，而是减少他们必须亲手操作的环节。

现有 SaaS 公司也并非只剩被替代的命运。Diogo 认为，它们恰恰知道客户每天在忙什么，知道哪些重复工作最值得自动化。

当然，这是他的判断，不是已经发生的结果。低价模型不会自动带来好产品，嵌入流程也不等于可靠性难题已经解决。

但这解释了他为什么不满足于再做一个聊天机器人。

他想让 AI 退到软件深处。人们不必不断提醒自己正在使用人工智能，只是发现以前麻烦的事情，现在顺畅了。

到那时，模型的价值也不必靠热搜、演示视频和排行榜反复证明。它会像 VISA 一样，成为大家依赖，却很少专门谈论的设施。

Diogo 说，到了那一天，他就不用再穿粉色西装了。
