https://x.com/i/article/2102764478530252800
Jev:离开 OpenAI 后,他做了一个不跟人聊天的 AI
一个参与过 InstructGPT 的人,为什么离开 OpenAI,去做一个不跟人聊天的模型。
Jev 发布后,Diogo Almeida 来到 Latent Space 的演播室。主持人 swyx 问他,现在感觉怎么样。
他的回答分成两半。
身体和情绪,糟透了。事情太多,他是个技术型 CEO,到处都有火要灭。可另一半,他兴奋得不行。他觉得自己念叨了好多年的事情,开发者终于听懂了。
他甚至闹了个笑话。他在 Twitter 上发帖,感叹三个热搜都是自己。有人提醒,那只是他的个人信息流。
这个不太会看热搜的人,有一个很不符合热搜气质的愿望。
他想把自己的公司做得像 VISA 一样无聊。到了那一天,大家照常生活,不必想起他的模型,他也不用再穿粉色西装。
不过,要走到那个未来,他先得反对眼前不少热闹的东西。
本文依据 Latent Space 的 swyx 对话 TypeSafe 联合创始人兼 CEO Diogo Almeida 的对谈记录。文中有关行业、公司和技术路线的评价,均按嘉宾个人观点呈现,不等于独立验证的结论。
一、他参与造出了好学生,却开始怀疑考试
Diogo 不是站在场外批评聊天模型的人。
在 OpenAI,他参与过 InstructGPT 和指令遵循方向的早期工作。按他的回忆,为了让早期版本尽快上线,他甚至用过自己写的、没有公开的训练算法。当时他的想法很直接:这东西太好用了,必须赶紧交到用户手里。
他也欣赏早期 ChatGPT 团队。他们在做一件 AI 研究员往往不擅长的事:死抠产品体验。
但后来,一个反差越来越刺眼。
模型看起来那么聪明,真正落地的用途却大量集中在写文案。它能给出令人惊叹的回答,很多基础、机械、枯燥的工作却仍然离不开人。
他开始回头审视自己参与推动的方向,RLHF。
这个缩写听着复杂,直白地说,就是用人的反馈来训练模型,让人更喜欢它的回答。这当然带来了进步,但 Diogo 怀疑,讨人喜欢和帮助人做对事情,并不总是一回事。
流畅、自信、说得头头是道,容易得到好评。说出罕见的可能性,承认自己拿不准,却未必那么讨喜。
按他的解释,训练可能让模型压低那些不常见的答案,偏向更熟悉、更稳妥的表达。它看上去更会说话了,输出的概率却未必更忠实于不确定性。这涉及两个相关但不同的问题:模式丢失,以及校准失真。
对普通人来说,不必记住术语。记住这个区别就够了:
你觉得它说得对,和它真的判断得对,是两回事。
Diogo 想要的不是一个永远显得很懂的模型。他想要的是,它在没把握的时候,不要把自己包装成很有把握。
二、Sam 说很好,但公司仍然朝另一个方向走
真正改变他的,是一个很简单的倒推。
假如 AI 最终承担了大量有经济价值的工作,那么调用 AI 的,主要会是人,还是代码。
他的答案是代码。
一个人一天能问多少次。一个程序一旦运行起来,可以不停地处理信息、作出判断,再把结果传给下一个程序。
可他看到的优化方向,几乎全都朝着人。怎样让回答更好听,怎样让对话更自然,怎样把 ChatGPT 放进更多东西里。
他把想法写成文档,找 Sam 聊。按他的回忆,Sam 觉得这个想法很好,让他去做。
所以,这不是一个老板听不懂天才的故事。
困难在于,赞成一个想法,和让一个组织围绕它工作,是不同的事。Diogo 想要给程序用的智能,身边讨论的却仍是怎样把聊天产品做得更好。
这种分歧会落到极小的接口细节上。他希望开发者能直接调整某个函数被选择的倾向,拿到类似概率或置信度的控制手段。可现实中,开发者往往只能往提示词里多写几句,恳求模型多用这个工具、少用那个工具。
他受不了这种感觉。
程序员本该拿到一个能控制的接口,却像在劝说一位不太听话的同事。
后来,他去找其他公司,讨论能不能为这个方向建立一个实验室。他问,在大公司里做和自己创业,哪一个更快。对方告诉他,创业更快。
他决定离开。
有趣的是,他原本以为这个项目一周就能做完。后来花了好多年。访谈里,他为自己当初的轻率向 OpenAI 的同事道歉。
三、不是再造一个天才,而是把直觉接到代码上
离开之后,他造出来的东西叫 Jev。
它不是聊天机器人。Diogo 更愿意叫它 System One,系统一模型,也叫大型可编程模型。
可以把系统一粗略理解为直觉式判断。不是坐下来写一长串推理,而是面对一份信息,迅速识别、分类、比较,判断该走哪一步。
直觉不等于死板的条件反射。它仍然需要理解语境,只是不必把思考过程写成一篇文章。
Diogo 认为,这正是语言模型已经拥有、却没有被充分利用的能力。
他的目标不是让 Jev 包办所有难题。他承认,有些任务它就是做不好。有时,聪明的答案应该是低置信度,甚至是不知道。系统一的边界也不是命名时画好的一条线,要靠实际使用去摸索。
关键是,软件里有太多地方,并不需要一个长篇大论的天才。
它需要从几个选项里挑一个,需要排一下顺序,需要判断一个条件是否成立。Jev 把这些能力做成代码可以直接使用的输出。
于是,软件的组织方式也可能跟着变。
过去,我们把一大堆材料和要求塞进提示词,让一个大模型从头做到尾。Diogo 希望把这团东西重新拆开:代码管理流程,模型在需要理解和判断的地方介入。
他尤其讨厌巨型系统消息。那像一个什么都往里装的全局变量。你写上不能读取某个目录、不能泄露密钥,再寄希望于模型一直记住。
他的主张更朴素:该用程序限制的,就用程序限制;必须依靠智能判断的,就拆成清楚的小问题,分别测试。
不是把整个软件交给 AI,而是让软件的每个必要环节,都能用上 AI。
四、一个名字,藏着一门反直觉的生意
Jev 这个名字,来自杰文斯悖论。
它讲的是一种反直觉的可能:资源用起来越高效,单次使用越省,总消耗反而可能上升。
原因不神秘。便宜之后,原本用不起的人开始用了,原本不值得做的事也开始做了。只要新增需求足够大,就会超过效率提升带来的节省。
这不是说降价一定能带来更多收入。它有一个前提:价格下降后,真的会释放出足够多的新需求。
Diogo 把这个判断放进了模型的名字。
他的目标不是单纯替客户省下一点今天的 AI 账单。他想让智能便宜到一种程度,使人开始在过去根本不会考虑的地方调用它。
但便宜还不够。
他反复强调一个指标:单位美元智力。说白了,一块钱到底买到了多少有用的判断能力。
一个模型即使便宜得惊人,如果做出的判断不能用,也没有意义。反过来,一个模型偶尔能展示惊人的聪明,但太贵、太慢、不稳定,也很难成为软件里随处可用的零件。
所以他要的是便宜又可靠。
实时场景还多一层要求:快。按他的解释,如果一次判断耗时减半,同样的等待时间里就能多做一次判断,或者把两次判断串起来。这时速度不只是等待体验,它会改变产品能做什么。
Jev 这个看着随意的名字,实际上给团队定了一条纪律:能力提高了,性价比也得站得住。
五、别拿成绩单来,让它去值夜班
融资时,投资人想看跑分。
Diogo 不愿意按这套方式证明自己。按他的回忆,这让融资吃了不少苦头。
他对公开评测的态度很激烈。问题不只是有人会作弊,而是只要一个分数成了目标,整个组织就会围着它转。即使没有直接拿考题训练,也可以大量寻找长得像考题的数据。
最后,大家都在变得更会考试。
他不是反对测量。TypeSafe 自己也做内部评测,否则无法判断不同成本下,哪个模型更好。他反对的是把一个公开分数,变成智能的替身。
在他看来,真正重要的评测发生在工作流里。把它放到你要解决的事情里,看它在哪些情况下会错,概率能不能信,能否长期稳定地运行。
公开榜单问它考得多好,工作流评测问你敢不敢把活交给它。
他举过一种很小的测试:往提示词里加一个没有实际意义的 UUID,也就是一串标识符。问题的意思没有改变,答案就不该因此大幅变化。
这比同一个问题问两次得到同一个答案,更接近他在意的可靠性。现实里的输入总会稍有不同,模型不能一碰到无关变化就失常。
他对业务的观察也类似。有人来试几次,不能让他特别兴奋。真正让他兴奋的是,大半夜仍有程序持续调用。
那意味着有人开始把它放进后台,让它值夜班。
当然,反对刷榜并不能替代证明。Jev 在客户自己的任务里是否足够可靠,仍然需要一项项测出来。Diogo 自己也承认,模型还会犯很多错,离像数据库一样让人放心,尚有很长的路。
六、他不要你的训练数据,却想处理你舍不得处理的数据
谈到数据,Diogo 说了一句很反行业惯性的话。
即使可以要求用户交出数据,他们也不想拿它来训练。
他的理由是,真实世界的数据偏差太大。大量用户反复问同样的问题,模型就可能越来越擅长最常见的那一小片,而忽略其他地方。
如果目标是服务今天的热门需求,这也许有效。但他想做的是未来的软件基础设施,要接住那些今天还没人想到的用途。
在他的判断里,即使拿到了当下所有数据,也可能只是把模型训练得更适应当下。
因此,他很看重合成训练数据。但不是随便让另一个模型生成一堆文本。任务是什么、能力缺口在哪里、如何覆盖那些少见却重要的情况,都需要有人细细设计。
他把这些数据人员比作艺术家,也比作做手术的人。他们寻找模型能力参差不齐的地方,然后尝试修补。
而在客户一侧,他特别看好另一类数据:暗数据,dark data。
这是企业已经积攒下来,却因为分析成本太高而没有充分利用的数据。过去,拿大模型把它们全部跑一遍,账单太吓人。判断能力足够便宜之后,这些数据才可能被重新拿出来处理。
这里有个容易混淆的区别。
合成数据是他拿来训练模型的。暗数据是客户希望模型去处理的。
他不是要用暗数据替代用户数据训练。恰恰相反,他想先把一个通用模型做好,再让客户拿它处理各自的材料。
七、用户说不需要,后来又来借 GPU
创业初期,有一段日子很不体面。
按 Diogo 的回忆,上线前几乎没有营收。团队里的非技术人员很担心,觉得大家根本听不懂他们在卖什么。
它像维生素,不像止痛药。
试用者里,有一半以上没理解这个东西。理解的人觉得很酷,接着又问,公司采购流程怎么走。
于是,那个创业者熟悉的词出现了:PMF,产品与市场的匹配。
照当时的反馈看,他们似乎还离它很远。
发布之后,反馈却突然变了。开发者开始做出团队自己都没想到的用法。有人要求更高的调用额度,甚至提出能不能借 GPU 给他们,因为现有算力不够用。
这让 Diogo 开始质疑对 PMF 的某些理解。
东西在那里,市场也在那里。但在有人把可能性做出来之前,很多人没办法回答它对自己有什么用。
对于一种新的基础能力,需求未必会以完整、清晰的句子,提前出现在用户访谈里。有人先用它做出东西,别人才认出来,原来自己也需要。
这段经历不等于用户反馈无用,更不意味着每个没人买的产品都藏着巨大市场。
它更像一个提醒:有时用户不买账,是产品不行;有时,是新能力还没有变成一个人们看得懂的用途。两者很难区分,Diogo 也说自己当时非常害怕。
八、刚开了一家实验室,他就劝别人别开实验室
swyx 问他,会怎样建议那些在大公司里拿不到资源、感到沮丧的研究员。
照这个故事的发展,他应该鼓励大家勇敢出走。
但他没有。
他反而批评了许多 neo lab,也就是新成立的 AI 实验室。他觉得其中不少团队没有清晰方向,只是想拿一笔钱,继续做研究。重新搭一遍大实验室已有的东西,真正推进前沿的机会却未必有多大。
他的区分不在于创业还是打工,而在于有没有一个值得坚持的任务。
如果只是想自由地做实验,大实验室可能更合适。如果有一个明确、重要、现有组织又不愿全力去做的方向,那就应该出来做。
这也是他对自己的解释。
他并不喜欢初创公司,从没想过当 CEO,也无法想象有人愿意创业第二次。刚开始融资,有投资人问他崇拜哪些 CEO,他甚至不理解自己为什么要崇拜那些人。
他离开,是因为想把一件事做到底,而不是因为想拥有一家实验室。
从这个角度看,他对研究员光环的冷淡并不矛盾。他需要研究员,但更在意他们究竟想解决什么。
九、他想保持纯粹,却已经不能只写代码
访谈后半段,话题转向安全、监管和政治。
Diogo 明显不舒服。
他担心的是,技术圈为了一个自认为正确的大局,开始把不确定的判断说得过于确定,再借助权威说服公众接受。
他不愿那样做。他知道公司变大后,有些事情可能躲不开,但仍想尽量保持一个纯粹的技术人。
这种纯粹,在他的叙述里,也体现在很具体的选择上。
发布最忙的时候,他仍想留出精力和开发者社区说话。对他来说,如果密密麻麻的日程里只有重要人物,没有实际使用产品的人,会很不自在。
他也请听众监督自己。不要等公司做大,转身只顾大客户,把最早支持他的开发者放到一边。
但纯粹不代表这家公司由他一个人说了算。
访谈里,他反复提到自己写了文章,团队还没让发;有些东西想公开,得先让同事看。他甚至说,员工并不怎么表现出对他的尊敬,会拿他开玩笑,他把这当成好文化的标志。
这个到处爆粗口、说自己品牌是混乱的人,也在学习一件很普通的事:放权。
他想守住技术人的原则,却必须学会不再只做一个技术人。
十、SaaS 不一定会死,聊天框可能才只是开头
关于软件的未来,Diogo 的判断同样逆着热闹走。
当许多人谈论 AI 会让 SaaS 走向末日,他期待的却是一场反向的 SaaS 末日。
他的观察是,AI 已经这么强,很多软件却仍然像过去一样。区别只是侧边栏多了一个聊天框。
聊天框能回答问题,可企业不敢轻易让它作出真正影响业务的决定。于是软件有了一个能说话的附件,内部流程却没有发生同样大的变化。
如果便宜、可靠的判断能力能深入这些流程,情况就不同了。
那些原本只负责保存、展示和传递信息的软件,可以进一步处理信息,帮助完成更多工作。不是让每个人多聊几轮,而是减少他们必须亲手操作的环节。
现有 SaaS 公司也并非只剩被替代的命运。Diogo 认为,它们恰恰知道客户每天在忙什么,知道哪些重复工作最值得自动化。
当然,这是他的判断,不是已经发生的结果。低价模型不会自动带来好产品,嵌入流程也不等于可靠性难题已经解决。
但这解释了他为什么不满足于再做一个聊天机器人。
他想让 AI 退到软件深处。人们不必不断提醒自己正在使用人工智能,只是发现以前麻烦的事情,现在顺畅了。
到那时,模型的价值也不必靠热搜、演示视频和排行榜反复证明。它会像 VISA 一样,成为大家依赖,却很少专门谈论的设施。
Diogo 说,到了那一天,他就不用再穿粉色西装了。