跳到正文
原文
elsewhere:文章(RSS)· elsewhere别处发生·· 3 小时前AI 评分68

数据公司为何估值飞涨:给模型做练习题的隐秘生意

数据公司一个个都太神了

AI 导读

作者观察近几个月数据公司成为创投最热赛道,成立不满一年就出现估值25亿美金的 UniPat 和多家估值3-8亿美金的公司,其业务本质是给模型采集专家解题轨迹、搭建 RL environment 做专项训练,类似 AI 时代的猿辅导。

正文

去年此时,有些应用的明星公司被盯得很紧,那时大家觉得它们飞黄腾达得太快,成立一年多就估值几亿美金,好夸张。

但在今年,只能说这些公司瞬间眉清目秀了起来。一批数据公司成立不满一年,就已经诞生了25亿美金的 UniPat ,和若干家估值3-8亿美金的公司。

过去几个月,无论AI应用、硬件、具身,还是世界模型,我都在许多个小范围讨论里感受到了一丝过气。但有一个领域,所有人一提起就都来了兴趣——就是数据公司。

各种都市传说满天飞。这个等有公司拿到了更大的结果,我们再来具体说说。

这些故事总会在每一轮的创投风口轮回上演。不过和以往的创投明星不同,这批数据公司和创始人,是真的渴望低调。

据说 founder 们曾达成过一个默契:只PR技术实力,对团队和业务进展保密。他们对媒体的主要诉求也是求别写。

这行业的确来钱快啊。到处流传着造富美谈,不是二线数商月入400w美金,就是在校生喜提10w月薪。很多数商都在各种场合流露过,拿融资也不是真需要钱,只是要基金的名号吸引人才和客户,要VC里的大哥大姐提供庇护和帮助。当你发现了不为人知的宝藏,当然要衣锦夜行。

这大概也是一级市场最快速的估值增长记录。相比一下, Kimi 是在成立一年时才到达25亿美金;陈冕勤勤恳恳地干了三年,最近才快要完成30亿美金估值融资。

一些数据公司很多会用"连接智能与现实"、"加速 AGI 进程"的大词来阐释业务,但其实一句话就可以概括:给模型制作练习题。有点类似于:AI时代的猿辅导。

而预训练吃的是互联网上公开、静止的数据,但到了一些真实工作场景,模型还做不到优秀打工人的水平,要跟各行各业的专家学,或者做足够的练习。数商做的事就是找问题、想解法、搭环境。要么给模型找名师——采集领域专家的真人解题轨迹,要么给模型出习题——一套包含任务、运行环境和评分准则的 RL environment 。然后交给模厂,用来做单科专项训练。

中国数商还有个较为创新的做法:发 bench 。但此 bench 非彼 bench ,你基本可以理解成一种对模厂的 marketing 手段:你家孩子这门课考得不行哈,你看隔壁家那谁谁是第一名,就是因为做了我们家的练习题。

过去两年,模型公司比的是算力和算法,到了今年,这两件事的边际收益在下降。当流水线已经建成,剩下的区别只在原料——也就是数据,这几乎就是模型此刻唯一重要的事。美国的 Scale AI 和 Surge AI 也是这么火起来的。

这是数据公司估值膨胀到这么夸张的一个原因。但如果只是数据,这些公司也不大可能值这么多钱。

一些数据公司也在讲 Neo Lab 、甚至是一个可能的模型故事:当有了足够多的钱和足够好的 researcher 、能快速补上算法和算力,数商有没有可能成为新的模厂?或者至少,成为模厂分封在某个垂直领域的诸侯?相比一些正在被模型吞吃的应用,这个上限和下限似乎都高多了。

很神奇。几年的时间、上百亿美金的投入,在这个叙事中,模厂的所有积累似乎都可以被轻松跨越。

除去所有故事和技术神秘主义,数据其实更像是一门野生野长的 ToB 生意,数商就像各拼手艺的工作室,还没拉开明显差距。关系,尤其是跟顶级模厂的关系,才是最核心的关窍。

**这是一个信任市场,至今没有公认的验收标准。**因为专业度高、数量太大,前期模厂基本只能靠抽检。比较靠谱的方法是后验:扔到模型里跑一轮,看表现有没有提升。但也发生过这样的事:一个数商把同一批数据交给两家模型公司,一家的模型明显进步,另一家区别不大。

所以模厂对数商的信任是慢慢建立的。先从几十万人民币的小单做起,靠谱再慢慢往上加。行业里疯传的上亿美金大单,其实都是年框合同,分批采购验收,不合格是会被打回的。

不过比起质量,模厂此刻更在意速度和数量。一个共识是:谁能拿到最多数据,谁就能占领更多的垂直领域,这对应的是一个垂直市场的商业价值。宁可泥沙俱下,不可放过错过。于是所有人都在赶时间,一类数据往往不到三个月就会过时;需求文档今天发下来,数商后天就要交货。甚至一些珍贵的、但此刻还不需要的数据,模厂也会愿意买走囤积,以防被对手占领。

**这也是一个信息市场,实力硬不如消息灵。**什么时候需要什么数据的判断,是从金字塔的顶端一层层向下传导的:国内的一线模厂跟着 OpenAI 和 Anthropic 走,二线模厂再跟着一线模厂走。数商如果能比别人更早、更准地获取这些信息,就相当于在股市里获得了内部消息。

比如, GPT-6 Astra 是9月发出来的,但从6月起,就已经有数商在到处打听能搞到 CAD 图纸的门路——他们已经从海外或国内的顶级模厂知道了这个消息,开始准备囤货了。后来 Astra 爆火,建模数据果然也变得昂贵。

**这更是一个油水很足的市场。**愿意给数据预算的模厂里,第一梯队是字节,相传有十几亿美金;阿里、腾讯次之。焦虑落后的蚂蚁、小红书、美团、滴滴们也都有买行业数据的需求。

我曾问一个数商朋友,做好数商最关键的是什么?他毫不犹豫:当然是跟模厂搞好关系。听起来跟 SaaS 这种吃销售的行业很像。但他对此有一个比喻:AGI是神,模厂的 researcher 们是祭司,因为他们掌握着圣经的解释权,所以我等凡人要交什一税,换取他们多透露天机。

这么说我就懂了,数商就是身披神圣祭袍的金牌销售。

围绕着 researcher 的是一个很小的圈子。模厂内部的 researcher 们基本上来自北大、清华、港科、北航……几个定点高校,师兄弟姐妹互相提携。数商和模厂之间,常常就是前同事、同门、同学。这也解释了为什么头部数商的创始人多半出身模厂。

这些看上去如此技术驱动的公司, founder 却往往很有 street smarts 。

江湖传闻中,有邀请众 researcher 看演唱会的;有陪模厂的数据采购人出去游山玩水一个月的;有如 Surge AI 和 Mercor ,请来大量美女销售跟 researcher 打交道的。

信任,当然不止酒肉朋友这么简单。一些没有顶级研究能力的数商之于模厂,理论上还可以扮演另一个角色——体外的自由分身,帮主体承担一些不能、也不便承担的风险。

让我们来做两个假设。

假设你是模型公司,你想蒸馏 OpenAI 和 Anthropic 的模型。但这样合规风险和舆论风险都很大。这时有一个安全的方法:找一个靠谱的小弟,你告诉他数据管线怎么搭,由他 OpenAI 和 Anthropic 的模型跑一遍,再把跑出来的数据返回来。过了一道手,数据就白了。

假设你是一家拥有应用产品的模型公司。这个应用看起来是你的,但把用户数据拿来训模型是违反用户条款的。这时又出现了一个安全的方法:再找一个靠谱的小弟,让他按照你的要求把产品数据爬出来,甚至帮你再清洗一遍,你再去训练。按照你们之间签订的合同,你可以默认对方给到的数据是解决了版权和合规问题的。

这也部分解释了数商们的神秘和顾左右而言他。

Neo Lab 与 street smarts 并存,明星项目和水下交易齐飞,数据真是我见过(除具身外)精彩故事最多的赛道。

不过更精彩的部分倒不在创投和模型公司这两个小圈子里。在堪比石油的数据行业,还有一张更庞大的暗网存在。这个我们节后再说。

封面来源:Edgar Degas, A Cotton Office in New Orleans, 1873, Musée des Beaux-Arts de Pau

来源:elsewhere:文章(RSS) · elsewhere.news