说个暴论,大模型过去几年至少一半的结构化调用,算力都花在表演写字上, 一个开源项目用MLX把这层窗户纸捅破了,一次前向传播读完所有字段,1669毫秒变295毫秒,0.3秒,在轻薄本上。
前天融资 4000 万美元的决策基座刚发布,然后开源社区就用一行没重新训练的 1B 模型,在苹果笔记本上把结构化推理压到了 0.3 秒以内。
全网都在把这件事当成爽剧看,但多数人看错了重点:与其说是小模型打败了大团队,不如说是大模型被当成打字机用了这么多年,终于有人把这个拧巴的习惯改过来了哈哈😄
以前让模型填表或做选择题,业界默认走自回归路线:模型得像个打字机一样,把大括号、双引号、键值对一个词一个词往外吐。不仅两秒钟才能走完,中途还经常格式跑偏。
真正的转变不是重训基座,而是把文本生成换回单次前向概率评估。
这个基于苹果 MLX 框架做出的 Qwen-2.5-1B-RLCD 项目,核心思路极其克制:基础模型本身就拥有同时计算多个类别概率的能力。他直接在一次前向传播中,同时提取 JSON 模板里每一个字段的候选置信度。
耗时从 1669 毫秒压到了 295 毫秒,格式自然对齐,而且全流程跑在一台轻薄本上。
比较克制的一点是,这种工程解法只能应付候选集清晰的分类和固定提取,遇到开放式逻辑链和超大规模动态图,闭源架构依然有它深水区的积累。
但它给所有开发者提了个醒: 很多时候困住我们的不是算力,而是路径依赖。 当大家习惯给简单任务套上复杂的生成管道时,哪怕只把底层的概率提取往前挪半步,就能省下大把冤枉算力。 https://x.com/harshagundal/status/2100044305536889015/video/1