开源项目 Qwen-2.5-1B-RLCD 用 MLX 一次前向传播读 JSON,端侧推理从 1669 毫秒压到 295 毫秒

AYi · @AYi_AInotes · X·2026-09-19 11:10·2小时前
AI 导读

开源项目 Qwen-2.5-1B-RLCD 基于苹果 MLX 框架,无需重新训练,在一次前向传播中同时提取 JSON 模板各字段的候选置信度,端侧结构化推理耗时从 1669 毫秒压到 295 毫秒,已在 Hugging Face 开源。作者认为此举把文本生成换回单次概率评估,但该解法只适合候选集清晰的分类和固定提取,开放式逻辑链和超大规模动态图仍是闭源架构的优势。

AYi@AYi_AInotes
65AI 编辑部评分,满分 100

开源项目 Qwen-2.5-1B-RLCD 用 MLX 一次前向传播读 JSON,端侧推理从 1669 毫秒压到 295 毫秒

2026-09-19 11:10· 2小时前
AI 导读

开源项目 Qwen-2.5-1B-RLCD 基于苹果 MLX 框架,无需重新训练,在一次前向传播中同时提取 JSON 模板各字段的候选置信度,端侧结构化推理耗时从 1669 毫秒压到 295 毫秒,已在 Hugging Face 开源。作者认为此举把文本生成换回单次概率评估,但该解法只适合候选集清晰的分类和固定提取,开放式逻辑链和超大规模动态图仍是闭源架构的优势。

说个暴论,大模型过去几年至少一半的结构化调用,算力都花在表演写字上, 一个开源项目用MLX把这层窗户纸捅破了,一次前向传播读完所有字段,1669毫秒变295毫秒,0.3秒,在轻薄本上。

前天融资 4000 万美元的决策基座刚发布,然后开源社区就用一行没重新训练的 1B 模型,在苹果笔记本上把结构化推理压到了 0.3 秒以内。

全网都在把这件事当成爽剧看,但多数人看错了重点:与其说是小模型打败了大团队,不如说是大模型被当成打字机用了这么多年,终于有人把这个拧巴的习惯改过来了哈哈😄

以前让模型填表或做选择题,业界默认走自回归路线:模型得像个打字机一样,把大括号、双引号、键值对一个词一个词往外吐。不仅两秒钟才能走完,中途还经常格式跑偏。

真正的转变不是重训基座,而是把文本生成换回单次前向概率评估。

这个基于苹果 MLX 框架做出的 Qwen-2.5-1B-RLCD 项目,核心思路极其克制:基础模型本身就拥有同时计算多个类别概率的能力。他直接在一次前向传播中,同时提取 JSON 模板里每一个字段的候选置信度。

耗时从 1669 毫秒压到了 295 毫秒,格式自然对齐,而且全流程跑在一台轻薄本上。

比较克制的一点是,这种工程解法只能应付候选集清晰的分类和固定提取,遇到开放式逻辑链和超大规模动态图,闭源架构依然有它深水区的积累。

但它给所有开发者提了个醒: 很多时候困住我们的不是算力,而是路径依赖。 当大家习惯给简单任务套上复杂的生成管道时,哪怕只把底层的概率提取往前挪半步,就能省下大把冤枉算力。 https://x.com/harshagundal/status/2100044305536889015/video/1

Harsha GundalaThey were building in stealth for 2 years, I was building in stealth for 2 hours… Happy to open source Qwen-2.5-1B-RLCD, 5x faster on-device inference for JSON ...