# 开源项目 Qwen-2.5-1B-RLCD 用 MLX 一次前向传播读 JSON，端侧推理从 1669 毫秒压到 295 毫秒

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-19 11:10
- AIHOT 分数：65
- AIHOT 链接：https://aihot.news/items/cmu7u9nj30qvdrogr08gs32ps
- 原文链接：https://x.com/AYi_AInotes/status/2101146883263533322

## AI 摘要

开源项目 Qwen-2.5-1B-RLCD 基于苹果 MLX 框架，无需重新训练，在一次前向传播中同时提取 JSON 模板各字段的候选置信度，端侧结构化推理耗时从 1669 毫秒压到 295 毫秒，已在 Hugging Face 开源。作者认为此举把文本生成换回单次概率评估，但该解法只适合候选集清晰的分类和固定提取，开放式逻辑链和超大规模动态图仍是闭源架构的优势。

## 正文

说个暴论，大模型过去几年至少一半的结构化调用，算力都花在表演写字上，
一个开源项目用MLX把这层窗户纸捅破了，一次前向传播读完所有字段，1669毫秒变295毫秒，0.3秒，在轻薄本上。

前天融资 4000 万美元的决策基座刚发布，然后开源社区就用一行没重新训练的 1B 模型，在苹果笔记本上把结构化推理压到了 0.3 秒以内。

全网都在把这件事当成爽剧看，但多数人看错了重点：与其说是小模型打败了大团队，不如说是大模型被当成打字机用了这么多年，终于有人把这个拧巴的习惯改过来了哈哈😄

以前让模型填表或做选择题，业界默认走自回归路线：模型得像个打字机一样，把大括号、双引号、键值对一个词一个词往外吐。不仅两秒钟才能走完，中途还经常格式跑偏。

真正的转变不是重训基座，而是把文本生成换回单次前向概率评估。

这个基于苹果 MLX 框架做出的 Qwen-2.5-1B-RLCD 项目，核心思路极其克制：基础模型本身就拥有同时计算多个类别概率的能力。他直接在一次前向传播中，同时提取 JSON 模板里每一个字段的候选置信度。

耗时从 1669 毫秒压到了 295 毫秒，格式自然对齐，而且全流程跑在一台轻薄本上。

比较克制的一点是，这种工程解法只能应付候选集清晰的分类和固定提取，遇到开放式逻辑链和超大规模动态图，闭源架构依然有它深水区的积累。

但它给所有开发者提了个醒：
很多时候困住我们的不是算力，而是路径依赖。
当大家习惯给简单任务套上复杂的生成管道时，哪怕只把底层的概率提取往前挪半步，就能省下大把冤枉算力。 https://x.com/harshagundal/status/2100044305536889015/video/1

### 引用推文

> Harsha Gundala：They were building in stealth for 2 years, I was building in stealth for 2 hours… Happy to open source Qwen-2.5-1B-RLCD, 5x faster on-device inference for JSON ...
