DeepSeek R1 长思考与蒸馏小模型往事回顾

karminski-牙医 · @karminski3 · X·2026-09-14 17:52·11小时前
AI 导读

DeepSeek R1 长思考表现从 71.0% 飙升至 86.7%,并将 R1 生成的长思维链蒸馏到 Qwen-1.5B、7B、14B 小模型,运行时给足思考预算后解题能力随思考长度正相关暴涨。作者借此回顾去年 ollama 将 deepseek-r1-distilled-qwen-7b 当作 deepseek 装到用户电脑上的事件。

karminski-牙医@karminski3
29AI 编辑部评分,满分 100

DeepSeek R1 长思考与蒸馏小模型往事回顾

2026-09-14 17:52· 11小时前
AI 导读

DeepSeek R1 长思考表现从 71.0% 飙升至 86.7%,并将 R1 生成的长思维链蒸馏到 Qwen-1.5B、7B、14B 小模型,运行时给足思考预算后解题能力随思考长度正相关暴涨。作者借此回顾去年 ollama 将 deepseek-r1-distilled-qwen-7b 当作 deepseek 装到用户电脑上的事件。

请读完了Section 2后继续看Section 3 . 明确写了模型在长思考时的表现. 当时震撼人心的继续从71.0% 飙升到 86.7% 就是这么来的. 然后将 R1 生成的长思维链蒸馏到了小模型( Qwen-1.5B、7B、14B)。在运行时给足其思考预算,然后解题能力就呈现出与思考长度正相关的暴涨。这不就是去年的新闻嘛....怎么还能记不住呢....然后就ollama把deepseek-r1-distilled-qwen-7b 当deepseek给大家装到电脑上了, 美其名曰运行deepseek. 有印象没? 串起来了吧?

家有一头牛@karminski3 R1-Zero是训练侧,别拿来证明推理开max更优;预算超任务复杂度就会掉分。

来源:karminski-牙医· x.com