关于 benchmark 中 reasoning_effort 该用 high 还是 max 的讨论

karminski-牙医 · @karminski3 · X·2026-09-15 15:47·20小时前
AI 导读

做 benchmark 不能因其他模型都用 max 就给 DeepSeek 单独用 high 测,评论则认为应该用 high 测。reasoning_effort 被指是厂商营销手段,把算力与精度权衡及计费风险转移给用户,宣称 benchmark 全用 max 跑、甜区在 high,导致有人误以为 high 最好。

karminski-牙医@karminski3
35AI 编辑部评分,满分 100

关于 benchmark 中 reasoning_effort 该用 high 还是 max 的讨论

2026-09-15 15:47· 20小时前
AI 导读

做 benchmark 不能因其他模型都用 max 就给 DeepSeek 单独用 high 测,评论则认为应该用 high 测。reasoning_effort 被指是厂商营销手段,把算力与精度权衡及计费风险转移给用户,宣称 benchmark 全用 max 跑、甜区在 high,导致有人误以为 high 最好。

问题在于我做的是 benchmark, 不是日常使用. 不能因其他模型都用max然后deepseek high 好单独用high测.

然后评论说应该用high测.

以及, reasoning_effort 在我看来是大模型厂商的营销手段. 把算力与精度的权衡交给了用户, 顺便把算力计费的风险也转移给了用户. 而且巧妙地进行掩饰: 宣称benchmark全是max跑出来的. 最后又说甜区(注意论文里称作cost–performance balance) 在high.

造成的结果就是, 有人认为high就是最好的.

我当然同意 thinking effort 不等价于 performance. 而且我认为之所以不等价是因为后训练拉了. 理想上应该追求让它等价.

但请注意, deepseek-v4-1-flash技术报告里给max评价为: best reserved for the most challenging tasks.

Yuu💖不太喜欢原推这种将 benchmark 分数类比为赛车性能的隐喻,这将问题过度简单化了,丢失了一个事实,即 thinking effort 不等价于 performance 而且不得不承认 max 所获得的往往只是 benchmark 上的边际收益,日常使用完全没必要开 max 这一点吧 而且我们也早已见过 5.6-s...

来源:karminski-牙医· x.com