返回
AI 评分 51/100

Baseten Base Labs 实验研究蒸馏何时有助于强化学习

Baseten Base Labs:模型研究·2026-09-24 02:41·3小时前
AI 导读

Baseten Base Labs 发布研究,用 Qwen3 的 0.6B、1.7B、4B、8B 模型比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL,覆盖十六个推理任务。

Baseten Base Labs:模型研究
51AI 编辑部评分,满分 100

Baseten Base Labs 实验研究蒸馏何时有助于强化学习

2026-09-24 02:41· 3小时前
AI 导读

Baseten Base Labs 发布研究,用 Qwen3 的 0.6B、1.7B、4B、8B 模型比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL,覆盖十六个推理任务。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:Baseten Base Labs:模型研究· labs.baseten.co