按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)Baseten Base Labs 实验研究蒸馏何时有助于强化学习
AI 导读
Baseten Base Labs 发布研究,用 Qwen3 的 0.6B、1.7B、4B、8B 模型比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL,覆盖十六个推理任务。
Baseten Base Labs:模型研究
51
AI 编辑部评分,满分 100Baseten Base Labs 实验研究蒸馏何时有助于强化学习
Baseten Base Labs 发布研究,用 Qwen3 的 0.6B、1.7B、4B、8B 模型比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL,覆盖十六个推理任务。
来源:Baseten Base Labs:模型研究· labs.baseten.co