按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)Prime Intellect 发布 INTELLECT-2,32B 推理模型通过全球分布式强化学习训练
AI 导读
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。
Prime Intellect(网页)
精选
66
AI 编辑部评分,满分 100Prime Intellect 发布 INTELLECT-2,32B 推理模型通过全球分布式强化学习训练
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。
推荐理由
原文给出分布式异步 RL 的完整基础设施与训练配方细节,并开源模型、代码和数据,读者可以了解去中心化训练的可行路径。
来源:Prime Intellect(网页)· primeintellect.ai