跳到正文
原文
Meta AI:Research Blog(网页)·· 2026-04-08精选AI 评分80

Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型

Introducing Muse Spark: Scaling Towards Personal Superintelligence

AI 导读

Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线并开放部分用户的私有 API 预览。

推荐理由

官方发布给出基准成绩与三条扩展轴的技术细节,读者可以了解其相对 Llama 4 Maverick 的效率变化和安全评估结论。

正文 · AI 翻译

今天,我们非常激动地推出 Muse Spark,这是 Meta Superintelligence Labs 开发的 Muse 系列模型中的首个模型。Muse Spark 是一个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排。

Muse Spark 是我们扩展阶梯上的第一步,也是我们从头彻底改革 AI 工作的首个成果。为了支持进一步的扩展,我们正在整个技术栈上进行战略投资——从研究和模型训练到基础设施,包括 Hyperion 数据中心。

在本文中,我们将首先探索 Muse Spark 的新能力和应用。在这些成果之后,我们将揭开帷幕,看看推动我们迈向个人超级智能的扩展轴。

Muse Spark 今天已在 meta.ai 和 Meta AI 应用中提供。我们正在向部分用户开放私有 API 预览。

面向个人超级智能的能力

Muse Spark 在多模态感知、推理、健康和智能体任务方面提供了具有竞争力的性能。我们继续投资于当前存在性能差距的领域,例如长时程智能体系统和编码工作流。

随着更大规模的模型正在开发中,这些结果表明我们的技术栈正在有效扩展。

我们还发布了 Contemplating 模式,它编排多个智能体并行推理。这使 Muse Spark 能够与 Gemini Deep Think 和 GPT Pro 等前沿模型的极限推理模式竞争。Contemplating 模式在挑战性任务上提供了显著的能力提升,在 Humanity's Last Exam 中达到 58%,在 FrontierScience Research 中达到 38%。

应用

Muse Spark 是迈向理解你世界的个人超级智能的第一步。从分析你的即时环境到支持你的健康,Muse Spark 的高级推理能力实现了强大且高度个性化的用例。

多模态。Muse Spark 从头构建,以跨领域和工具整合视觉信息。它在视觉 STEM 问题、实体识别和定位方面取得了强劲表现。这些能力结合在一起,实现了互动体验,例如创建有趣的小游戏或通过动态标注排查家用电器故障。

健康。个人超级智能的一个主要应用是帮助人们了解和改善健康。为了提高 Muse Spark 的健康推理能力,我们与 1,000 多名医生合作,策划训练数据,以实现更符合事实且全面的回答。Muse Spark 可以生成互动展示,解析和解释健康信息,例如各种食物的营养成分或运动时激活的肌肉。

扩展轴

为了构建个人超级智能,我们模型的能力应当可预测且高效地扩展。下面,我们分享我们如何沿着三个轴研究和追踪 Muse Spark 的扩展特性:预训练、强化学习和测试时推理。

预训练。预训练阶段是 Muse Spark 获得其核心多模态理解、推理和编码能力的阶段——这是强化学习和测试时计算所依赖的基础。

在过去九个月里,我们重建了预训练技术栈,对模型架构、优化和数据整理进行了改进。这些进步共同提升了我们能够从每单位算力中提取的能力。为了严格评估我们的新配方,我们对一系列小模型拟合了缩放定律,并比较达到特定性能水平所需的训练 FLOPs。结果很明确:与我们的前代模型 Llama 4 Maverick 相比,我们能用少一个数量级以上的算力达到相同的性能。这一改进也使 Muse Spark 比可供比较的领先基础模型显著更高效。

强化学习。 预训练之后,强化学习(RL)利用算力以可扩展的方式放大模型能力。尽管大规模 RL 以不稳定著称,我们的新技术栈仍能带来平滑、可预测的提升。

下图展示了为 Muse Spark 扩展 RL 算力(以步数衡量)带来的收益。左图中,我们看到训练数据上 pass@1 和 pass@16(16 次尝试中至少成功一次)呈对数线性增长。这表明 RL 在提升模型可靠性的同时并未损害推理多样性。右图中,在留出评估集上的准确率增长表明 RL 带来的收益可预测地泛化:Muse Spark 在训练中未见过的任务上也能平稳提升。

测试时推理。 RL 训练我们的模型在回答之前先“思考”——这一过程被称为测试时推理。要为数十亿用户提供这一能力,需要高效使用推理 token。为此,我们依靠两个关键手段:思考时间惩罚以优化 token 使用,以及多智能体编排以在不拖慢响应时间的情况下提升性能。

为了在每个 token 上提供最大智能,我们的 RL 训练在思考时间惩罚的约束下最大化正确性。在 AIME 等部分评估上,这引发了相变。在模型通过思考更久而提升的初始阶段之后,长度惩罚引发了思维压缩——Muse Spark 压缩其推理过程,用显著更少的 token 解决问题。压缩之后,模型再次扩展其解答以取得更强性能。

为了在不大幅增加延迟的情况下投入更多测试时推理,我们可以扩展并行智能体的数量,让它们协作解决难题。下图展示了这一方法的收益。标准测试时扩展让单个智能体思考更久,而用多智能体思维扩展 Muse Spark 则能在可比延迟下实现更优性能。

安全性

Muse Spark 在双用途科学领域具有广泛的推理能力,因此我们在部署前进行了大量安全评估。我们的流程遵循更新后的 Advanced AI Scaling Framework,该框架为我们最先进的模型定义了威胁模型、评估协议和部署阈值。我们在应用安全缓解措施前后,针对前沿风险类别、行为对齐和对抗鲁棒性对 Muse Spark 进行了评估。

我们发现,Muse Spark 在生物和化学武器等高风险领域表现出强烈的拒绝行为,这得益于预训练数据过滤、以安全为重点的后训练以及系统级防护措施。在网络安全和失控领域,Muse Spark 并未展现出实现威胁场景所需的自主能力或危险倾向。我们的评估显示,鉴于其部署环境,Muse Spark 在我们测量的所有前沿风险类别中均处于安全范围内。完整结果见我们的安全与准备报告。

在针对接近发布版本的检查点进行的第三方评估中,Apollo Research 发现,Muse Spark 在他们观察过的模型中表现出最高的评估意识率。该模型经常将场景识别为“对齐陷阱”,并推理认为它应该诚实表现,因为它正在被评估。这一点很重要,因为能够识别评估情境的模型在测试期间的行为可能与部署时不同。然而,这些结果并不能确认这种意识会直接改变行为,我们自己的后续调查发现了初步证据,表明评估意识可能会在一小部分对齐评估中影响模型行为,而这些评估均与影响模型发布决策的危险能力或倾向无关。我们得出结论,这不是发布的阻碍性问题,但值得进一步研究。更多内容请阅读我们的安全与准备报告。

结论

借助 Muse Spark,我们正走在一条可预测且高效的扩展轨迹上。我们期待在通往个人超级智能的道路上很快分享能力日益强大的模型。

来源:Meta AI:Research Blog(网页) · ai.meta.com