跳到正文
Hugging Face:Blog·· 2025-05-21精选AI 评分60

TII 发布 Falcon-H1 系列混合架构开源模型,覆盖 0.5B 至 34B

Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance

AI 导读

TII 的 Falcon LLM 团队发布 Falcon-H1 系列,共六个开源模型(0.5B、1.5B、1.5B-Deep、3B、7B、34B),均有 base 与 instruct 版本。

推荐理由

原文给出六个尺寸开源模型的混合架构设计、长上下文与吞吐数据,读者可据此评估其替代现有模型的可行性。

正文 · AI 翻译

Image 1: Hugging Face's logoHugging Face


返回文章

Falcon-H1:重新定义效率与性能的混合头语言模型家族

团队文章

发布于 2025 年 5 月 21 日

- [x] 点赞 40

  • Image 2
  • Image 3
  • Image 4
  • Image 5
  • Image 6
  • Image 7
  • +34

Image 8: Jingwei Zuo's avatar

Jingwei Zuo JingweiZuo 关注

Image 9: Technology Innovation Institute's avatartiiuae

Image 10: Maksim Velikanov's avatar

Maksim Velikanov yellowvm 关注

Image 11: Technology Innovation Institute's avatartiiuae

Image 12: Ilyas Chahed's avatar

Ilyas Chahed IChahed 关注

Image 13: Technology Innovation Institute's avatartiiuae

Image 14: Younes B's avatar

Younes B ybelkada 关注

Image 15: Technology Innovation Institute's avatartiiuae

Image 16: Rhaiem's avatar

Rhaiem DhiyaEddine 关注

Image 17: Technology Innovation Institute's avatartiiuae

Image 18: Falcon LLM TII UAE's avatar

Falcon LLM TII UAE FalconLLM 关注

Image 19: Technology Innovation Institute's avatartiiuae

Image 20: image/png

引言

也请查看我们的官方博客文章

Image 21: image/png

今天,我们自豪地推出 Falcon-H1 系列,这是一组包含六个开源模型的集合,参数规模从 0.5B 到 34B 不等,每个模型均提供基础版和指令微调版。这些模型的核心是一种混合架构,它将经典的基于 Transformer 的注意力机制的优势与以卓越的长上下文记忆和计算效率著称的状态空间模型(SSM)相结合。这一架构创新进一步得益于训练动态和数据利用方面的根本性进步,使 Falcon-H1 模型能够在所有覆盖的规模层级上提供不妥协的性能,与顶级的基于 Transformer 的模型相媲美。

在本次发布中,我们推出了六个开放权重模型:0.5B、1.5B、1.5B-Deep、3B、7B 和 34B,以及它们的指令版本。我们所有的开源模型均采用基于 Apache 2.0 的宽松许可证。

模型规模 基础模型 指令模型
0.5B 🤗 Falcon-H1-0.5B-Base 🤗 Falcon-H1-0.5B-Instruct
1.5B 🤗 Falcon-H1-1.5B-Base 🤗 Falcon-H1-1.5B-Instruct
1.5B-Deep 🤗 Falcon-H1-1.5B-Deep-Base 🤗 Falcon-H1-1.5B-Deep-Instruct
3B 🤗 Falcon-H1-3B-Base 🤗 Falcon-H1-3B-Instruct
7B 🤗 Falcon-H1-7B-Base 🤗 Falcon-H1-7B-Instruct
34B 🤗 Falcon-H1-34B-Base 🤗 Falcon-H1-34B-Instruct

Falcon-H1 的主要特性

  • 混合架构(注意力 + SSM):我们在混合 mixer 模块中并行结合了注意力头和 Mamba-2 头。重要的是,注意力头和 mamba 头的数量可以独立调整,从而实现最优的注意力/SSM 比例。这种混合设计带来了更快的推理速度、更低的内存占用以及跨任务的强大泛化能力。

  • 广泛的模型规模:提供六种规模——0.5B、1.5B、1.5B-deep、3B、7B 和 34B——每种均有基础版和指令微调版,适用于从边缘设备到大规模部署的各种场景。

  • 原生多语言设计:原生支持18 种语言,包括阿拉伯语(ar)、捷克语(cs)、德语(de)、英语(en)、西班牙语(es)、法语(fr)、印地语(hi)、意大利语(it)、日语(ja)、韩语(ko)、荷兰语(nl)、波兰语(pl)、葡萄牙语(pt)、罗马尼亚语(ro)、俄语(ru)、瑞典语(sv)、乌尔都语(ur)和中文(zh)——得益于我们在多样化语言数据集上训练的多语言分词器,可扩展至100 多种语言。

  • **紧凑模型,强大性能:**Falcon-H1-0.5B 的性能与2024 年典型的 7B 模型相当,而 Falcon-H1-1.5B-Deep 则可与当前许多领先的 7B–10B 模型媲美。每个 Falcon-H1 模型都旨在达到或超越至少两倍于其规模的模型的性能,使其成为低资源和边缘部署的理想选择,同时不牺牲能力。

  • 256K 上下文支持:Falcon-H1 模型支持高达 256K 上下文长度,可用于长文档处理、多轮对话和长程推理等应用。

  • 卓越的 STEM 能力:得益于训练期间对高质量 STEM 数据的侧重,Falcon-H1 模型在数学和科学领域表现出色。

  • 稳健的训练策略:采用高效数据策略和定制的最大更新参数化(μP),确保跨模型规模的训练平稳且可扩展。

Image 22: image/png

构建 Falcon-H1 背后的主要原则

在启动 Falcon-H1 系列开发时,我们选择从根本上重新思考训练方法。尽管 LLM 开发领域已在许多可靠产出强大模型的既定实践上达成共识,但这些惯例主要是在经典 transformer 架构上得到验证的。从纯注意力机制转向混合注意力-SSM 设计代表着重大的架构变革,因此这些标准实践是否仍然最优变得不确定。

鉴于这种不确定性,我们进行了广泛的实验阶段,在启动最终训练运行之前,系统地重新审视了模型设计和训练方法的几乎每一个方面。虽然我们将在即将发布的技术报告中提供全面细节,但我们希望分享塑造 Falcon-H1 模型的关键见解。

架构

Image 23: image/png

混合注意力-SSM 模型拥有更大的配置空间,涵盖定义模型架构的所有参数。我们的目标是逐一探查这些配置参数,检查它们对模型性能和效率的影响。结果,我们揭示了模型配置空间中一些在轻微效率代价下提升性能的区域。我们可以大致将混合模型的配置空间划分为以下 4 个部分:

  • SSM 特定参数。我们的 SSM 层基于 mamba-2 架构,其组织为若干组头,类似于现代 transformer 模型中的注意力。我们发现,组数或头数偏离文献中通常使用的值并不会提升性能,反而可能降低效率。相比之下,使用更大的内存大小——一个没有注意力对应物的 SSM 特定变量——能在仅付出轻微效率代价的情况下提升性能。
  • 注意力特定参数。我们采用标准的全注意力层。然而,我们发现,在旋转位置嵌入(RoPE)中使用极大规模参数能显著提升模型性能。我们的假设是,与纯 transformer 相比,在混合模型中如此大的值之所以可行,是因为部分位置信息由模型的 SSM 部分原生处理。
  • 结合 mamba 与注意力。将注意力和 SSM 结合在一个模型中有许多方式,其中顺序或并行方法是主要的设计选择。我们最终采用了上图所示的并行方法。我们并行混合设计的关键特性是能够调整注意力和 SSM 头的比例,我们发现相对较小比例的注意力就足以获得良好性能。
  • 通用参数。在我们的实验中,我们观察到增加模型深度对性能的影响最大,尽管会带来效率代价。这使得选择模型深度成为一个艰难的权衡,取决于具体用例。我们的 Falcon-H1-1.5B-deep 正是出于这一权衡,面向需要在较小参数量下实现最大性能的使用场景。

数据策略

众所周知,语言模型的能力主要来自训练数据,这对 Falcon-H1 系列同样适用。除了为模型准备的原始数据外,这些数据在训练期间如何以及何时呈现也至关重要。其中一种数据策略通常被称为课程学习,即在训练开始时展示较简单的数据,而将需要更高级推理的样本留到最后。令人惊讶的是,一种完全相反的策略对我们效果最好。从训练一开始就提供最复杂的数据——一道高等数学题或一个长上下文样本——似乎能让模型有更多时间学习处理相应复杂任务所必需的特征。

另一个关键方面是高质量数据的稀缺。训练大型模型时一个常见的担忧是,模型会暴力记忆数据,而非真正理解数据。为了将这种记忆风险降到最低,一种常见做法是在训练期间不重复使用数据样本,或者对最高质量的样本至多重复使用几次。这一策略的一个副产品是,数据混合会被网络样本主导,因为与高质量来源相比,网络样本的数量大得不成比例。我们发现,记忆效应可能被略微高估了,而仔细估计模型的记忆窗口,可以更频繁地重复使用高质量样本,且不会损害模型的泛化能力。

自定义最大更新参数化(μP)

经典 μP 是一种深深植根于神经网络理论的技术,但有着清晰的实际应用:如果在一个基础模型规模上找到了最优训练超参数,就可以使用 Mup 缩放规则,毫不费力地将其迁移到其他通常更大的模型规模上。我们在整个 Falcon-H1 系列中采用了 Mup 超参数迁移,大幅减少了实验时间,并使并行训练 6 个模型成为可能。

在此基础上,我们又向 μP 背后的内部机制迈出了下一步,以进一步提升模型性能。简而言之,模型的每个组件都“想要”以各自的强度进行训练,而这种强度取决于组件的大小。μP 缩放规则通过所谓的“μP 乘数”将这种依赖关系纳入考虑,以实现最优超参数迁移。然而,经典 μP 在基础模型规模上使用平凡的乘数 1,这相当于假设所有组件的强度在基础规模上已经最优。我们摒弃了这一假设,并在基础模型规模上调整乘数。具体来说,我们将模型参数划分为 35 个细粒度组,并对相应的 35 个乘数进行了联合优化。

训练动态

我们在 Falcon-H1 系列工作中的首批步骤之一,是处理并消除尖峰,已知这对基于 SSM 的模型是一个严重问题。对我们最有效的解决方案,是在 SSM 块的某个位置放置抑制性 μP 乘数。除了使最终模型训练更平滑之外,消除尖峰对于在后续实验中获得干净信号也至关重要。

我们观察到,训练动态的许多方面都在“噪声解释与控制”这一共同主题下相互关联。这包括学习率和批量大小调度、学习率随批量大小的缩放,以及参数范数的行为。特别是,我们发现参数范数主要由训练超参数决定,而不是由模型拟合数据决定。考虑到这一点,我们将权重衰减——一种主要控制参数范数的超参数——纳入了训练调度和 μP 乘数中。

性能

指令模型

当前的 Falcon-H1 模型并未经过针对推理的专门微调,但它们已经展现出强大的通用指令遵循能力。为了突出其性能,我们详细对比了 Falcon-H1-34B-Instruct 与其他同规模或更大规模的顶级 Transformer 模型,包括:Qwen3-32B(非思考模式)、Qwen2.5-72B、Qwen2.5-32B、Gemma3-27B、Llama-4-Scout-17B-16E(109B)和 LLaMA3.3-70B。完整的评估设置和方法请参阅 Falcon-H1 GitHub 页面。

Image 24: image/png

Falcon-H1 系列的突出特点之一是其紧凑型模型的强劲性能。下面,我们对比 1.5B 规模的指令模型。Falcon-H1-1.5B-Deep-Instruct 明显优于同类领先模型,如 Qwen3-1.7B-Instruct。更值得注意的是,它的表现与许多 7B 模型相当,甚至更好,包括 Falcon3-7B-Instruct 和 Qwen2.5-7B-Instruct。

🔎 注意:Falcon-H1-1.5B-Deep 和 Falcon-H1-1.5B 使用相同的设置进行训练;唯一的区别在于其架构的深度和宽度。

Image 25: image/png

多语言能力

为了展示 Falcon-H1 在不同语言上的表现,我们提供了 30B 规模模型在一组选定语言上的 Hellaswag 和 MMLU 平均分数,这些语言包括阿拉伯语、德语、西班牙语、法语、印地语、意大利语、荷兰语、葡萄牙语、罗马尼亚语、俄语和瑞典语。它在其他支持的语言上也展现出相当的表现。

Image 26: image/png

长上下文基准测试

Falcon-H1 的突出特点之一是其处理长上下文输入的能力,在这一领域,状态空间模型(SSM)在内存效率和计算成本方面具有显著优势。

为了展示这些能力,我们在系列长上下文基准测试中评估了 Falcon-H1-34B-Instruct 与 Qwen2.5-72B-Instruct 的对比。我们聚焦于 Helmet 基准套件中的三个核心任务类别——检索增强生成(RAG):Natural Questions、TriviaQA、PopQA、HotpotQA;召回任务:JSON KV、RULER MK Needle、RULER MK UUID、RULER MV;长文档问答任务:∞BENCH QA、∞BENCH MC。这些评估凸显了 Falcon-H1 在扩展到更长序列的同时保持高性能和高效率方面的优势。

Image 27: image/png

此外,我们在 23 个基准测试中对 Falcon-H1 系列与领先的 Transformer 模型进行了全面评估,涵盖多个领域和模型规模。您可以在下方探索交互式结果——只需选择与您的用例最相关的基准测试,即可查看相应的聚合性能分数(下方是官方博客文章中交互式图表的截图)。

Image 28: image/png

基础模型

我们详细对比了 Falcon-H1-34B-Base 与其他同规模或更大规模的领先基础模型,包括 Qwen2.5-72B、Qwen2.5-32B、Llama-4-Scout-17B-16E(109B)和 Gemma3-27B。

🔎 注意:Qwen3-32B 目前不提供基础模型检查点。

Image 29: image/png

下面,我们对比 1.5B 规模的基础模型。Falcon-H1-1.5B-Deep-Base 明显优于同类领先模型,如 Qwen3-1.7B-Base。值得注意的是,它的表现与 Falcon3-7B 相当,甚至在数学和推理任务上超过它,使其成为构建小规模推理导向模型的绝佳基础。

Image 30: image/png

对于基础模型,我们还在官方博客文章中提供了一个交互式图表,展示它们在 14 个基准测试上的表现,涵盖多个领域和不同模型规模(下方是官方博客文章中交互式图表的截图)。

Image 31: image/png

模型效率

我们在下图中比较了 Falcon-H1 与 Qwen2.5-32B 的输入(预填充)和输出(生成)吞吐量。虽然在较短的上下文长度下,Transformer 略快,但随着上下文增长,我们的混合模型变得显著更高效——在较长序列长度下,输入吞吐量最高可提升 4 倍,输出吞吐量最高可提升 8 倍。基准测试使用我们的 Falcon-H1 vLLM 实现以及 Qwen2.5-32B 的官方 vLLM 实现运行。

这一性能提升凸显了 Falcon-H1 架构的可扩展性。我们将小上下文长度下的吞吐量差距归因于当前推理流程中,注意力机制的优化比当前的状态空间模型(SSM)实现更为成熟。

⚙️ 我们邀请社区参与进一步优化 SSM 实现——这是推进下一代高效 LLM 的一个有前景的方向。

Image 32: image/png

🔎 注意:输入吞吐量衡量模型在读取/编码文本时处理 token 的速度。输出吞吐量衡量模型生成新 token 的速度。比率线显示 Falcon-H1/Qwen2.5 的性能对比。

开源承诺

秉承我们促进 AI 可及性与协作的使命,Falcon-H1 在 Falcon LLM 许可证下发布。我们希望 AI 社区能发现这些模型对研究、应用开发和进一步实验具有价值。Falcon-H1 是我们持续打造更强大、更高效基础模型努力的延续。在我们继续改进和推进这些模型能力的过程中,我们欢迎社区的反馈与合作。

实用链接

引用

@misc{tiifalconh1,
    title = {Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance},
    url = {https://falcon-lm.github.io/blog/falcon-h1},
    author = {Falcon-LLM Team},
    month = {May},
    year = {2025}
}

本文提到的集合 1

Falcon-H1 集合 Falcon-H1 系列混合头语言模型(Transformer-SSM),包括 0.5B、1.5B、1.5B-Deep、3B、7B 和 34B(预训练与指令微调)。•33 个项目•更新于 8 月 13 日• 60

来自该作者的更多内容

Image 33 ## QIMMA قِمّة ⛰:质量优先的阿拉伯语 LLM 排行榜 * Image 34 tiiuae 团队 13 2026 年 4 月 21 日 tiiuae

Image 35 ## Falcon Perception * Image 36 tiiuae 团队 71 2026 年 4 月 1 日 tiiuae

社区

编辑预览

通过拖入文本输入框、粘贴或点击此处上传图片、音频和视频。

点击或粘贴此处以上传图片

评论 ·注册或登录以发表评论

- [x] 点赞 40

  • Image 37
  • Image 38
  • Image 39
  • Image 40
  • Image 41
  • Image 42
  • Image 43
  • Image 44
  • Image 45
  • Image 46
  • Image 47
  • Image 48
  • +28

本文提到的集合 1

Falcon-H1 集合 Falcon-H1 系列混合头语言模型(Transformer-SSM),包括 0.5B、1.5B、1.5B-Deep、3B、7B 和 34B(预训练与指令微调)。•33 个项目•更新于 8 月 13 日• 60

系统主题

公司

服务条款隐私政策关于招聘

网站

模型数据集空间定价文档

来源:Hugging Face:Blog · huggingface.co