inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T

蚂蚁 inclusionAI:GitHub 新仓库·2026-02-11 18:52·221天前·inclusionAI
AI 导读

inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。

蚂蚁 inclusionAI:GitHub 新仓库
精选
78AI 编辑部评分,满分 100

inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T

2026-02-11 18:52· 221天前· inclusionAI
AI 导读

inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。

推荐理由

蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。

正文 · AI 翻译

🤗 Hugging Face | 🤖 ModelScope

引言

隆重推出 Ring-2.5-1T:全球首个基于混合线性注意力架构的开源万亿参数思考型模型

在迈向通用 AI 智能体的重要一步中,我们正在将混合线性注意力扩展至预训练和 RL 阶段。我们高效的 1:7 MLA + Lightning Linear Attention 提升了推理速度与探索能力,而扩展后的 RL 训练则增强了深度思考与长时程任务执行能力。

性能

Ring-2.5-1T 模型在 IMO 2025 和 CMO 2025 上均达到金牌🏅水平的表现。关于我们模型的详细解题过程,请参见示例

模型下载

模型 上下文长度 下载
Ring-2.5-1T 128K -> 256K (YaRN) 🤗 HuggingFace
🤖 ModelScope

注意:如果你对之前的版本感兴趣,请访问 HuggingfaceModelScope 中过往的模型合集。

部署

SGLang

环境准备

我们后续会将模型提交至 SGLang 官方发布,现在我们可以按照以下步骤准备环境:

git clone -b ling_2_5 git@github.com:antgroup/sglang.git
cd sglang

# Install the python packages
pip install --upgrade pip
pip install -e "python"

运行推理

SGLang 目前同时支持 BF16 和 FP8 模型。这取决于 ${MODEL_PATH} 中模型的 dtype。

以下是在多 GPU 节点上运行 Ring-1T 的示例,其中主节点 IP 为 ${MASTER_IP},服务器端口为 ${PORT}:

  • 启动服务器:
# Node 0:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 0 
# Node 1:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 1 
# Node 2:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 2 
# Node 3:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 3

# This is only an example. Please adjust arguments according to your actual environment.
  • 客户端:
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "auto", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'

更多用法可参见此处

许可证

本代码仓库依据MIT 许可证授权。

来源:蚂蚁 inclusionAI:GitHub 新仓库· github.com