Mistral 发布 Mistral Large 4,Artificial Analysis 评测称其为美中之外最智能模型
Mistral has released Mistral Large 4, making France home to the most intelligent model outside the US and China
Mistral 发布 Mistral Large 4(Research Public Preview),在 Artificial Analysis Intelligence Index 得分 38,与 GPT-6 Luna(max, 38)相当,为美中之外最智能模型,计划 10 月底开源 1T 参数(49B 激活)权重。
原文给出 Intelligence Index、Cyber Index、定价与上下文窗口等具体数据,读者可据此评估 Mistral Large 4 的真实水平与成本。
Mistral 发布了 Mistral Large 4,在 Artificial Analysis 智能指数上得分 38;法国重新拥有来自美国和中国之外的最智能模型
Mistral 以研究公开预览版的形式发布了 Mistral Large 4,并计划在 10 月底发布这个 1T 参数(49B 激活)模型的权重。它在 Artificial Analysis 智能指数上达到 38,与 GPT-6 Luna(max,38)和 DeepSeek V4.1 Flash(max,39)相当。它还在 Artificial Analysis 网络安全指数上达到 50,与 GLM-5.3-Flash 持平,并领先于 Kimi K3 和 DeepSeek V4.1 Flash(max)等模型。

Mistral Large 4 Preview 的关键基准测试结果:
➤ 来自美国和中国之外的最智能模型: Mistral Large 4 Preview 在智能指数上得分 38,与 DeepSeek V4.1 Flash(max,39)和 GPT-6 Luna(max,38)相当。这使其成为来自美国和中国之外的最智能模型,领先于韩国和阿联酋等国家

➤ 网络防御能力与 GLM-5.3-Flash 持平: Mistral Large 4 Preview 在 Artificial Analysis 网络安全指数上得分 50,与 GLM-5.3-Flash(50)持平,落后于 MiMo-V2.6-Pro(56)。一旦其权重发布,它将在网络安全指数上跻身前三的开源权重模型之列。其最强结果出现在 CyberGym-E2E-AA 上,得分 82%,领先于 MiMo-V2.6-Pro(79%)和 GPT-6 Luna(max,78%)

➤ 每任务成本是同等智能水平开源权重模型的 4 倍以上: Mistral Large 4 Preview 在智能指数每任务上的成本为 $1.13,标准定价为每 1M 输入/输出 token $1.36/$4.18,每 1M 缓存输入 token 为 $0.14。前两周,Mistral Large 4 Preview 将以 50% 的发布折扣提供服务,使其每任务成本降至 $0.57。这仍然比 GLM-5.3-Flash($0.25)和 DeepSeek V4.1 Flash(max,$0.27)更贵

➤ 强大的文档和图像推理能力: Mistral Large 4 Preview 在 GDP.pdf 上得分 19%,与 MiMo-V2.6-Pro(19%)相当,落后于 Kimi K3(22%)。这比 Mistral Large 3 提升了 18 个百分点,部分原因是其 API 的改进,现在每次请求可接受 100 张图像,而此前 Mistral 模型为 8 张
关键模型细节:
➤ 上下文窗口: 512k tokens
➤ 多模态: 文本和图像输入,文本输出
➤ 定价: 每 1M 输入/输出 token $1.36/$4.18(每 1M 缓存输入 token $0.14),前两周 50% 折扣($0.68/$2.09)
➤ 可用性: 在 Mistral 的 API 上提供研究公开预览版,计划于 10 月底开放权重

来源:Artificial Analysis 完整文章 · artificialanalysis.ai