Microsoft 发布 MAI-Code-1-Flash 编码模型,基准全面超越 Claude Haiku 4.5
Introducing MAI-Code-1-Flash
Microsoft 发布编码模型 MAI-Code-1-Flash,直接用生产环境 GitHub Copilot harness 训练,主打真实开发工作流而非仅优化基准。
官方说明了用生产环境 Copilot harness 训练和评测的思路,并给出与 Claude Haiku 4.5 的基准对比数据,可据此评估其在真实编码工作流中的价值。
为开发者而构建,而非为基准测试而构建
编码模型只有在开发者日常使用的同一环境中表现出色时,才最有价值。这就是为什么我们在构建 MAI-Code-1-Flash 时以生产工作流为核心,而不是仅仅针对基准测试进行优化。该模型直接使用生产环境中使用的 GitHub Copilot 工具链进行训练。这使它能够学习在智能体编码任务中如何与周围的工具和系统交互,与其他可用模型相比,它独特地非常适合真实的 Copilot 工作流。
在训练期间,我们在核心软件工程任务、代码仓库问答、重构以及源自真实 GitHub Copilot 使用情况的遥测任务上评估了各个检查点。训练、评估和生产之间的这种一致性有助于将离线改进转化为真实世界中的开发者质量。
旨在最大化每个 token 的价值
MAI-Code-1-Flash 通过自适应解决方案长度控制进行训练,这有助于模型根据任务调整其响应的深度。对于较简单的请求,它可以保持简洁;当问题需要更深入的分析或更广泛的代码更改时,它可以投入更多的推理预算。在实践中,这意味着开发者能更快看到有用的输出。我们看到 MAI-Code-1-Flash 在解决更难的问题时使用的 token 最多减少 60%。这有助于降低延迟、降低成本、提高 token 回报率,并使交互式工作流更加流畅。
生产工具链中的基准测试结果
为了了解质量和效率,我们在 SWE-Bench Verified、SWE-Bench Pro、SWE-Bench Multilingual 和 Terminal Bench 2 上,使用开发者日常编码任务所用的同一生产工具链,将 MAI-Code-1-Flash 与 Claude Haiku 4.5 进行了对比评估。我们测量了任务成功率以及完成每个任务所需的平均解决方案 token 数。
MAI-Code-1-Flash 在所有测试的核心编码基准上均优于 Claude Haiku 4.5,在全部 4 项评估中通过率更高,其中在 SWE-Bench Pro 多样化、真实世界的任务上领先 16 个百分点(51.2% 对 35.2%)。它不仅更聪明,也更精简,在 SWE-Bench Verified 上解决更难的问题时使用的 token 最多减少 60%,证明更高的准确率和更高的效率不再是取舍关系。
来源:Microsoft AI:官方博客(网页) · microsoft.ai