跳到正文

CyberBench Patch v1.1

Vals AI / 编程 · 修补真实开源项目的安全漏洞。

官方评测
在 AIHOT 中参与排名
所属领域编程
上游数据时间10/01 08:00
最近成功同步10/08 02:05

它测什么,怎么测

56 个 Patch 任务,统一 mini-swe-agent;编译、原漏洞复测及隐藏输入与维护者修复对照。

如何使用这份证据

计分:漏洞修补一类评测。 固定十个对照型号至少测到六个,才参与计算。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1openai/gpt-daybreak-blueOpenAI89.3%Max 推理
1openai/gpt-6-solOpenAI89.3%Max 推理
1openai/gpt-5.6-solOpenAI89.3%Max 推理
4openai/gpt-6-lunaOpenAI87.5%Max 推理
4zai/glm-5.3Z.ai87.5%Max 推理
4google/gemini-3.7-flashGoogle87.5%High 推理
4anthropic/claude-opus-5-5-rangeAnthropic87.5%Max 推理未计入:Cyber Range / CVP 为独立运行条件,不能代替标准型号的 Patch 成绩。
4anthropic/claude-sonnet-5-5Anthropic87.5%Max 推理
4anthropic/claude-fable-5-1Anthropic87.5%Max 推理
4deepseek/deepseek-v4-flash-0731DeepSeek87.5%High 推理
4openai/gpt-5.6-terraOpenAI87.5%Max 推理
4google/gemini-3.8-flashGoogle87.5%High 推理
13xiaomi/mimo-v2.6-proXiaomi85.7%来源默认配置
13google/gemini-4-argonGoogle85.7%High 推理
13tencent/hy4-previewTencent85.7%来源默认配置
13google/gemini-3.6-flashGoogle85.7%High 推理
13deepseek/deepseek-v4-pro-0813DeepSeek85.7%Max 推理
13anthropic/claude-opus-5-5Anthropic85.7%Max 推理
13anthropic/claude-opus-5Anthropic85.7%Max 推理
13deepseek/deepseek-v4.1-flashDeepSeek85.7%High 推理
13fireworks/ember-1Fireworks AI85.7%来源默认配置
13meta/muse_spark_1_2Meta85.7%xHigh 推理
13xiaomi/mimo-v2.6-flashXiaomi85.7%来源默认配置
13zai/glm-5.3-flashZ.ai85.7%Max 推理
25anthropic/claude-sonnet-5-rangeAnthropic83.9%Max 推理未计入:Cyber Range 为独立运行条件,不能代替标准型号的 Patch 成绩。
25grok/grok-4.7xAI83.9%xHigh 推理
25openai/gpt-5.6-lunaOpenAI83.9%Max 推理
25alibaba/qwen3.8-27bAlibaba83.9%xHigh 推理
29anthropic/claude-sonnet-5Anthropic82.1%Max 推理
29kimi/kimi-k3Moonshot AI82.1%Max 推理
评测局限与数据署名

只取 Patch,不混入 PoC 或总分;回退比例按 Patch 的 56 题计算。 缺测留空;回退成绩计入并标注,受影响题目过半不计。

数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准

成绩由 Vals AI 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。