Cyber Index 新增可信访问模型,GPT-6 Sol 登顶
先了解这件事
Artificial Analysis 将 Cyber Index 网络安全评估排行榜扩展至非公开访问的 trusted-access 模型类别,首个纳入的 GPT-6 Sol (Daybreak Blue, max) 登顶,该模型仅可通过 OpenAI 的 Daybreak 项目使用。据 Artificial Analysis 称,它在整个指数测试中未触发任何安全拦截,总分较公开版 GPT-6 Sol(max)提升 32 分,每任务成本 $1.77,低于 Grok 4.7(xhigh)的 $11.67。 Cyber Index 于 9 月 25 日发布,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项开放基准,基于 Stirrup 开源代理框架运行,覆盖代码审计、漏洞发现到复现与修补的防御全流程,暂不评估利用漏洞生成攻击载荷的能力;CollinearAI、IBM、NVIDIA、Vercel 为启动伙伴。10 月 1 日公布的 CyberGym-E2E-AA 结果显示,部分前沿模型在 85% 以上任务上被安全拦截无法响应。
AI 根据报道生成 · 18 分钟前更新
事件进展
3 个进展
- 10月8日 00:00 · 2 篇报道Cyber Index新增可信访问模型,GPT-6 Sol领先Artificial Analysis 完整文章:Artificial Analysis Cyber Index 引入 trusted-access 模型,GPT-6 Sol (Daybreak Blue) 登顶
- 10月1日 09:09 · 1 篇报道Artificial Analysis 发布 CyberGym-E2E-AA 网络防御基准评测结果Artificial Analysis:Artificial Analysis 发布 CyberGym-E2E-AA 网络防御基准评测结果
- 9月25日 00:00 · 2 篇报道Artificial Analysis 发布 Cyber IndexArtificial Analysis 完整文章:Artificial Analysis 发布 Cyber Index 网络安全评估联盟
报道时间线
沿着报道,了解事件的不同侧面。
- Artificial AnalysisArtificial Analysis 网络指数新增可信访问模型,GPT-6 Sol 登顶
Artificial Analysis 网络指数新增可信访问模型类别,GPT-6 Sol(Daybreak Blue, max)以领先成绩登顶,并进入成本与能力帕累托前沿。该模型在整个指数测试中未触发任何安全拦截,总分较公开版 GPT-6 Sol(max)提升 32 分。其每任务成本为 $1.77,低于 Grok 4.7(xhigh)的 $11.67。
- Artificial Analysis 完整文章Artificial Analysis Cyber Index 引入 trusted-access 模型,GPT-6 Sol (Daybreak Blue) 登顶
Artificial Analysis 将 Cyber Index 排行榜扩展至非公开访问的 trusted-access 模型,首个纳入的 GPT-6 Sol (Daybreak Blue, max) 目前登顶,仅可通过 OpenAI 的 Daybreak 项目使用。
- Artificial AnalysisArtificial Analysis 发布 CyberGym-E2E-AA 网络防御基准评测结果
Artificial Analysis 发布 CyberGym-E2E-AA 基准评测,测量模型在内存安全任务上从漏洞发现到打补丁的网络防御能力。部分前沿模型在 85% 以上任务上被安全拦截无法响应;GPT-6 Luna 和 MiMo-V2.6-Pro 在 1M+ 行代码库上跑约 100 次漏洞挖掘仅需约 $20,单任务成本比次强的 Grok 4.7 便宜最多 100 倍。
- Artificial AnalysisArtificial Analysis 发布 Cyber Index 与 Cyber Index Alliance 评测 AI 模型企业网络防御能力
Artificial Analysis 发布 Cyber Index 与 Cyber Index Alliance,联合 @CollinearAI、@IBM、@nvidia、@vercel 作为启动伙伴,用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三个开放基准评估智能体发现和修复漏洞的能力。
- Artificial Analysis 完整文章Artificial Analysis 发布 Cyber Index 网络安全评估联盟
Artificial Analysis 推出 Cyber Index,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项评估,覆盖从代码审计、漏洞发现到复现与修补的防御全流程。该指数基于 Stirrup 开源代理框架运行,重点测试模型在拥有源代码访问权限下的漏洞识别与修复能力,并单独记录因安全原因拒绝任务的情况。目前暂不包含利用漏洞生成攻击载荷的能力评估。
本事件热度走势
- 可比范围当前
- 3
- 可比范围峰值
- 610月2日 05:00
- 近 24 小时变化
- -50%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。