跳到正文
热点事件持续更新

Cyber Index 新增可信访问模型,GPT-6 Sol 登顶

5 篇报道2 个报道来源1 小时前更新

先了解这件事

AI 综述

Artificial Analysis 将 Cyber Index 网络安全评估排行榜扩展至非公开访问的 trusted-access 模型类别,首个纳入的 GPT-6 Sol (Daybreak Blue, max) 登顶,该模型仅可通过 OpenAI 的 Daybreak 项目使用。据 Artificial Analysis 称,它在整个指数测试中未触发任何安全拦截,总分较公开版 GPT-6 Sol(max)提升 32 分,每任务成本 $1.77,低于 Grok 4.7(xhigh)的 $11.67。 Cyber Index 于 9 月 25 日发布,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项开放基准,基于 Stirrup 开源代理框架运行,覆盖代码审计、漏洞发现到复现与修补的防御全流程,暂不评估利用漏洞生成攻击载荷的能力;CollinearAI、IBM、NVIDIA、Vercel 为启动伙伴。10 月 1 日公布的 CyberGym-E2E-AA 结果显示,部分前沿模型在 85% 以上任务上被安全拦截无法响应。

AI 根据报道生成 · 18 分钟前更新

事件进展

3 个进展

  1. 10月8日 00:00 · 2 篇报道
    Cyber Index新增可信访问模型,GPT-6 Sol领先
    Artificial Analysis 完整文章:Artificial Analysis Cyber Index 引入 trusted-access 模型,GPT-6 Sol (Daybreak Blue) 登顶
  2. 10月1日 09:09 · 1 篇报道
    Artificial Analysis 发布 CyberGym-E2E-AA 网络防御基准评测结果
    Artificial Analysis:Artificial Analysis 发布 CyberGym-E2E-AA 网络防御基准评测结果
  3. 9月25日 00:00 · 2 篇报道
    Artificial Analysis 发布 Cyber Index
    Artificial Analysis 完整文章:Artificial Analysis 发布 Cyber Index 网络安全评估联盟

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Artificial Analysis
    Artificial Analysis 网络指数新增可信访问模型,GPT-6 Sol 登顶

    Artificial Analysis 网络指数新增可信访问模型类别,GPT-6 Sol(Daybreak Blue, max)以领先成绩登顶,并进入成本与能力帕累托前沿。该模型在整个指数测试中未触发任何安全拦截,总分较公开版 GPT-6 Sol(max)提升 32 分。其每任务成本为 $1.77,低于 Grok 4.7(xhigh)的 $11.67。

10月8日
  1. Artificial Analysis 完整文章
    Artificial Analysis Cyber Index 引入 trusted-access 模型,GPT-6 Sol (Daybreak Blue) 登顶

    Artificial Analysis 将 Cyber Index 排行榜扩展至非公开访问的 trusted-access 模型,首个纳入的 GPT-6 Sol (Daybreak Blue, max) 目前登顶,仅可通过 OpenAI 的 Daybreak 项目使用。

10月1日
  1. Artificial Analysis
    Artificial Analysis 发布 CyberGym-E2E-AA 网络防御基准评测结果

    Artificial Analysis 发布 CyberGym-E2E-AA 基准评测,测量模型在内存安全任务上从漏洞发现到打补丁的网络防御能力。部分前沿模型在 85% 以上任务上被安全拦截无法响应;GPT-6 Luna 和 MiMo-V2.6-Pro 在 1M+ 行代码库上跑约 100 次漏洞挖掘仅需约 $20,单任务成本比次强的 Grok 4.7 便宜最多 100 倍。

9月28日
  1. Artificial Analysis
    Artificial Analysis 发布 Cyber Index 与 Cyber Index Alliance 评测 AI 模型企业网络防御能力

    Artificial Analysis 发布 Cyber Index 与 Cyber Index Alliance,联合 @CollinearAI、@IBM、@nvidia、@vercel 作为启动伙伴,用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三个开放基准评估智能体发现和修复漏洞的能力。

9月25日
  1. Artificial Analysis 完整文章
    Artificial Analysis 发布 Cyber Index 网络安全评估联盟

    Artificial Analysis 推出 Cyber Index,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项评估,覆盖从代码审计、漏洞发现到复现与修补的防御全流程。该指数基于 Stirrup 开源代理框架运行,重点测试模型在拥有源代码访问权限下的漏洞识别与修复能力,并单独记录因安全原因拒绝任务的情况。目前暂不包含利用漏洞生成攻击载荷的能力评估。

本事件热度走势

可比范围当前
3
可比范围峰值
610月2日 05:00
近 24 小时变化
-50%

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。