跳到正文
热点事件历史事件

发布 Terminal-Bench-Science 0.1 排行榜:GPT-6 Astra (max) 63%、Claude Opus 5.5 (xhigh) 62% 暂居前二

1 篇报道1 个报道来源3 天前更新

先了解这件事

事实说明

发布 Terminal-Bench-Science 0.1 的排行榜。评测将 agent 放入沙盒执行任务,自动测试按通过/失败评分,并报告 3 次尝试的平均 pass@1。GPT-6 Astra (max) 以 63%、Claude Opus 5.5 (xhigh) 以 62% 暂居前二,仅这两个模型超过 50%;Claude Opus 5.5 (xhigh) 在数学科学任务通过率 71%、生命科学 46%;最佳开放权重模型 GLM-5.3 (max) 为 10%、DeepSeek V4.1 Flash (max) 为 9%。

报道时间线

沿着报道,了解事件的不同侧面。

9月25日
  1. X:Artificial Analysis (@ArtificialAnlys)
    Artificial Analysis 发布 Terminal-Bench-Science 0.1 榜单

    Artificial Analysis 上线 Terminal-Bench-Science 0.1 智能体科研基准榜单,GPT-6 Astra (max) 以 63% 居首,Claude Opus 5.5 (xhigh) 以 62% 紧随其后。

本事件热度走势

当前热度 3·可比范围峰值 29(9月25日 09:00)·近 24 小时可比范围变化 -83%

01020309月25日08:009月26日00:009月26日16:009月27日08:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。