热点事件历史事件
发布 Terminal-Bench-Science 0.1 排行榜:GPT-6 Astra (max) 63%、Claude Opus 5.5 (xhigh) 62% 暂居前二
1 篇报道1 个报道来源3 天前更新
先了解这件事
事实说明
发布 Terminal-Bench-Science 0.1 的排行榜。评测将 agent 放入沙盒执行任务,自动测试按通过/失败评分,并报告 3 次尝试的平均 pass@1。GPT-6 Astra (max) 以 63%、Claude Opus 5.5 (xhigh) 以 62% 暂居前二,仅这两个模型超过 50%;Claude Opus 5.5 (xhigh) 在数学科学任务通过率 71%、生命科学 46%;最佳开放权重模型 GLM-5.3 (max) 为 10%、DeepSeek V4.1 Flash (max) 为 9%。
报道时间线
沿着报道,了解事件的不同侧面。
9月25日
- X:Artificial Analysis (@ArtificialAnlys)Artificial Analysis 发布 Terminal-Bench-Science 0.1 榜单
Artificial Analysis 上线 Terminal-Bench-Science 0.1 智能体科研基准榜单,GPT-6 Astra (max) 以 63% 居首,Claude Opus 5.5 (xhigh) 以 62% 紧随其后。
本事件热度走势
当前热度 3·可比范围峰值 29(9月25日 09:00)·近 24 小时可比范围变化 -83%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。