返回
精选AI 评分 63/100

ARC Prize 用 ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式

ARC Prize:官方博客·2026-05-01 00:00·135天前
AI 导读

ARC Prize 分析了 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的 160 段推理回放,两模型在半私 数据集上的得分分别为 0.43% 和 0.18%,并开源了分析包。

ARC Prize:官方博客
精选
63AI 编辑部评分,满分 100

ARC Prize 用 ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式

2026-05-01 00:00· 135天前
AI 导读

ARC Prize 分析了 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的 160 段推理回放,两模型在半私 数据集上的得分分别为 0.43% 和 0.18%,并开源了分析包。

推荐理由

作者基于 160 段推理回放归纳出三种可复用的失败模式分类,并对比两个模型在压缩策略上的差异。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:ARC Prize:官方博客· arcprize.org