按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)ARC Prize 用 ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式
AI 导读
ARC Prize 分析了 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的 160 段推理回放,两模型在半私 数据集上的得分分别为 0.43% 和 0.18%,并开源了分析包。
ARC Prize:官方博客
精选
63
AI 编辑部评分,满分 100ARC Prize 用 ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式
ARC Prize 分析了 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的 160 段推理回放,两模型在半私 数据集上的得分分别为 0.43% 和 0.18%,并开源了分析包。
推荐理由
作者基于 160 段推理回放归纳出三种可复用的失败模式分类,并对比两个模型在压缩策略上的差异。
来源:ARC Prize:官方博客· arcprize.org