返回
精选AI 评分 71/100

ARC Prize 实测 OpenAI o1 在 ARC-AGI-Pub 的成绩

ARC Prize:官方博客·2024-09-13 00:00·730天前
AI 导读

ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。

ARC Prize:官方博客
精选
71AI 编辑部评分,满分 100

ARC Prize 实测 OpenAI o1 在 ARC-AGI-Pub 的成绩

2024-09-13 00:00· 730天前
AI 导读

ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。

推荐理由

ARC Prize 用同一测试框架实测 o1 并给出测试时算力与效率分析,读者可借此理解 o1 在 ARC-AGI 上成绩有限的原因。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:ARC Prize:官方博客· arcprize.org