ARC Prize:官方博客精选
AI 评分 83/100
ARC Prize 官方测试报告显示,OpenAI o3 在 ARC-AGI-1 Semi-Private 评测中以 $10k 算力上限取得 75.7%,高算力(172 倍)配置达 87.5%,Public Eval 高算力为 82.8%、低算力为 91.5%。
推荐理由:ARC Prize 官方第一手测试数据,给出 o3 在 ARC-AGI 各算力档位的得分、成本和机制解读。
第 161–163 条 · 共 163 条
ARC Prize 官方测试报告显示,OpenAI o3 在 ARC-AGI-1 Semi-Private 评测中以 $10k 算力上限取得 75.7%,高算力(172 倍)配置达 87.5%,Public Eval 高算力为 82.8%、低算力为 91.5%。
ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。
ARC 作为第三方评估方与 Anthropic、OpenAI 等实验室合作,在受控环境中测试前沿模型自主获取资源、逃避人工监督的危险能力。结论是被测的 Claude 和 GPT-4 版本均未能产出可信的完整自主复制计划,执行中易出错、有幻觉、难以在多副本间分派任务,但能部分完成浏览网页、雇佣人类代办、制定长期计划等子任务。