精选归档 · 第 8 页

141145 条 · 共 144

6月5日6月5日周四

星期四 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 67/100
ARC Prize 实测各大 AI 推理系统,ARC-AGI 上没有明显赢家

ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,ARC-AGI-2 上则全数近乎失败,最高仅 Claude Opus 4 的 8.6%。文章指出测试时计算扩展方法堆叠可提升准确率但效率大幅下降,ARC-AGI-2 上的一致性差说明前沿系统存在共同局限,AGI 仍需新想法。


推荐理由:官方实测给出了各推理系统在 ARC 上的准确率与成本双轴数据,读者可据此按自身需求选型而非追单一赢家。

4月22日4月22日周二

星期二 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 69/100
ARC Prize 实测 o3 与 o4-mini 在 ARC-AGI 上的表现

ARC Prize Foundation 首次公布 OpenAI o3 与 o4-mini 在 ARC-AGI 上的公开测试结果。o3-low 在 ARC-AGI-1 Semi Private Eval 得分 41%,o3-medium 达 53%,两者在 ARC-AGI-2 上均未超过 3%;o4-mini-low 在 ARC-AGI-1 得 21%。


推荐理由:ARC Prize 公布了自家基准上 o3 与 o4-mini 的完整实测数据和高推理档的失真问题,读者可借此校准对推理档位选择的预期。

12月20日12月20日周五

星期五 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 83/100
ARC Prize 实测 OpenAI o3 在 ARC-AGI-Pub 取得突破性高分

ARC Prize 官方测试报告显示,OpenAI o3 在 ARC-AGI-1 Semi-Private 评测中以 $10k 算力上限取得 75.7%,高算力(172 倍)配置达 87.5%,Public Eval 高算力为 82.8%、低算力为 91.5%。


推荐理由:ARC Prize 官方第一手测试数据,给出 o3 在 ARC-AGI 各算力档位的得分、成本和机制解读。

9月13日9月13日周五

星期五 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 71/100
ARC Prize 实测 OpenAI o1 在 ARC-AGI-Pub 的成绩

ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。


推荐理由:ARC Prize 用同一测试框架实测 o1 并给出测试时算力与效率分析,读者可借此理解 o1 在 ARC-AGI 上成绩有限的原因。

3月17日3月17日周五

星期五 · 1 条
00:00
METR:Research(网页)精选
AI 评分 69/100
ARC 发布 Claude 与 GPT-4 危险能力评测进展

ARC 作为第三方评估方与 Anthropic、OpenAI 等实验室合作,在受控环境中测试前沿模型自主获取资源、逃避人工监督的危险能力。结论是被测的 Claude 和 GPT-4 版本均未能产出可信的完整自主复制计划,执行中易出错、有幻觉、难以在多副本间分派任务,但能部分完成浏览网页、雇佣人类代办、制定长期计划等子任务。


推荐理由:ARC 公布了危险能力评测的动机、方法与结论,读者可以了解模型自主复制能力的评估方式。