🚨 AI News | TestingCatalog · @testingcatalog · X·2026-09-04 04:43·23天前
AI 导读

GPT-6 Astra 在 ARC-AGI-3 上以标准 harness 得分 63%,经新的 provider adapter harness 可达 99%,并在 96% 的关卡上动作效率超过受测人类中位数。ARC Prize 观察到它能将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则并自建领域速记语言来跟踪状态和规划动作。

🚨 AI News | TestingCatalog@testingcatalog
67AI 编辑部评分,满分 100
2026-09-04 04:43· 23天前
AI 导读

GPT-6 Astra 在 ARC-AGI-3 上以标准 harness 得分 63%,经新的 provider adapter harness 可达 99%,并在 96% 的关卡上动作效率超过受测人类中位数。ARC Prize 观察到它能将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则并自建领域速记语言来跟踪状态和规划动作。

OPENAI 🔥: Astra scored 63% on ARC-AGI-3 with a standard harness.

GPT-6 Astra surpasses the human baseline in action efficiency on ARC-AGI-3. It used fewer actions than the median tested human on 96% of levels.

A key behavior observed in GPT-6 Astra was its ability to turn unfamiliar environments into compact symbolic world models. It represented game mechanics as logical rules and developed its own domain-specific language shorthand to track state and plan actions.

ARC PrizeGPT-6 Astra by @OpenAI achieves SOTA on ARC-AGI: - Astra scores 63% on ARC-AGI-3, 99% via a new provider adapter harness - It surpasses human performance on 96%...

来源:🚨 AI News | TestingCatalog· x.com