ExplorationBench:评估 AI 探索能力的异世界基准
先了解这件事
2026 年 9 月 24 日,HuggingFace Daily Papers 收录了社区热门论文 ExplorationBench。研究者提出用规则可执行、且与既有知识相冲突的“异世界”来评估 AI 系统的探索能力,其设计使答案可被精确验证,同时无法依靠预训练记忆作答。该基准包含两个沙盒:AlienCode 设有 31 个发现目标、70 项任务;AlienLogic 设有 24 个发现目标、70 项任务。9 月 30 日,腾讯混元在 X 上宣布联合复旦、清华发布 ExplorationBench,称其用可执行规则的 Alien Worlds 评测 AI 自主探索能力,并给出两个沙盒的构成:AlienCode 含 31 条隐藏规则改动、70 项任务,AlienLogic 含 24 条推理规则、70 项定理。早先报道称 AlienCode 为 31 个发现目标、AlienLogic 为 24 个发现目标,后续报道则分别表述为 31 条隐藏规则改动与 24 条推理规则。
AI 根据报道生成 · 2 小时前更新
事件进展
- 9月30日 21:29 · 1 篇报道腾讯混元等发布ExplorationBench基准腾讯混元:腾讯混元等发布 ExplorationBench 评测 AI 探索能力
- 9月24日 08:00 · 1 篇报道ExplorationBench:在可验证异世界中评估 AI 系统的探索能力HuggingFace Daily Papers(社区热门论文):ExplorationBench:在可验证异世界中评估 AI 系统的探索能力
报道时间线
沿着报道,了解事件的不同侧面。
- X:腾讯混元 (@TencentHunyuan)腾讯混元等发布 ExplorationBench 评测 AI 探索能力
腾讯混元联合复旦、清华发布 ExplorationBench,用可执行规则的 Alien Worlds 评测 AI 自主探索能力,含 AlienCode(31 条隐藏规则改动、70 任务)和 AlienLogic(24 条推理规则、70 定理)两个沙盒。
- HuggingFace Daily Papers(社区热门论文)ExplorationBench:在可验证异世界中评估 AI 系统的探索能力
研究者推出 ExplorationBench,用规则可执行且与既有知识冲突的"异世界"评估 AI 探索能力,使答案可精确验证且无法靠预训练记忆作答。该基准包含 AlienCode(31 个发现目标、70 项任务)和 AlienLogic(24 个发现目标、70 项任务)两个沙盒。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。