跳到正文
热点事件持续更新

ExplorationBench:评估 AI 探索能力的异世界基准

2 篇报道2 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 9 月 24 日,HuggingFace Daily Papers 收录了社区热门论文 ExplorationBench。研究者提出用规则可执行、且与既有知识相冲突的“异世界”来评估 AI 系统的探索能力,其设计使答案可被精确验证,同时无法依靠预训练记忆作答。该基准包含两个沙盒:AlienCode 设有 31 个发现目标、70 项任务;AlienLogic 设有 24 个发现目标、70 项任务。9 月 30 日,腾讯混元在 X 上宣布联合复旦、清华发布 ExplorationBench,称其用可执行规则的 Alien Worlds 评测 AI 自主探索能力,并给出两个沙盒的构成:AlienCode 含 31 条隐藏规则改动、70 项任务,AlienLogic 含 24 条推理规则、70 项定理。早先报道称 AlienCode 为 31 个发现目标、AlienLogic 为 24 个发现目标,后续报道则分别表述为 31 条隐藏规则改动与 24 条推理规则。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 9月30日 21:29 · 1 篇报道
    腾讯混元等发布ExplorationBench基准
    腾讯混元:腾讯混元等发布 ExplorationBench 评测 AI 探索能力
  2. 9月24日 08:00 · 1 篇报道
    ExplorationBench:在可验证异世界中评估 AI 系统的探索能力
    HuggingFace Daily Papers(社区热门论文):ExplorationBench:在可验证异世界中评估 AI 系统的探索能力

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. X:腾讯混元 (@TencentHunyuan)
    腾讯混元等发布 ExplorationBench 评测 AI 探索能力

    腾讯混元联合复旦、清华发布 ExplorationBench,用可执行规则的 Alien Worlds 评测 AI 自主探索能力,含 AlienCode(31 条隐藏规则改动、70 任务)和 AlienLogic(24 条推理规则、70 定理)两个沙盒。

9月24日
  1. HuggingFace Daily Papers(社区热门论文)
    ExplorationBench:在可验证异世界中评估 AI 系统的探索能力

    研究者推出 ExplorationBench,用规则可执行且与既有知识冲突的"异世界"评估 AI 探索能力,使答案可精确验证且无法靠预训练记忆作答。该基准包含 AlienCode(31 个发现目标、70 项任务)和 AlienLogic(24 个发现目标、70 项任务)两个沙盒。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。