Karina · @karinanguyen · X·2026-09-18 08:42·42分钟前
AI 导读

Epoch AI 推出 Benchmark Reviews 计划,用于审计 AI 基准,首批覆盖 15 个基准:4 个 Verified、9 个 Flawed、2 个信息不足以评审。Verified 包括 WeirdML v2、ExploitBench v0.1、PostTrainBench v1.1、SimpleQA Verified,Flawed 包括 Terminal-Bench 4.0.0、SWE-Bench Verified、SWE-Bench Pro 等。作者 Karina Nguyen 转发并称赞该举措能激励行业构建真正高质量的基准,并感谢其审计 PostTrainBench 和挖掘旧的 SimpleQA。

Karina@karinanguyen
50AI 编辑部评分,满分 100
2026-09-18 08:42· 42分钟前
AI 导读

Epoch AI 推出 Benchmark Reviews 计划,用于审计 AI 基准,首批覆盖 15 个基准:4 个 Verified、9 个 Flawed、2 个信息不足以评审。Verified 包括 WeirdML v2、ExploitBench v0.1、PostTrainBench v1.1、SimpleQA Verified,Flawed 包括 Terminal-Bench 4.0.0、SWE-Bench Verified、SWE-Bench Pro 等。作者 Karina Nguyen 转发并称赞该举措能激励行业构建真正高质量的基准,并感谢其审计 PostTrainBench 和挖掘旧的 SimpleQA。

Great initiative to eval the evals. It incentivizes the industry to build genuinely high-quality benchmarks.

Ty for auditing PTB and digging up the old SimpleQA too :)

Epoch AIIntroducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough infor...

来源:Karina· x.com