按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力
AI 导读
METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。
METR:Research(网页)
精选
61
AI 编辑部评分,满分 100METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力
METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。
推荐理由
原文在同一环境公平对比人类专家与前沿模型智能体,并给出长短时间预算下得分反转的关键数据和完整开源转录。
来源:METR:Research(网页)· metr.org