HuggingFace Daily Papers·· 4 天前AI 评分40
CheatBench:衡量 AI 智能体奖励作弊行为的基准
CheatBench: Measuring Reward Gaming in AI Agents
AI 导读
研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,通过将高难度任务与作弊机会结合,考察智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,用于测量并减少智能体在承担更重要职责时的作弊行为,已公开发布。
来源:HuggingFace Daily Papers · arxiv.org