HuggingFace Daily Papers·· 2 天前AI 评分50
研究揭示工具型智能体很少把无用证据判断转化为停止决策
Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions
AI 导读
一项 arXiv 论文在受控检索环境中测试七个智能体,发现它们对失效信源的结果 97-100% 判为无用,却大多不据此停止调用。提示词线索只改变停止时机而非停止依据,预算声明会让 7-8B 模型拖到截止点;只有让智能体在连续五次判为无用后强制给出回答的整合步骤,停止行为才跟随证据,该规则在预注册的 300 个新问题上复现有效。
来源:HuggingFace Daily Papers · arxiv.org