跳到正文
HuggingFace Daily Papers·· 1 天前AI 评分38

从证据到行动:工具调用智能体为何失败

From Evidence to Action: How Tool-Using Agents Fail

AI 导读

研究揭示工具调用智能体在从证据到行动的链条上存在断裂:在十种模型-框架配置中,静态动作判断能力强,但交互式执行明显偏弱。失败常始于执行前,智能体调查不完整或证据未建立就行动;单动作执行通常可靠,多动作工作流则暴露未解决的前置条件和执行不完整问题。为此研究提出 SafeActBench,涵盖六大领域、五种协议的 656 个案例,并用证据账本与轨迹评估器追踪信息建立与依赖满足情况。

来源:HuggingFace Daily Papers · arxiv.org