Stanford 团队(Jiacheng Miao、James Zou)的 Paper2Agent 于 2026 年 9 月 16 日发表在 Nature,可将论文及其代码库自动转换为 MCP 服务器,供 Claude Code 等 MCP 兼容智能体用自然语言调用论文方法。
Stanford 团队(Jiacheng Miao、James Zou)的 Paper2Agent 于 2026 年 9 月 16 日发表在 Nature,可将论文及其代码库自动转换为 MCP 服务器,供 Claude Code 等 MCP 兼容智能体用自然语言调用论文方法。
Cohere Labs 聚合七个公开目录,构建含 696,291 个工具、123,069 个 MCP 服务器的 Agentic Task Ecosystem 数据集并对外开放。
论文提出 CAST,一种批判感知训练框架,将稀疏任务结果转化为动作级监督,用于批判学习与策略优化,通过分析智能体轨迹合成解释动作有效性的结构化理由。在动态工具调用基准上微调 Qwen3 系列模型,Retail 任务 pass^4 超过 GPT-OSS-120B 达 10% 以上,域外 Telehealth 场景额外提升 9%。
Agent Seer 提出一种无需人工构建或实时执行工具即可合成评测场景的方法,利用函数名、自然语言描述和类型化参数模式等工具规格中的语义信息,生成能反映从业者组合工具与多轮迭代的真实测试场景。该方法旨在解决手工构建场景依赖领域专家、难以跨工具生态扩展且静态基准无法跟踪 API 演进的问题。
PROOF-Gen提出用优化后的数据改进工具调用能力的知识蒸馏。在τ²-bench上,教师模型57%的试运行失败,其中三分之二是近失(大部分工具调用正确),而传统生成-过滤流程因失败不提供信号,每轮都会遗留相同的难题。该方法通过利用失败信号优化数据,提升蒸馏效果。
StarHarness 提出一种在保持模型权重不变的前提下,为特定环境进化智能体框架(harness)的方法,可优化提示词、工具接口、技能、MCP 提供商及子智能体结构等配置。
AutoSaddler 提出一种自动化 harness 优化框架,将 harness 改进视为离线学习问题,通过失败轨迹诊断、结构化补丁生成和基于验证的更新选择,迭代优化智能体外部控制逻辑。
Thinkingbox 是一个工具-智能体-用户交互沙箱,提供隔离的 MCP 兼容工具会话、完整执行轨迹及终端后端状态结果评估。基于该沙箱构建的 Thinkingbox-bench 包含 507 个策略约束工作流,覆盖零售、酒店、汽车保险等场景;最强模型 pass@1 达 65.36%,但 pass^20 仅 25.25%,显示响应或工具调用级信号无法可靠预测端到端任务完成。
DART-SD提出一种新框架,将多轮工具调用训练从全局轨迹模仿转向拓扑引导的局部修正,以解决最优解空间呈组合菱形晶格时全轨迹模仿导致的拓扑坍缩与策略多样性退化问题。该方法通过交互状态转移图建模执行过程,识别关键拓扑断点并检索成功恢复参考,仅在生成的恢复步骤上计算训练损失,保护有效推理前缀免受破坏性梯度更新。在复杂多轮工具调用基准上,DART-SD显著优于传统全轨迹基线。
一项新研究评估了原生与改造型循环语言模型在API-Bank、BFCL和NESTful基准上的组合式工具调用表现。在匹配监督微调条件下,循环计算普遍有利于组合与依赖感知的工具使用,多步工具调用准确率随循环深度增加而提升。自适应推理通过按需分配额外计算,实现了更优的计算-性能权衡,表明循环语言模型是智能体系统的有前景架构。
SPIEval 是一个人工策划的基准,基于推理、消歧、整合、偏好推断和多意图分解五种认知能力,包含 250 个任务、覆盖 10 个应用中 4,335 条个人记录,并通过 21 个工具支持多轮交互。评测九个大语言模型后发现,最佳模型 GPT-5.5 (xhigh) 准确率仅 57.3%,最弱模型仅 16.4%;79% 的失败源于信息定位不准确,且不到 2% 的检索动作采用高级搜索方法。
Mistral AI 获得美国专利 US 12,670,045 B1,涵盖一种基于代码实现的工具调用方法。该方法由大语言模型(LLM)生成封装工具调用的代码块,在服务器沙箱中执行,遇待处理调用时暂停并将请求发送至客户端执行,随后恢复代码块运行并替换结果。专利共 20 项权利要求,发明人为 Gabriel Vergnaud。
AntiSkillBench 是一个端到端基准,用于评估人格技能(persona skills)流水线中的隐私泄露、冒充风险与防御措施。其数据集包含 7,500 条基于 50 个行为丰富画像的人格对话轨迹,并覆盖三种技能蒸馏策略与四种防御配置。实验表明,风险在三个前沿智能体上持续存在,现有防御效果有限且依赖蒸馏策略。
Beacon 是一种新型智能体视觉推理模型,通过“模式自适应性”和“工具效应”两个维度重新审视工具使用。研究发现现有模型在模式自适应性上表现有限,工具带来的增益在简单问题上被抵消。Beacon 引入必要性感知自适应奖励和提示引导能力扩展机制,在多个基准上取得更强整体性能,并显著提升模式自适应性与工具效应。
JarvisHub 是一个面向长周期多模态创作的开放智能体框架,将可编辑画布作为用户工作区、智能体外部记忆、动作空间和共享项目状态,通过画布状态、协议桥接和智能体运行时三层架构,支持智能体在可检查、可编辑的创意状态中持续规划、生成、修改和组织多模态项目。该设计使创意智能体超越孤立的工具调用,实现可持续、可人工引导的创意自动化,用户可在全过程中检查、指导和干预。
DataFlow-Harness 通过引导 LLM 智能体执行类型化增量突变来构建平台原生有向无环图(DAG),而非生成自由格式脚本。在 12 项数据工程基准测试中,其端到端通过率达 93.3%,相比 Vanilla Claude Code 成本降低 72.5%、生成延迟降低 49.9%。
微软研究院等机构提出 Resource2Skill 框架,能从教程视频、代码仓库、文档等多模态资源中自动蒸馏出可复用的智能体技能,并组织成层级化 Skill Wiki。该框架覆盖幻灯片设计、网页生成、Excel 表格、Blender 场景、CAD 设计、UE5 场景构建和音乐制作七个创意软件领域。实验表明,技能访问在多个模型后端和领域上持续提升了智能体性能。
Apple 机器学习研究团队提出一种针对大语言模型函数调用的不确定性量化方法,旨在提升 LLM 在自主任务执行中的可靠性。该方法通过量化模型对函数调用参数和决策的置信度,帮助识别潜在错误调用。该研究目前处于学术探索阶段,未公布具体模型版本或开源计划。
多教师在线蒸馏虽能提升智能体模型的工具调用召回率,但会引发“过度调用”行为,即模型在应直接回答的样本上也调用工具。研究发现,该偏移源于模式入口和函数名等结构位置的 token 级信号存在行为杠杆失衡。提出的 Soft Clamp 方法通过动态压缩极端 token 级 JS 散度,在 APIGen-MT 上将过调用率从 13.7% 降至 9.0%,且不损失决策准确率。
PromptArmor 自 5 月中旬至 6 月底追踪 Claude 和 ChatGPT 的第三方连接器,发现 2517 个连接器中 931 个发生了能力或权限变更,新工具、权限范围、注入指令等在审批后持续漂移且缺乏重新确认机制。
LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。
PlanBench-XL是一个交互式基准测试,包含327个零售任务和1,665个工具,用于评估LLM智能体在检索受限工具可见性下的长时域规划能力。智能体需迭代检索并调用工具以逐步逼近最终目标。可选阻塞机制通过缺失、失败或干扰的工具函数模拟不确定性,迫使智能体检测中断路径并运行时自适应。在10个领先LLM上的实验显示,GPT-5.4在无阻塞条件下准确率为51.90%,最严重阻塞下骤降至11.36%。分析表明,当故障缺乏明确错误信号或恢复需要更长替代工具路径时,智能体尤其脆弱。PlanBench-XL为诊断智能体规划失败提供了测试平台。
客服领域的工具调用智能体需跨轮维护任务状态并遵守领域策略。标准方法将状态隐含在提示词中,易导致信息过时或策略违规。LedgerAgent 是一种推理时方法,将观察到的任务状态单独维护于分类账中并渲染到提示词;在改变环境的工具调用前,用分类账检查状态依赖的策略约束以阻止违规。在四个客服领域和混合开源/闭源模型上,LedgerAgent 的平均 passk 指标优于标准基于提示的工具调用方法,在多轮一致性指标上提升最大。
研究指出聚合分数排行榜无法反映部署场景真实表现,排名在分布外设置中不稳定。基于一个MCP工业基准进行了14项并行实现,涵盖多模态扩展、编排、检索、推理、基础设施及评估探针,并合并7个先前智能体基准。提出以预测有效性(样本内与样本外排名相关性)替代均值排名,构建12层测量框架,暴露HELM及其后继者忽视的部署维度。给出三个具有明确阈值的可证伪分布外标准,最后呈现预注册试点设计与下一代基准报告的前瞻性愿景。
HarnessBridge是一个轻量级可学习调控控制器,将智能体-环境接口参数化为双向投影:观测投影将原始轨迹蒸馏为紧凑、决策相关状态,动作投影将提议动作转换为可执行转换或轨迹接地拒绝。在harness监督数据集上通过统一指令微调训练,HarnessBridge在Terminal-Bench 2.0和SWE-bench Verified上匹配或超越强专用调控方案,同时大幅减少token使用和轨迹长度,并从小型生成器泛化到更大商业模型。
Evoflux是一种推理时进化搜索方法,通过结构化编辑、执行反馈、自适应强度、元引导重设计和多样性剪枝,将紧凑型语言模型的可执行工具工作流修复为可运行图。在覆盖250个工具和MCP服务器的MCP-Bench任务上,Evoflux将小型规划器的执行可行性从约3%提升至17-24%。相比之下,同一数据上的SFT和SFT+DPO表现持平、不如或崩溃至低于零样本水平;ReAct可达更高峰值但方差和token成本更高。结果表明,在稀缺教师轨迹预算下,基于执行反馈的搜索更可靠。
VoLoAgent是一个基于VLM的物理编排智能体,将异构机器人能力(VLA/WAM、视觉模型、动作原语)作为可中断工具,实现规划、监控与恢复。同时提出RoboVoLo基准,专为开放词汇长时程操作设计,涵盖常识、记忆/状态跟踪、复杂指代与世界知识,并提供任务级成功率和失败诊断。实验表明VoLoAgent显著优于单VLA/VLM或基于工具的系统,并在真实机器人上验证。
Retrospective Harness Optimization (RHO) 是一种自监督方法,仅利用过往轨迹优化LLM智能体的工具链(技能、工具和工作流程集合)。RHO从历史任务中选取多样化的困难任务核心集,并行重新执行;智能体通过自我验证和自我一致性分析回放,生成候选工具链更新,并依据自身成对自我偏好选择最有效更新。在软件工程、技术工作和知识工作三个领域评估中,单轮优化将SWE-Bench Pro通过率从59%提升至78%,无需外部评分。分析表明RHO有效针对先前失败模式,优化后的工具链改变智能体行为模式,在长周期会话中维持更高准确率。