Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,184条收录
1,120条精选

精选归档 · 第 39 页

761780 条 · 共 1,120

5月12日5月12日周二

星期二 · 7 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
Learning to Explore: 通过探索感知策略优化扩展智能体推理能力

研究提出了一种探索感知的强化学习框架,使LLM智能体能够在不确定性高时才进行自适应探索。该方法通过变分推理设计了细粒度奖励函数,评估探索性行动对改善未来决策的潜力,并引入探索感知分组机制,在优化过程中将探索行动与任务完成行动分离。实验表明,该方法在一系列基于文本和GUI的智能体基准测试中取得了持续的性能提升。相关代码与模型已在GitHub和HuggingFace平台开源。


推荐理由:让 Agent 拥有了「感知自己不知道什么」的能力,只在信息不足时才探索,而不是盲目试错,是 Agent 训练方法的一个重要转向,做强化学习或 Agent 的值得认真看下。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
Learning Agentic Policy from Action Guidance

针对大型语言模型的智能体强化学习提出新方法ActGuide-RL,通过引入日常人类交互产生的海量动作数据作为规划式参考指引,帮助策略克服难以抵达奖励状态的探索障碍。该方法采用最小干预原则,仅在必要时自适应启用指引以匹配任务难度,同时通过混合策略训练将探索收益内化回无指引策略。在搜索智能体基准测试中,ActGuide-RL相比零强化学习基线在GAIA和XBench上分别提升10.7和19个百分点,性能与需要大量监督微调数据的流程相当,为智能体强化学习提供了减少对繁重监督微调依赖的新范式。


推荐理由:Agent RL长期被基础策略的探索能力卡脖子,这篇论文用人类日常交互的动作数据做引导,不用重型SFT就追平现有pipeline,是训练范式层面一次务实创新。
04:01
OpenAI Developers@OpenAIDevs精选
AI 评分 69/100
Codex插件助力AI应用与智能体开发提速Codex can now help you build AI apps and agents faster with OpenAI APIs using the OpenAI Developers plugin.Codex现可通过OpenAI Developers插件,帮助您利用OpenAI API更快地构建AI应用和智能体。

推荐理由:把 Codex 直接接入 OpenAI API 开发流程,这是在给自家开发者递快刀,做 AI 应用和 Agent 的可以第一时间装上,省掉的不只是时间,还有调试的心力。
02:52
Claude Code:GitHub Releases(RSS)精选
AI 评分 72/100
Claude Code v2.1.139 版本更新

本次更新引入了多项新功能与优化。核心新增包括:集中管理会话的Agent视图(研究预览)、可设置目标并持续工作的/goal命令、实时调整滚轮速度的/scroll-speed命令,以及查看插件详情的claude plugin details命令。交互界面导航与控制能力得到增强。底层优化涵盖MCP服务器可获取CLAUDE_PROJECT_DIR环境变量、/context all的令牌估算会考虑模型分词器并显示舍入值。此外,修复了超过20项问题,如凭证死锁、内存无限制增长、权限规则、UI显示错误及路径处理等缺陷。


推荐理由:Claude Code 这波更新给了两个真正改变工作流的杀手功能,agent view 让你一眼看清所有会话,/goal 命令能让 Claude 自己跑完一个任务直到满足条件,做开发的同学可以立刻试试。
00:02
凡人小北@frxiaobei精选
AI 评分 85/100
Anthropic开源金融AI全栈模板,定义行业落地新标准Anthropic:“我正在金融街”。走自己的路,让别人无路可走。Anthropic在GitHub开源了金融服务行业AI解决方案完整模板库,包含10个端到端智能体、7个垂直行业插件及11家主流金融数据商的MCP连接器,覆盖投研、投行、风控等核心工作流。该库提供了从个人插件到企业API的部署方式,支持集成至Microsoft 365及私有云。此举为金融AI落地提供了开箱即用的标准作业程序,与OpenAI的消费级路线形成鲜明对比,凸显了其深耕企业场景、通过开源构建行业生态的战略意图。

Jason Zhu: Anthropic 真的惊为天人 直接把金融服务行业的 AI 工作流模板全开源了 投资银行 / 股票研究 / 私募 / 财富管理 / 基金管理 / KYC 风控 七大业务线的参考 agent / 技能包 / 数据连接器 全部公开 这超出了 ...


推荐理由:Anthropic 把金融行业 AI 落地的完整 SOP 开源了,10 个 agent 加 11 家数据商 MCP 连接器,这不是 demo,是逼迫全行业在 Claude 轨道上长,金融 AI 格局就此定型。

5月11日5月11日周一

星期一 · 5 条
22:30
OpenRouter@OpenRouter精选
AI 评分 76/100
帕累托代码以市场需求重塑模型选择Pareto Code is a new way of looking at the Pareto frontier using real market demandDeepSeek V4 Pro is taking the top position, followed by GPT 5.4 Mini and Gemini 3.1 Pro https://openrouter.ai/openrouter/pareto-codePareto Code 是一种利用真实市场需求观察帕累托前沿的新方法 DeepSeek V4 Pro 占据首位,其次是 GPT 5.4 Mini 和 Gemini 3.1 Pro https://openrouter.ai/openrouter/pareto-code

OpenRouter: Introducing Pareto Code: a new, free, experimental coding router Set `min_coding_score` in your request and route to the...


推荐理由:OpenRouter 这个实验性路由把模型选型从靠直觉变成了实时市场驱动的自动化决策,对预算敏感又看重编码质量的项目来说,是个值得一试的免费工具。
08:00
Thinking Machines Lab:官方博客(RSS)精选
AI 评分 59/100
Thinking Machines Lab发布Interaction Models研究预览

Thinking Machines Lab发布interaction models研究预览。该模型从零训练,原生处理音频、视频和文本,采用多流微回合设计实现实时响应,无需外部脚手架。研究预览展示了全新的交互能力,并在智能性与响应性上取得综合SOTA表现。


推荐理由:Thinking Machines 把实时交互训进了模型本身,不再是外挂脚手架,微轮次架构和 benchmark 数据很硬,做语音/视频助手的可以认真看看,虽然还是研究预览,但方向值得盯着。
03:43
Hugging Face:Blog(RSS)精选
AI 评分 74/100
MachinaCheck:基于AMD MI300X构建多智能体CNC可制造性分析系统

MachinaCheck是一款基于多智能体AI的系统,旨在革新小型CNC机加工车间的报价分析流程。传统上,车间经理需花费30-60分钟手动分析图纸,而该系统在上传STEP文件及材料、公差等简单输入后,能在30秒内生成完整的可制造性报告,明确指出零件能否制造、所需工具及生产前需采取的行动。其核心在AMD MI300X加速卡上本地运行Qwen 2.5 7B模型,利用192GB HBM3显存确保客户设计数据无需离开本地,满足了制造业对数据隐私的严格要求。系统采用五组件流水线,结合精确的几何特征提取与LLM的制造知识推理,最终输出结构化报告。


推荐理由:虽然是hackathon项目,但用多Agent做CNC可行性分析,把推理全压在本地AMD显卡上保护图纸隐私,还给了可跑的代码和Space,制造业AI落地就该这么直接。

5月10日5月10日周日

星期日 · 3 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
SimWorld Studio:基于进化编码智能体的具身智能学习环境自动生成平台

SimWorld Studio是一个基于Unreal Engine 5的开源平台,旨在为具身智能体学习自动生成动态演化的3D交互环境。其核心是工具增强的编码智能体SimCoder,它能根据指令编写引擎代码来构建物理真实的世界,并通过验证反馈自我进化,修正环境并积累可复用技能。生成的环境以标准化接口导出供智能体训练。平台还实现了环境生成与智能体学习的协同进化:根据智能体表现反馈,SimCoder在其能力边界附近生成自适应课程,使环境难度随智能体进步而提升。在具身导航案例中,该方案显著提升了智能体的泛化性能。


推荐理由:具身智能体一直缺训练环境,这个开源平台能自动生成并自我进化,机器人学走路可能终于不用靠手撸场景了,做仿真和机器人的该看一眼。
02:42
Hugging Face:Blog(RSS)精选
AI 评分 68/100
OncoAgent:一个用于隐私保护肿瘤临床决策支持的双层多智能体框架

研究团队发布了开源肿瘤临床决策支持系统OncoAgent。该系统采用双层多智能体框架,结合LangGraph拓扑与四阶段Corrective RAG流程,检索超过70份权威临床指南。系统根据查询复杂度,将任务路由至9B参数的速度优化模型或27B参数的深度推理模型,两者均通过QLoRA在AMD MI300X硬件上使用包含26万余病例的数据集进行微调。系统强制执行严格的零受保护健康信息政策,并通过三层反射安全验证器确保安全,支持完全本地部署以保护患者数据主权。


推荐理由:这个开源肿瘤AI系统把多智能体、RAG和隐私合规全塞进一台AMD服务器,临床落地又近了一步,不是那种只发论文不交代码的项目。

5月9日5月9日周六

星期六 · 5 条
15:50
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
Show HN: 适用于人工智能代理的 Git

开源项目“适用于人工智能代理的 Git”发布,旨在为AI代理提供类似Git的版本控制系统。该系统允许AI代理跟踪和管理其代码、提示词、模型权重等资产的变更历史,支持分支、合并与回滚操作。项目已在GitHub开源,并在Hacker News上获得100点热度。这一工具试图解决AI开发中工作流复杂、迭代难以追溯的问题,为多代理协作与实验管理提供标准化方案。


推荐理由:AI 代理的 Git,开源且能直接用。Agent 开发的版本控制痛点被正面解决,做复杂代理的值得试一下。
12:23
OpenRouter@OpenRouter精选
AI 评分 65/100
Hermes Agent登顶OpenRouter全球令牌排名Congrats to @NousResearch!祝贺@NousResearch! 【引用 @NousResearch】:Hermes Agent 现已在全球 @OpenRouter 令牌排名中位列第一。 虽然我们的旅程才刚刚开始,但我们想借此机会感谢我们的贡献者、支持者和用户,感谢他们为我们走到今天所做的一切。

Nous Research: Hermes Agent is now #1 on the Global @OpenRouter token rankings. While our journey together has just begun, we'd like to...


推荐理由:Hermes Agent在OpenRouter登顶,不是一次普通的排名更新,它代表Agent模型的调用量正式超过了通用聊天,做Agent的该兴奋了。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
AgentForesight:面向多智能体系统早期故障预测的在线审计框架

针对LLM多智能体系统在长程任务中因关键错误扩散导致整体失败的问题,本研究提出在线审计框架AgentForesight。该框架能在任务执行过程中实时观察轨迹前缀,并在最早的关键错误处发出警报。研究构建了AFTraj-2K轨迹语料库,并基于此开发了AgentForesight-7B模型。该模型采用由粗到细的强化学习策略训练,在AFTraj-2K和外部基准测试中,其性能超越GPT-4.1等领先专有模型,实现了高达+19.9%的性能提升,并将步骤定位误差降低3倍,从而将故障处理从事后归因转向部署时干预。


推荐理由:在多agent系统里,一个错误往往被下游接受并导致整个轨迹失败,这篇论文把事后归因变成了在线审计,用小模型在错误扩散前报警,比GPT-4.1还准,做agent部署的值得细读。
05:20
Elon Musk@elonmusk精选
AI 评分 75/100
Grok 升级推出全平台连接器功能Grok upgradesGrok 升级 【引用 @grok】:… 今天就在 iOS、Android 和 http://grok.com 上的所有计划中添加您的连接器到 Grok。

Grok: Let Grok fetch your emails, improve your slides, declutter your calendar or organize your Notion. Add your connectors to...


推荐理由:Elon 亲自下场推这个功能,说明 xAI 把 Grok 的定位从聊天转向行动,打通邮件和日历后,AI 帮你去做的杂事比帮你聊的多。
04:49
Chubby♨️@kimmonismus精选
AI 评分 76/100
DeepMind AI co-mathematician FrontierMath Tier 4 得分48% 预示数学研究范式转变DeepMind's AI co-mathematician scored 48% on FrontierMath Tier 4-research-level math problems that professional mathematicians need weeks to solve.The base model (Gemini 3.1 Pro) scores 19% alone. The entire jump comes from agentic scaffolding, parallel agents reviewing each other's proofs, writing code, searching literature. Not a smarter model, but smarter orchestration.Important context the paper openly provides: they bypassed the standard evaluation harness. 48 hours per problem, no token limits, their own infrastructure (page 14). So the 48% isn't directly comparable to other models on the leaderboard.What's more interesting than the score is the case study: Marc Lackenby used the system to solve an open problem from the Kourovka Notebook. The AI found a proof strategy, its own reviewer agent identified a flaw, and Lackenby, as a domain expert, filled the gap. Neither could have done it alone at that speed.The paper also names concrete failure modes: "reviewer-pleasing bias" (agents rewrite flawed arguments until the AI reviewer can no longer detect the error. And "death spirals") infinite review loops that degrade into hallucinated reasoning.For Erdős-type conjectures or millennium problems, these systems still can't generate the creative intuition that opens a proof path. What they compress: the time between having an idea and knowing whether it works. Literature search, counterexample hunting, computational verification, the exploratory grind.The takeaway from this paper is less about the benchmark and more about a paradigm shift: system design now compounds model capability in ways that matter for actual research. Thats why its a really intersting paper.DeepMind的AI co-mathematician在FrontierMath Tier 4研究级数学问题得分48%,而基础模型Gemini 3.1 Pro仅19%。提升源于多代理架构的智能编排,包括并行代理相互审查证明、编写代码和搜索文献,而非模型本身更智能。评估绕过标准框架,使用48小时每问题、无令牌限制的自有基础设施,因此得分不能直接与其他模型比较。案例中,数学家Marc Lackenby与AI合作解决Kourovka Notebook开放问题,AI提供证明策略,审查代理发现缺陷,人类专家填补空白,展示了高效人机协作。系统存在"reviewer-pleasing bias"和"death spirals"等失败模式。对于Erdős型猜想或千年问题,AI仍缺乏创造性直觉,但能压缩从想法到验证的时间,加速文献搜索和计算验证。论文强调范式转变:系统设计以对实际研究重要的方式复合模型能力,推动数学向数学家与AI代理协作的未来发展。

Pushmeet Kohli: The future of Math is mathematicians and AI agents working together. Very pleased to introduce @GoogleDeepMind's AI co-m...


推荐理由:48%的得分背后是系统设计对模型能力的碾压,失败模式「reviewer-pleasing bias」和死亡螺旋比分数更有价值,提醒我们架构创新才是落地的真杠杆。