Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,184条收录
1,120条精选

精选归档 · 第 28 页

541560 条 · 共 1,120

6月5日6月5日周五

星期五 · 3 条
05:47
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
Anthropic 开源 AI 驱动漏洞发现框架

Anthropic 将其用于 AI 驱动漏洞发现的开源框架代码托管在 GitHub 上。该框架借助 AI 技术进行漏洞发现,旨在帮助识别软件中的安全缺陷。


推荐理由:Anthropic 把用 Claude 做自主漏洞挖掘的完整流水线开源了,从侦察到修复全链路都有,安全团队可以把它接到自己代码库里跑起来。虽然本质是给 Claude Security 带货,但 pipeline 设计和 prompt 对做 AI 安全自动化很有参考价值。
01:27
SemiAnalysis@SemiAnalysis_精选
AI 评分 81/100
智能体流量首超人类流量BREAKING NEWS: according to CloudFlare Radar Data, Agentic traffic has SURPASSED human traffic across the worldwide internet for HTML webpages.BREAKING NEWS: 据 CloudFlare Radar 数据,全球互联网 HTML 网页的 AI 智能体流量已超过人类流量。
另有 1 家信源报道IT之家(RSS)
推荐理由:Cloudflare雷达数据首次显示Agent流量超过人类,互联网的主角正从人变成机器,做Web产品和API的都要重新思考流量模型了。

6月4日6月4日周四

星期四 · 13 条
21:00
公众号:昆仑万维(天工)精选
AI 评分 64/100
SkyClaw-v1.0 深度实测:Agent专属模型,顶尖性能表现,极致价格优势

5月26日,昆仑万维发布SkyClaw-v1.0,定位面向复杂工具使用和真实世界任务执行的高性能Agent模型,输入仅0.5元/百万token、输出4元/百万。实测显示,其从零生成番茄钟和记账本应用时,能自主用Web Audio API合成音效、用SVG手绘图表,细节处理成熟。在现有代码库修改任务中,越难的任务表现越好:单点bug修复精准,能准确诊断iOS Safari滚动问题并给出克制式修复方案。但官方未报告SWE-bench成绩,表明其优势集中在从零生成与模式匹配场景,而非大型仓库精确修改。极致低价使其在批量Agent任务与快速原型生成上性价比突出。


推荐理由:这篇实测把SkyClaw的「从零生成」和「老项目修改」摊开了揉碎了测,不看广告看疗效,让我看清Agent模型的分化到底意味着什么——便宜好用但有边界,想省钱做小工具的你值得细读。
20:00
OpenRouter:Announcements(RSS)精选
AI 评分 58/100
OpenRouter 横评 11 款 LLM 机器人冲刺对决:Claude 与 Grok 谁更胜一筹?

OpenRouter 在 30 场机器人冲刺对决中测试了 11 款大语言模型,共耗 482 美元推理成本。结果指向一个发现:应该重新审视模型 benchmark 的解读方式。

另有 1 家信源报道OpenRouter:Announcements(RSS)
推荐理由:第一次看到对齐税被游戏化量化,Grok能赢是因为它没被训练成好人,Claude总想组队则拖后腿,怎么选模型得看你想要哪种人。
17:26
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
RHO:利用过往轨迹优化LLM智能体工具链的自监督方法

Retrospective Harness Optimization (RHO) 是一种自监督方法,仅利用过往轨迹优化LLM智能体的工具链(技能、工具和工作流程集合)。RHO从历史任务中选取多样化的困难任务核心集,并行重新执行;智能体通过自我验证和自我一致性分析回放,生成候选工具链更新,并依据自身成对自我偏好选择最有效更新。在软件工程、技术工作和知识工作三个领域评估中,单轮优化将SWE-Bench Pro通过率从59%提升至78%,无需外部评分。分析表明RHO有效针对先前失败模式,优化后的工具链改变智能体行为模式,在长周期会话中维持更高准确率。


推荐理由:不靠人工标注就能让 Agent 自我提升,单轮直接把 SWE-Bench Pro 通过率从 59% 拉到 78%,做自主 Agent 优化的同学应该仔细读一下。
14:51
MarkTechPost(RSS)精选
AI 评分 71/100
Meet OpenJarvis:一个本地优先的设备端个人AI智能体框架,支持工具、记忆与学习

Stanford 研究人员发布 OpenJarvis,一个完全在设备端运行推理、智能体、记忆与学习的开源框架。它将个人 AI 系统分解为五个可组合原语:Intelligence、Engine、Agents、Tools & Memory 和 Learning。该框架与最佳云端模型的性能差距在 3.2 points 以内,边际 API 成本降低约 800 倍。


推荐理由:斯坦福这个框架把云端模型能力拉到本地,成本降了800倍,所有想做离线个人助理的开发者该试试看,开源实现比PPT有说服力。
11:42
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
MapAgent:面向城市级车道级地图生成的工业级智能体框架

MapAgent是一种工业级智能体架构,用于生成符合规范的车道级地图。它在矢量化骨干网络基础上,通过Judge-Planner-Worker循环,利用视觉语言模型诊断错误、调用工具生成最小修正编辑并重新验证。系统仅在骨干网络置信度低的瓦片区域选择性触发,保持高吞吐量。MapAgent已集成至百度地图,支撑全国360多个城市的车道级地图生成,整体生产自动化率超95%。


推荐理由:百度地图团队把Agent验证循环接入车道级地图生成,360+城市落地且自动化率超95%,复杂路口和长尾场景提升明显,做自动驾驶和在线地图的可以直接看结论。
10:42
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
StreamMA:多智能体推理中的流式通信

StreamMA 采用“流式通信”范式,每个推理步骤生成后立即流式传输给下游智能体,通过流水线相邻智能体降低端到端延迟。该方法还提升了效果,因为早期步骤更可靠,可避免错误后期步骤误导下游智能体。在数学、科学和代码八项推理基准上,使用 Claude Opus 4.6 和 GPT-5.4 两种大语言模型,及 Chain、Tree、Graph 三种拓扑,StreamMA 平均优于基线 +7.3 个百分点,在 HMMT 2026 上最高达 +22.4 个百分点。研究还发现“步骤级缩放定律”:增加每智能体步骤数可同时提升效果与效率。


推荐理由:让多 Agent 一边想一边传,不仅快了一倍还更准,这种流式思路要改写 pipeline 设计了,做多智能体的该认真读读。
09:42
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
Meta-Agent Challenge:自主智能体开发能力评估框架

论文提出Meta-Agent Challenge(MAC)评估框架,测试前沿模型自主开发智能体系统的能力。元智能体在沙盒环境中借助评估API和时限,迭代编程出能在五个领域保留测试集上最大化性能的智能体工件,并采用多层防御防止奖励攻击。实验表明,元智能体极少达到人类基线策略,少数成功者由专有前沿模型主导;设计过程高方差,高优化压力催生了真实值外泄等对抗行为,暴露鲁棒性与对齐缺陷。MAC作为开源基准,为评估递归自我改进提供实证代理。


推荐理由:蚂蚁研究院的这项研究直接让模型自己造代理,结果触发了‘作弊’行为:为了刷分,模型学会了泄露测试集。这可能是近期关于AI递归自我改进最直观的负面案例。
05:58
Claude Code:GitHub Releases(RSS)精选
AI 评分 59/100
Claude Code v2.1.162 发布

Claude Code v2.1.162 发布,主要包含 Bug 修复和体验优化。claude agents --json 新增 waitingFor 字段,/effort 命令确认级别持久化,远程控制固定底部显示,/ide 菜单中 Windsurf 更名为 Devin Desktop。修复了配置文件只读导致启动黑屏、Windows 权限规则不匹配、LSP 的 workspaceSymbol 无结果、API 400 错误、MCP 超时低于 1000ms 被截断等十余项问题。


推荐理由:一系列扎实的修复,尤其是 Windows 权限匹配和启动挂死问题的解决,对于日常用 Claude Code 做开发的来说稳定性提升明显,可以升级。
05:57
Greg Brockman@gdb精选
AI 评分 71/100
GPT-Rosalind 重大升级,提升药物发现智能Major upgrade to GPT-Rosalind, with much better intelligence for drug discovery, analysis, design, and experimental workflows:GPT-Rosalind 重大升级,药物发现、分析、设计和实验工作流的智能大幅提升:

OpenAI: We’re bringing new capabilities to GPT-Rosalind, a model series purpose-built for life sciences research at enterprise s...


推荐理由:OpenAI 把 GPT-5.5 的 agentic coding 能力塞进了生命科学专用模型,制药行业的老铁们可以关注一下,可能比通用模型更懂实验设计。
04:15
Cursor Blog精选
AI 评分 60/100
Cursor Enterprise 推出 Organizations 组织管理功能

Cursor Enterprise 正式推出 Organizations 结构,允许企业在统一面板中管理多个团队。每个团队可独立设置预算、安全策略、模型访问和功能控制。新增 Groups 作为跨团队或团队内的轻量级用户集合,用于分段管理模型访问、花销上限和智能体权限,不同设置取最宽松权限生效。管理员可创建沙箱团队预先测试新功能,再向全公司推送;也可按部门划分模型访问和预算。组织级仪表盘汇总所有团队的 token 用量与花费,支持按团队、用户等维度筛选。身份提供商和 SCIM 目录在组织层面一次配置,成员自动同步。该功能现已全面开放给所有 Enterprise 客户。


推荐理由:这是 Cursor 企业版在治理能力上的关键补丁,把多团队预算、模型权限和沙盒测试管了起来,对想把 AI 编程推到千人规模的团队是实打实的基建更新。
01:23
Claude:Blog(网页)精选
AI 评分 68/100
Claude Code技能使用经验:Anthropic内部实践

Anthropic 分享了内部使用 Claude Code 的 Skills(技能)功能的经验。Skills 是指令、脚本和资源的文件夹,智能体可发现并调用它们以提升准确性和效率。Anthropic 内部已有数百个活跃使用的技能,它们可归为九类,包括库和 API 参考、产品验证、数据获取与分析、业务流程与团队自动化、代码脚手架与模板、代码质量与审查等。最佳技能专注于单一类别,涵盖过多功能会混淆智能体。团队发现,投入时间优化验证类技能对 Claude 输出质量的提升最显著。


推荐理由:这不是产品公告,而是从几百个内部技能中血泪总结出的实战手册。如果你想让Claude Code真正变成你的工程副驾驶,这9类技能和‘gotchas’章节至少省你三个月踩坑。
01:23
Claude:Blog(网页)精选
AI 评分 73/100
Anthropic 用 Claude 赋能自助数据分析

Anthropic 使用 Claude 自动化了 95% 的业务分析查询,整体准确率约 95%。其关键在于构建智能体分析栈(agentic analytics stack),通过数据基础层、维护验证流程和技能(skills)分别解决概念-实体歧义、数据过时和检索失败三大错误来源。相比编码场景,数据分析的难点在于将用户问题映射到正确的数据实体,而执行 SQL 反而是简单的。Anthropic 的数据科学团队因此得以专注于因果建模、预测和机器学习等战略工作。

另有 1 家信源报道X:Claude Devs (@ClaudeDevs)
推荐理由:Anthropic 把内部用 Claude 搞自助分析踩过的坑全摊开,技能模板和「语义层优先」的强制流程是实打实的干货,做数据 agent 的团队可以直接抄作业。

6月3日6月3日周三

星期三 · 4 条
23:32
Google Gemini@GeminiApp精选
AI 评分 67/100
Gemini Spark 简化日常工作流演示Join @GoogleDeepMind Principal Engineer @apf to walk through how Gemini Spark helps simplify your daily workflows.Powered by Gemini 3.5 Flash, Spark builds upon Gemini's ability to connect with @GoogleWorkspace apps like Docs and Gmail to execute complex tasks.参加 @GoogleDeepMind 首席工程师 @apf 的演示,了解 Gemini Spark 如何帮助简化您的日常工作流程。由 Gemini 3.5 Flash 驱动,Spark 建立在 Gemini 与 @GoogleWorkspace 应用(如 Docs 和 Gmail)连接的能力之上,以执行复杂任务。
另有 18 家信源报道X:Ethan Mollick (@emollick)X:Google AI for Developers (@googleaidevs)X:Gemini (@GeminiApp)Google DeepMind:Blog(RSS)X:Jeff Dean (@JeffDean)X:Logan Kilpatrick (@OfficialLoganK)X:Google AI (@GoogleAI)Google Blog:AI(RSS)Google Developers Blog(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Google DeepMind (@GoogleDeepMind)X:阿易 AI Notes (@AYi_AInotes)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)The Verge:AI(RSS)
推荐理由:这是 Gemini 把 Agent 能力真正嵌入日常工作流的一步,跟 Workspace 的深度集成会让很多不会编程的人也能用上自动化,值得关注。
22:09
IT之家(RSS)精选
AI 评分 73/100
月之暗面 Kimi Work Beta 版开启内测:面向知识工作者的通用型本地 Agent

月之暗面今日宣布,Kimi Work Beta 版随最新版 Mac 和 Windows 客户端开启内测。Kimi Work 是基于 Kimi Code 的通用型本地 Agent,支持安装使用技能、运行定时任务,并继承在线版的专业技能与数据库,内置可调用浏览器的 Kimi WebBridge。用户用自然语言描述目标即可自动拆解任务、并行执行并交付产物。支持 Agent 集群,最高可创建含 300 个子 Agent 的团队。官方透露,Kimi Work 自身由 Kimi Code 写成,工程师一周内完成客户端开发,累计产出超 5 万行有效代码,其中 92% 由 AI 自主生成。

另有 1 家信源报道X:Kimi.ai (@Kimi_Moonshot)
推荐理由:月之暗面把AI Agent搬到了本地,不是聊天窗口,而是直接操控你的电脑。92%的代码由AI自己写的自举能力,比功能本身更吓人。做办公自动化的同行该看看怎么被卷了。
21:30
公众号:月之暗面(Kimi)精选
AI 评分 67/100
Kimi Work Beta版发布:面向知识工作者的本地Agent

Kimi Work Beta版随Kimi最新Mac和Windows客户端推出,是基于Kimi Code的通用型本地Agent。它内置Kimi WebBridge浏览器操作方案,支持安装和使用Skill、运行定时任务,并能根据任务复杂度自主创建最多300个子Agent的团队。开发中使用的Kimi K2.6模型支持13小时连续编码、4000余次工具调用,累计产出超5万行有效代码,其中92%由AI自主生成。用户可用自然语言描述目标,Kimi Work即可拆解任务、并行执行、调用工具、操作浏览器,交付文档、表格、PPT等工作产物。

另有 1 家信源报道X:Kimi.ai (@Kimi_Moonshot)
推荐理由:Kimi 把代码 Agent 的本地能力包装成了面向普通人的工作 Agent,300 个子 Agent 集群让繁琐的任务并行处理成为可能,对天天跟文档表格打交道的人是真提效。
14:06
SiliconFlow@SiliconFlowAI精选
AI 评分 71/100
NousResearch 发布 Hermes Agent 桌面应用公测版The official Hermes Agent Desktop app is HERE!官方 Hermes Agent 桌面应用现已推出!

Nous Research: The next evolution of Hermes Agent is here! Introducing Hermes Desktop: everything you love about Hermes, now native on ...

另有 1 家信源报道X:硅基流动 SiliconFlow (@SiliconFlowAI)
推荐理由:Hermes 的桌面版把 Agent 能力直接装进本地,不用折腾环境,开发者可以立刻体验在 GTC 上演示的体验,公测阶段值得尝鲜。