Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,182条收录
1,119条精选

精选归档 · 第 29 页

561580 条 · 共 1,119

6月3日6月3日周三

星期三 · 11 条
10:02
公众号:数字生命卡兹克精选
AI 评分 66/100
Claude Code团队工程总监分享5条AI原生工作原则

Claude Code团队工程总监Fiona Fung提出,AI时代软件工程瓶颈从“写代码太贵”转移至验证、评审与安全。团队采用JIT规划,先做原型再补文档;遇到重复工作追问“能否自动化”,形成肌肉记忆。代码评审中Claude承担60-70%风格检查与漏洞捕捉,人类聚焦法律、安全与产品判断。角色边界模糊,PM写代码、工程师用Claude起草文案,招聘看重品味与判断力而非代码产出速度。

另有 1 家信源报道Claude:Blog(网页)
推荐理由:瓶颈从写代码转移到验证,这判断太准了。更实际的是自动化那些重复三次以上的事,这套逻辑正在Claude Code团队验证,值得每个带团队的人照抄。
07:02
Satya Nadella@satyanadella精选
AI 评分 74/100
微软与高通合作推出Project Solara平台With Project Solara, we are building a new platform purpose-built for agent-first devices.Excited to work with @cristianoamon and @Qualcomm on this!通过Project Solara,我们正在构建一个专为智能体优先设备打造的新平台。 很高兴能与@cristianoamon和@Qualcomm合作!

Cristiano R. Amon: We’re shifting from apps and operating systems to agents, and that changes the device experience end to end. Great conve...


推荐理由:微软和高通联手搞了个 Agent 优先的硬件平台 Project Solara,这标志着 AI 竞赛正式从模型卷到了设备,以后什么是智能终端可能要被重新定义。
05:16
Claude:Blog(网页)精选
AI 评分 77/100
Claude Code 新增动态工作流功能

Claude Code 新增动态工作流功能,允许模型在运行时即兴创建和协调多智能体框架来处理复杂任务。该功能通过执行特定的 JavaScript 文件来生成和协调拥有独立上下文窗口的子代理,可解决单一上下文窗口中长时间执行任务可能出现的智能惰性等问题。工作流适用于研究、安全分析、代码审查等场景,通常消耗更多 token,更适合高价值复杂任务,其最佳实践仍在发展中。

另有 4 家信源报道X:Thariq (@trq212)X:Claude Devs (@ClaudeDevs)Claude:Blog(网页)Claude Code:GitHub Releases(RSS)
推荐理由:Claude Code 现在能自己动态生成多代理协调器,这在调试、审查、研究等复杂任务上是个真正的生产力跃迁,但普通编码工作用它反而是杀鸡用牛刀。
03:00
Microsoft:Official Blog(RSS)精选
AI 评分 66/100
微软:企业成功的关键在于围绕AI构建集成智能体平台

微软认为,企业成功的关键在于围绕AI构建一个集成的智能体平台,而非仅拥有强大模型。该平台需遵循三大原则:单一集成系统、安全与治理内建、持续改进。微软正构建一个支持多种模型、以开发者为中心的开放平台,让智能体在软件交付、支持、财务等职能中执行长期工作。


推荐理由:微软把agent平台从散装工具升级成统一系统,这个「企业AI操作系统」的思路让治理和持续进化成为内置能力,而不只是模型和算力。
01:56
GitHub Blog精选
AI 评分 72/100
GitHub Copilot应用:智能体原生的桌面体验

在微软 Build 2026 大会上,GitHub 发布了新的工具和更新,并将 Copilot 应用定位为“智能体原生的桌面体验”。其核心目标是让 AI 智能体能够以用户已经习惯的方式进行工作。

另有 1 家信源报道The Verge:AI(RSS)
推荐理由:GitHub 把 Copilot 从插件变成了独立桌面应用,Agent 不再躲在 IDE 背后,这是 AI 编程从辅助工具走向桌面中枢的标志,开发者现在可以直接在桌面上跟 AI 协作了。
00:30
LangChain:Blog(RSS)精选
AI 评分 63/100
LangChain 发布 Rubrics:让 AI 智能体自我评估并修正工作

LangChain 推出 Rubrics,通过 RubricMiddleware 为智能体运行添加自我评估循环。用户可设定评分标准并配置评分器,在需要高正确性的任务中获得可靠输出。


推荐理由:为 Deep Agents 加了个自我纠错中间件,对需要高可靠性输出的开发者挺实用,虽不算大动作,但让 Agent 的可用性又近了一步。
00:00
Anthropic:Research(发表成果 · 网页)精选
AI 评分 77/100
AI驱动的网络威胁映射:LLM ATT&CK Navigator的洞察

Anthropic分析了832个因违反政策被封禁的恶意账户(2025年3月至2026年3月),将其活动映射到MITRE ATT&CK框架的全部14种战术和482种子技术。风险评分显示,中等及以上风险行为者比例从上半年的33%跃升至下半年的56%,增长集中在横向移动、凭证窃取、webshell等高危技术。Agentic scaffolding使攻击链实现自主编排——2025年11月一次间谍活动风险评分达100,所用技术数量却与中等风险者相当。MITRE ATT&CK框架尚未覆盖这种自主攻击。该报告与Verizon合作,已纳入2026年数据泄露调查报告;Anthropic据此更新了Claude的检测分类器以拦截高风险行为。

另有 1 家信源报道Anthropic:Research(发表成果 · 网页)
推荐理由:Anthropic 首次把一年内 832 个恶意账户的 AI 辅助攻击行为完整映射到 MITRE ATT&CK 框架,并给出风险评分工具,数据表明高风险攻击者半年内增长了七成,关键驱动力不是技术高低而是编排与自主执行,威胁情报团队应该马上拿来校准自己的检测规则。

6月2日6月2日周二

星期二 · 9 条
23:05
SenseTime@SenseTime_AI精选
AI 评分 81/100
商汤开源SenseNova-Skills AI办公技能套件Power smarter AI agents with #𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮-𝗦𝗸𝗶𝗹𝗹𝘀 🚀𝗔𝗻 𝗼𝗽𝗲𝗻-𝘀𝗼𝘂𝗿𝗰𝗲 𝗔𝗜 𝗼𝗳𝗳𝗶𝗰𝗲 𝘀𝗸𝗶𝗹𝗹 𝘀𝘂𝗶𝘁𝗲 𝗳𝗼𝗿 𝗮𝗻𝘆 𝘀𝗸𝗶𝗹𝗹𝘀-𝗰𝗼𝗺𝗽𝗮𝘁𝗶𝗯𝗹𝗲 𝗮𝗴𝗲𝗻𝘁, 𝗶𝗻𝗰𝗹𝘂𝗱𝗶𝗻𝗴 #𝗢𝗽𝗲𝗻𝗖𝗹𝗮𝘄 𝗮𝗻𝗱 #𝗛𝗲𝗿𝗺𝗲𝘀𝗔𝗴𝗲𝗻𝘁.🖼️ 𝗜𝗻𝗳𝗼𝗴𝗿𝗮𝗽𝗵𝗶𝗰 𝗚𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 — image generation & graphic design; mirror visual style from a reference📊 𝗗𝗮𝘁𝗮 𝗔𝗻𝗮𝗹𝘆𝘀𝗶𝘀 — multi‑sheet parsing, data cleaning, image-based data extraction and visualization📑 𝗣𝗣𝗧 𝗖𝗿𝗲𝗮𝘁𝗶𝗼𝗻 — outline & content generation, intelligent layout design; outputs editable PPT files🔍 𝗗𝗲𝗲𝗽 𝗥𝗲𝘀𝗲𝗮𝗿𝗰𝗵 — multi‑source search across academic, tech, social platforms & more; synthesizes insights & generates reportsNow fully #OpenSourced.👉 GitHub https://github.com/OpenSenseNova/SenseNova-Skills ⚡ Quick installation (bundled with Hermes Agent & OpenClaw) https://github.com/OpenSenseNova/SenseNova-Skills/blob/main/INSTALL.md 👾 Discord https://discord.gg/BuTXPHmQub商汤开源了AI办公技能套件SenseNova-Skills。这是一个为任何技能兼容智能体(如OpenClaw与HermesAgent)设计的开源技能集合,提供四大核心功能:图像信息图表生成(可镜像参考风格)、数据分析(支持多表解析、清洗与可视化)、PPT创建(生成大纲内容并智能排版,输出可编辑文件)以及深度研究(跨学术、技术、社交等多源搜索并生成报告)。该技能套件现已完全开源。

推荐理由:商汤掏出了一套开箱即用的 agent 技能包,从做图到写报告都能一键接,而且代码全在 GitHub 上。想做 agent 产品的可以直接 fork 当乐高用,比等 API 发布快多了。
22:40
Hugging Face:Blog(RSS)精选
AI 评分 73/100
Holo3.1:快速本地计算机使用智能体

Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包括 FP8、Q4 GGUF 和 NVFP4,以优化本地推理。在 AndroidWorld 基准测试中,35B-A3B 模型得分从 67% 提升至 79.3%。在 DGX Spark 上,NVFP4 量化相比 BF16 实现 1.74 倍 token 吞吐量提升,并将平均步骤时间从 6.8 秒缩短至 3.3 秒。模型支持函数调用协议,可在第三方智能体框架中部署。


推荐理由:Holo3.1 把计算机使用代理从桌面扩展到了移动端,还首次放出了量化版,让本地运行真正快了起来。想做 GUI 自动化的开发者可以立刻跑起来了。
13:40
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
OpenWebRL:面向视觉网页智能体的在线多轮强化学习开源框架

OpenWebRL是一个用于在真实网站上通过在线多轮强化学习训练视觉网页智能体的开源框架,覆盖了完整的训练流程。基于该框架训练的OpenWebRL-4B模型,在仅使用0.4K条监督初始化轨迹和2.2K个开放式RL训练任务的情况下,在Online-Mind2Web基准上达到67.0%成功率,在DeepShop基准上达到64.0%,超越了同规模或更大规模的先前开源智能体,性能可与OpenAI CUA和Gemini CUA等闭源系统竞争。该工作为构建更强、可复现且高性价比的开源网页智能体提供了实践路径。


推荐理由:做 Web Agent 的同行终于不用再羡慕闭源了。OpenWebRL 用 4B 模型和 2.2K RL 任务就逼近 OpenAI CUA,而且全开源,这路子值得认真读一读。
12:19
OpenRouter:Announcements(RSS)精选
AI 评分 77/100
OpenRouter 5月发布亮点

OpenRouter 发布5月更新,推出语音与转录API、模型融合(Model Fusion)功能,并为平台添加了私有模型和企业工作区管控能力。此次更新共上线20个新模型,其中包括 Gemini 3.5 Flash 和 Claude Opus 4.8。

另有 1 家信源报道OpenRouter:Announcements(RSS)
推荐理由:OpenRouter 五月交付了一整套平台级能力,从安全护栏到语音 API 再到模型融合,Pareto Code Router 按质量阈值选廉价模型这个思路,对 coding agent 的成本控制很实用。如果你重度依赖 OpenRouter,这次更新值得细读。
09:58
公众号:数字生命卡兹克精选
AI 评分 71/100
基于 Codex 的开源 AI 技能"清理垃圾.skill":自动扫描电脑生成 HTML 报告,一键清理垃圾

作者基于 Codex 创建并开源了“清理垃圾.skill”,可对 Mac 和 Windows 电脑进行只读扫描,自动生成可交互的 HTML 报告,将文件按优先级分为绿灯(可自动清理)、黄灯(建议手动)、红灯(跳过)。在作者的 MacBook Air 上扫出近 120 GB 垃圾,其中 96.7 GB 为 B 站离线缓存视频,而 CleanMyMac 仅检出 15.8 GB。用户可在网页上逐项或一键清理,全程需二次确认,项目已开源至 GitHub。


推荐理由:卡兹克这个开源skill直接用Agent清理电脑垃圾,比CleanMyMac更透明、可定制,而且马上就能用,是AI冲击工具软件的活案例。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
ACTS:面向高效可控LLM推理的智能体链式思维引导

ACTS将推理引导建模为马尔可夫决策过程,控制器智能体在推理中自适应引导冻结的推理器。控制器每步观察推理轨迹与剩余预算,发出含推理策略和引导短语的动作,实现预算感知的推理控制。控制器通过合成轨迹初始化,并经强化学习优化。在多个基准上,ACTS以显著token节省匹配全思考性能,实现可控的精度-效率权衡。代码已开源。


推荐理由:ACTS 把 LLM 推理过程变成可控制的 MDP,用预算感知的策略节省 token 同时保持精度,做推理加速的研究者应该试试他们开源的代码。
07:14
Cursor Blog精选
AI 评分 64/100
Cursor Teams计划定价方案更新

Cursor Teams计划推出三项更新:增加Composer特定使用池,将第一方模型(Composer和Auto)与第三方API的使用额度分开计费;推出Premium席位,提供5倍于标准席位($40/月)的使用量,价格为$96/月(年付);仪表盘现可实时显示用户额度使用情况,管理员可通过Slack或邮件配置智能提醒。


推荐理由:Cursor这个定价更新把「用不用得起第三方模型」的问题从团队开支里切出去了,标准席位加量不加价,重度用户直接上Premium可能比现在更划算,做Agent开发的团队不妨算算账。
05:48
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 66/100
OpenAI前沿模型与Codex现可在AWS上使用

OpenAI的前沿模型与Codex现已在AWS上全面可用。企业客户可通过其现有的AWS环境、控制与采购流程来使用OpenAI的AI技术,从而加速从评估到生产部署的过程。

另有 3 家信源报道X:OpenAI Developers (@OpenAIDevs)X:OpenAI (@OpenAI)X:Testing Catalog (@testingcatalog)
推荐理由:这不是模型发布,而是渠道开闸,企业拿着现有 AWS 安全体系就能用上 GPT-5.5,合规部门终于不用再纠结。Codex 也直接嵌入开发流程,落地阻力小了一大截。