Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,184条收录
1,120条精选

精选归档 · 第 38 页

741760 条 · 共 1,120

5月14日5月14日周四

星期四 · 6 条
03:48
Cursor Blog精选
AI 评分 67/100
为智能体配置开发环境

Cursor发布新工具,用于配置云端智能体开发环境。核心更新包括:支持多仓库环境,使智能体可跨代码库协同工作;提供基于Dockerfile的代码化配置,支持构建密钥并优化缓存,命中缓存后构建速度提升70%;增强由智能体主导的环境设置流程,提供验证与故障回退机制。同时新增环境治理与安全功能,如版本历史、审计日志,以及可在环境级别独立管控的网络出口和密钥权限。这些改进旨在帮助团队在受控环境中更高效地运行能端到端处理任务的并行智能体集群。


推荐理由:Cursor 云代理这次把多仓库、环境即代码和审计控制打包补齐,让开发团队可以真正放养一队 agent 跑端到端任务,企业落地门槛降了一大截。
03:29
Claude:Blog(网页)精选
AI 评分 73/100
Claude 电脑与浏览器使用的最佳实践

Claude 最新模型在电脑与浏览器使用能力上显著提升,支持构建复杂智能体系统。本文针对Claude 4.6系列和Opus 4.7提供实践指南,重点优化截图分辨率:Claude 4.6系列API限制最大长边1568像素、总像素115万;Opus 4.7提升至最大长边2576像素、总像素375万。发送前将截图缩放到限制内是提升点击准确性的最有效方法。推荐起始分辨率为1280x720,Opus 4.7用户可优先使用1080p,并避免发送未经缩放的原始截图或过低分辨率图像。


推荐理由:如果你正在让 Claude 操作桌面或浏览器,这篇官方指南把分辨率、token 压缩和缓存策略一次讲透了,附带代码和踩坑表,是那种"读完就能少写一堆 bug"的硬核文档。
03:18
Tomer Tunguz 博客(VC 分析)精选
AI 评分 59/100
The 6 Messages That Actually Matter

知识工作者平均每天收到121封邮件,传统收件箱处理模式难以为继。未来邮件处理将转向高度个性化与自动化:用户能用自然语言定义处理规则,实现收据自动转发、销售线索自动录入CRM等流程。所有历史邮件将构成个人上下文层,为AI处理新邮件提供背景信息,敏感信息则由设备端模型进行私密处理。最终,收件箱本身将消失,真正重要的信息可能浓缩至仅6条。


推荐理由:Tunguz 描绘了一个让收件箱消失的未来,关键是那 6 条真正重要的消息如何被 AI 接管,做产品的人可以把这个当成工作流重构的思考起点。
01:02
Runway:News(网页)精选
AI 评分 76/100
Introducing Runway Agent

Runway正式发布Runway Agent,这是一个能够通过单次对话将创意想法转化为完整、可发布视频的智能创作伙伴。用户只需用自然语言描述需求,Agent便能根据上下文和目标,自主完成概念提案、故事节奏设计、视觉方向规划,并最终生成包含多场景、旁白、对话和音乐的成片。它旨在为品牌团队、营销人员、创意机构和电影制作人快速生产各类视频内容,如品牌宣传、社交媒体素材和短片,将传统需要数天或数周的审核制作周期压缩至几分钟。该产品现已上线,新免费计划用户可获得1500积分用于制作首个视频。


推荐理由:Runway Agent 把视频生产从“一个团队干一周”变成“一个人聊十分钟”,品牌和内容团队的视频成本结构可能就此改写。
00:28
Anthropic:Newsroom(网页)精选
AI 评分 80/100
Anthropic推出面向小型企业的Claude服务包

Anthropic推出“Claude for Small Business”服务包,旨在帮助小型企业弥补在AI应用资源上与大型公司的差距。该产品包含一系列连接器和15个开箱即用的自动化工作流,能将Claude深度集成到QuickBooks、PayPal、HubSpot等企业日常工具中。其核心功能是自动化处理财务、运营、销售等领域的重复性任务,如规划薪资、月末结算、追踪发票和分析营销活动等。用户通过Claude Cowork界面操作并手动批准关键步骤,所有任务均由用户发起和控制,Anthropic承诺保障数据安全。


推荐理由:Anthropic 把 Claude 装进 QuickBooks、PayPal、HubSpot,直接帮小老板跑 payroll、关账、催发票,这是 AI 第一次真正为那些「深夜还在忙杂务」的人减负,小企业主和做 SaaS 的朋友值得细看。

5月13日5月13日周三

星期三 · 13 条
11:55
Tencent Hy@TencentHunyuan精选
AI 评分 76/100
Hy3预览版登陆GMI,开源最强模型领跑Hy3 preview is now on @gmi_cloud. 🙌Hy3 预览版现已登陆 @gmi_cloud。🙌

GMI Cloud: Hy3 preview from @TencentHunyuan is now live on GMI #1 on OpenRouter's LLM leaderboard, open-sourced, and the strongest ...


推荐理由:腾讯混元 Hy3 开源且登顶 OpenRouter 排行榜,295B MoE 架构在推理和代码上提升明显,不是小厂的刷榜产品,搞 agent 和 coding 的可以认真试试。
11:38
公众号:MiniMax(稀宇科技)精选
AI 评分 68/100
MiniMax 升级 Agent 为 Mavis,推出 Agent Teams 多智能体协作

MiniMax 将升级后的 Agent 命名为 Mavis,并上线 Agent Teams,支持桌面端多个 Agent 并行协作,以解决单 Agent 在复杂任务中易中途停止、长任务性能下降、响应慢及角色分工不清等痛点。


推荐理由:把多 Agent 系统的交接、共享与聚合成本摊开讲,比多数产品发布更实在地描述了从演示走向交付需要跨过的基础设施门槛,对选型团队有参考价值。
07:27
Hacker News:AI 热帖精选
AI 评分 76/100
展示 HN:Statewright--通过可视化状态机提升AI智能体可靠性

Statewright 是一个通过状态机为AI智能体提供约束的系统,能控制其在各阶段可使用的工具,从而聚焦推理并提升可靠性。它将工作流定义为规划、实施、测试等多个阶段,自动执行工具限制与状态转换。在本地模型测试中,两个模型在5项SWE-bench子任务上应用约束后,正确率从2/10显著提升至10/10。该系统已集成到Claude Code等平台,一个修复测试失败的典型工作流可在46秒内完成。


推荐理由:Statewright用状态机给AI代理上“紧箍咒”,让13B小模型也能搞定SWE-bench任务,做coding agent的应该立刻装上试试。
04:33
OpenAI Developers@OpenAIDevs精选
AI 评分 70/100
Codex实现跨应用无感多任务处理Computer use lets Codex work across your apps without taking over your Mac.@AriX talks with @romainhuet about what changes when agents can click, type, and keep working in the background.计算机使用让Codex能在你的应用间工作而不占用你的Mac。 @AriX与@romainhuet探讨当代理程序能点击、输入并在后台持续工作时将带来哪些改变。

推荐理由:Codex 这个「computer use」不接管整台 Mac,只在后台帮你点、帮你打字,对用过 Cursor 接管全屏后心里发毛的开发者来说,是个更让人放心的设计,但有没有宣传的那么顺还得等实测。
03:08
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 64/100
Parameter Golf 揭示了关于 AI 辅助研究的哪些经验

Parameter Golf 项目汇聚了超过 1000 名参与者和 2000 多份提交作品,在严格限制条件下探索了 AI 辅助的机器学习研究、编码智能体、模型量化及新颖模型设计。活动展示了 AI 工具如何帮助研究人员在受限参数规模下优化模型性能,推动了高效模型架构与自动化代码生成技术的实践进展。核心发现包括智能体协作能显著提升研究效率,而量化技术可在微小精度损失下大幅压缩模型体积。


推荐理由:OpenAI让1000多人一起玩AI辅助研究,这篇复盘给出了几个很实在的教训,尤其关于代码Agent和量化,搞研究的人值得花五分钟读一下。
02:54
Claude:Blog(网页)精选
AI 评分 58/100
Anthropic 网络安全团队如何利用 Claude Code 构建威胁检测平台

Anthropic 检测平台工程团队技术负责人 Jackie Bow 运用 Claude Code 开发了 CLUE 威胁检测与响应平台。该平台通过自然语言界面连接内部系统,包含 CLUE Triage 自动初筛警报,整合上下文信息分配处置建议;以及 CLUE Investigate 支持分析师用自然语言查询日志,由 Claude 自动生成并执行查询,将数小时的人工分析缩短至几分钟。团队在一天内完成概念验证,一周内交付实现,显著提升了安全运营效率。


推荐理由:我一直好奇大模型公司自己怎么用 AI 做安全,这篇挖出了 Anthropic 内部 CLUE 平台的构建细节——从一天出原型到每周省下 234 人天,数据比很多 PR 稿扎实。
01:54
Claude:Blog(网页)精选
AI 评分 73/100
Claude进军法律行业

Anthropic公司为法律行业发布20多个新的MCP连接器及12个专用插件,将Claude深度集成至合同管理、文档处理等法律核心软件栈。Claude现可直接在Microsoft Word、Outlook等办公应用中无缝工作,具备起草、修订、条款比对等可复用技能,并能自动化处理日常法律事务。公司同时宣布与多个司法公益组织合作,以扩大法律服务的可及性。


推荐理由:Claude 这次在法律行业的布局很大,20+ 连接器和 12 个插件意味着它不是做表面集成,而是把律师的整套工具链都拉了进来——对律所是效率革命,对做垂直 AI 产品的团队则是教科书级的行业解决方案示范。
01:33
01:05
Google Developers Blog(RSS)精选
AI 评分 73/100
使用ADK构建可暂停、恢复且永不丢失上下文的长时运行AI智能体

本文探讨了如何从无状态聊天机器人升级为生产级AI智能体,以管理长达数天或数周的企业工作流程(如HR入职)。通过引入Agent Development Kit(ADK),其架构核心采用持久状态机和持久化会话存储,确保智能体在“空闲时间”或服务器重启时永不丢失上下文。系统利用事件驱动的Webhook和多智能体委托机制,实现在暂停期间“休眠”,并在唤醒后以高推理准确性恢复复杂任务,从而构建出具备韧性和可靠性的长时运行智能体系统。


推荐理由:Google 官方手把手教你把无状态 chatbot 升级成能跨天跨周的持久化 agent,状态机和持久会话是两个关键切入点,做过生产环境 agent 的都懂这东西有多刚需。
00:24
Claude:Blog(网页)精选
AI 评分 58/100
Code w/ Claude SF 2026开发者大会:基于AI指数级增长的构建

在Code w/ Claude SF 2026开发者大会上,Anthropic宣布提升开发者工具能力。Claude Code的速率限制翻倍,Claude Opus的API限制提高,以支持大规模可靠开发。同时,Claude平台上的托管智能体新增四项功能:“梦想”功能通过回顾会话优化记忆;多智能体编排支持主智能体并行委派子任务;“成果”功能通过定义输出标准提升任务成功率,内部测试显示最难问题成功率最多提升10%;Webhooks提供任务完成通知。大会主题演讲和分组会议录像已上线,并计划在伦敦和东京举办后续活动。


推荐理由:虽然已是旧闻,但Dreaming和Outcomes这两个功能让agent能自我改进,是构建生产级AI团队的真信号,做Claude开发的值得补课。

5月12日5月12日周二

星期二 · 1 条
22:40
Google DeepMind:Blog(RSS)精选
AI 评分 57/100
Co-Scientist:一个加速研究的多智能体AI伙伴

Co-Scientist 是一款由 Gemini 构建的协作式 AI 助手,旨在帮助科研人员加速科学突破。它通过多智能体(multi-agent)的架构设计,作为研究人员的智能伙伴参与工作流程,以提升研究效率并推动创新发现。


推荐理由:Google DeepMind 推出的科研助手,用多智能体框架帮科学家加速实验设计,如果做生物/材料领域研究,值得跟踪一下,但对其他领域暂时可能还是个概念。