Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,184条收录
1,120条精选

精选归档 · 第 14 页

261280 条 · 共 1,120

7月15日7月15日周三

星期三 · 7 条
10:42
AYi@AYi_AInotes精选
AI 评分 78/100
Airtap iMessage 新功能:发条短信让 AI 替你操作手机刚演示完帮我刷 TikTok,转头就跑通了星巴克点单,AI真的无感的刚我点好了一杯美式,感觉Airtap 这步迈得比预想的狠啊。你不用装 TikTok,也不用装星巴克 App,甚至不用开任何新软件,给手机通讯录里的号码发条 iMessage,它能直接替你选品加购走到结账页,全程靠视觉模拟真人点屏幕,不是对接专属 API。原推说 “手机 = 装 App 的逻辑要重想”,现在这个判断又实了一步。 也就是说它不仅能替你处理信息,还能替你替你完成交易, 当然最后支付还得你自己接手,毕竟真金白银的账号没人敢直接交出去,信任这道坎所有 Agent 厂商肯定是都绕不过去的,我觉得当触发服务的门槛,从下载注册一个 App 降到发一条短信,那原来的agent的入口逻辑,真的在一点点碎掉~Airtap 推出 iMessage 新功能,用户只需给美国号码发一条 iMessage,其云手机上的 AI Agent 就能通过视觉模拟点击,替用户完成 TikTok 刷视频、星巴克点单等操作,无需安装对应 App。其架构分为三层:大脑(理解指令)、AutoPilot(视觉操控屏幕)、云手机(24小时在线)。但支付等敏感操作仍需用户手动完成,信任与授权仍是所有 Agent 厂商的难题。

AYi: 卧槽真的有点炸裂兄弟们,我在国内连 TikTok 都装不了,结果在手机里发了条 iMessage,一个远在美国的 AI Agent 竟然替我注册了一个TikTok号,还帮我刷完了 10 条 TikTok 热门视频,把视频总结都直接发了回来,...


推荐理由:阿易实测 Airtap 从刷 TikTok 到点星巴克,把 Agent 从信息处理推到交易环节,虽然最后支付还得手动,但不用装 App 就能办事这条路,真的在敲碎原有产品入口逻辑。做产品的值得盯着,信任问题也是所有 Agent 绕不过去的。
10:40
公众号:通义实验室(千问)精选
AI 评分 73/100
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。


推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
10:31
公众号:通义实验室(千问)精选
AI 评分 78/100
Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?

阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。


推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。
10:10
公众号:卡尔的AI沃茨精选
AI 评分 71/100
开源 LLM TODO Skill"阿福":用 Claude Code 和 Codex 实现知识管理到排期自动化

作者基于 API 版 Fable5 和 Codex 开发了开源 TODO Skill“阿福”,用于将收件箱中的待办资料自动转为 Markdown 任务卡,识别信息不完整项(如视频链接需通过 yt-dlp 和本地 Whisper 提取字幕),并支持批量排期、AI 分组合并、拖拽调整周视图及同步到 Mac 日历或飞书日历。项目已开源在 GitHub,安装仅需一条命令。


推荐理由:卡尔把三年知识管理教训封装成一个能自动扫描、合并排期的 TODO Skill,如果你也被碎片信息淹没,这个工具比任何大纲都实用。
08:10
公众号:数字生命卡兹克精选
AI 评分 64/100
每天Vibe Coding 16小时,作者分享Fable 5与GPT-5.6 Sol的AI开发流程

作者每天Vibe Coding约16小时,认为Claude Fable 5在大型方案初版设计上“当世独一档”,GPT-5.6 Sol能有效纠错并优化方案。核心流程为:Fable 5出方案初版 → GPT-5.6 Sol审查纠错 → 在Codex中开启“目标模式”全自动化执行,最长曾连续运行17小时。


推荐理由:卡兹克把每天16小时Vibe Coding磨出的流程讲透了,Claude出方案、GPT纠错、Codex目标模式全自动执行,这条流水线能让你的开发瓶颈从写代码转移到测试和方案设计上,值得一试。
00:37
Hacker News:AI 热帖精选
AI 评分 73/100
Juggler:一款开源 GUI 编程智能体,由 JUCE 创建者开发

Juggler 是一款开源 GUI 编程智能体,提供可视化工作台,支持可检查的工具调用、分支线程和可编辑上下文。会话以树状结构组织,而非线性聊天记录,用户可创建子线程、回溯、比较和编辑。所有关键信息以 Finder 风格 Miller 列展示。Juggler 支持本地、远程或同时运行,桌面应用与浏览器可连接同一会话。模型支持包括 Claude Code、OpenAI、Gemini、Ollama、OpenRouter、Z.AI、Deepseek 等。后端使用 Go 和 Wails,UI 为 HTML/JS。


推荐理由:我觉得 Juggler 把 AI 编码的交互从聊天记录变成了可编辑的树,这下能细致管理多个修改分支了,而且完全开源,做软件的值得试一下。

7月14日7月14日周二

星期二 · 3 条
17:59
公众号:小红书技术(dots.llm)精选
AI 评分 64/100
小红书企业级 AI 个人助理:从 0 到全员覆盖的架构实践

小红书以 3 人 3 天推出内测版本,约一个月实现全员覆盖,核心是 AI Native 项目运作机制。技术选型基于 OpenClaw 二次开发,通过 Seal AI Zone 隔离集群与 NEX 沙箱解决安全,Self-GC 使输入 Token 下降 10%~15%、Auto 模式路由使成本降低 69%,并自研 LLM Wiki 三层记忆架构与 Skill Hub 生态。


推荐理由:从物理隔离到三层记忆,这套方案把 OpenClaw 定制为企业个人助理,沙箱和成本控制细节对同类实践有直接参考价值。
17:57
Google AI:DEV 作者专属(RSS)精选
AI 评分 66/100
Google ADK 2.4.0 发布:Agent 可直接触发动态工作流

Google 发布 ADK 2.4.0,允许将 Workflow 直接注册为 Agent 的工具列表中的一等工具,使协调 Agent 能自动调用动态工作流。该模式通过 @node 装饰器定义动态执行节点,支持在运行时根据用户输入的任务列表迭代调用子 Agent 生成执行计划。示例使用 gemini-3.5-flash 模型实现任务协调,代码已开源至 devrel-demos 仓库。


推荐理由:ADK 2.4 把动态工作流直接注册成 Agent 的工具,补齐了多智能体编排里缺失的那块拼图,做复杂 Agent 的可以直接抄这个模式,代码拿来就能跑。
17:10
公众号:卡尔的AI沃茨精选
AI 评分 75/100
实测LibTV Agent:100个AI视频工作流重组为Skill,实现创意自由

LibTV推出Agent功能并内置Skill Hub,提供100多个覆盖武侠电影、皮克斯动画广告、电商口播等类型的视频Skill。用户输入想法后,Agent会分析需求并询问方向,自动生成视频分镜并串联成完整节点工作流,每个节点可查看和修改提示语。生成后LibTV会启动自查机制,自动检测并返修有问题的镜头。故事板视图提供图片与视频资产总览,支持在成片中直接打开剪辑时间线进行精细调整。用户还可自行创建Skill,上传三个文件即可,无需编程。实测中,Agent能输出剧情连贯、带粤语配音的成片,并支持双语字幕生成。


推荐理由:LibTV把成熟的视频流程做成可复用的Skill,并开放自定义上传,让创作者无需从节点开始,直接输出接近成片的作品,对于想缩短想法到成片距离的人,这是一个值得上手的效率工具。

7月13日7月13日周一

星期一 · 1 条
00:35
AYi@AYi_AInotes精选
AI 评分 75/100
腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户这个我看第一眼直接卧槽,效果有点炸裂, 腾讯这几个月到底发生了什么,前面组织架构调整,老登高管退位,年轻一代掌权的结果吗? 兄弟们看这个,腾讯Hy3 把你摄像头直接调起来了, 手往镜头前一伸,整只手的骨架实时描出来,张开手掌,粒子炸开融解, 握拳,又被吸回去重新拼成图。双手一拉,整团粒子跟着变形, 帧率飙到一百多,硬是一格没掉腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备自检和主动说明不足的能力。

AYi: 最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 ,...

另有 4 家信源报道X:腾讯混元 (@TencentHunyuan)X:阿易 AI Notes (@AYi_AInotes)公众号:腾讯混元IT之家(RSS)
推荐理由:腾讯Hy3 不拼参数拼干活效率,直接集成十亿用户,这是国产模型第一次把 Agent 底座铺到日常生活里,比刷榜重要得多。

7月12日7月12日周日

星期日 · 1 条
22:23
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
Mindwalk:在代码库 3D 地图上回放编码代理会话

Mindwalk 是一款可视化工具,可将 Claude Code 和 Codex 的会话日志在代码库的 3D 地图上回放。它将仓库绘制成夜间地图,代理搜索、读取和编辑过的文件会发光,未触及区域保持黑暗,让用户一眼看清代理对任务的理解范围。单个 Go 二进制文件即可运行,所有会话数据完全本地处理,不会离开机器。支持树状图/地形图两种视图,文件触达状态分为未访问、已查看、已读取、已编辑四种颜色标记。播放界面包含错误率、文件修改量等摩擦信号面板,以及上下文压缩、子代理启动、用户交互等时间轴标记。支持键盘快捷键控制播放速度、跳转编辑点或错误点。


推荐理由:这个工具把编码代理的会话回放做成 3D 代码地图,一眼就能看出代理探索了哪些文件、在哪里改动最多。如果你是 Claude Code 或 Codex 用户,这是目前最直观地理解代理「脑子里在想什么」的方式。

7月11日7月11日周六

星期六 · 4 条
20:37
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 65/100
蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施

蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。


推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。
10:33
AYi@AYi_AInotes精选
AI 评分 76/100
OpenAI GPT-5.6-Sol 删光 AI 创业者 Matt Shumer 的 Mac 硬盘真是能力越强,破坏力越大啊! 这个老哥Mac上的文件被OpenAI最顶的GPT-5.6-Sol删光了,估计所有跑本地AI Agent的人看到这个都得吓出一身冷汗🤯整个事件详细拆解,以及怎么避免类似悲剧发生👇GPT-5.6-Sol,OpenAI 刚发的最强 Agent 模型,把一个知名 AI 创业者的整个 Mac 硬盘,删光了。Matt Shumer,就是那个之前天天晒 Agent 自己跑一周做完整项目的哥们,今天给本地 Agent 开了 Full Access 全权限,让 subagent 做个简单的文件清理。结果 shell 变量解析炸了 ——$HOME路径没展开对,Agent 直接执行了rm -rf /Users/mattsdevbox。等他发现不对冲过去 kill 进程的时候,电脑里几年的代码、文件、照片,已经没了一大半。事后 Agent 自己生成了一份事故报告,老老实实承认是自己路径展开错了。认错态度很好,但删了的文件不会因为它道歉就回来啊!这件事最恐怖的地方其实还不是模型犯了错 ,而在于他说:这种 cleanup 任务,他之前已经让 Agent 跑过几百次,从来没出过问题。就这一次,模型在大家都觉得不可能出错的地方,犯了个最低级的错,结果就是不可逆的物理毁灭。咱们也别觉得这是他 prompt 写得烂,笑他不小心, 其实这是现在整个 Agent 行业都在回避的死刑级真相: 1. 哪怕是 GPT-5.6 这种顶级模型,照样会在变量展开、相对路径、shell 命令这种 “小事” 上翻车 —— 它完全懂你要 “清理垃圾文件”,但手滑一下,就是家目录没了 2. Subagent + 长时自主运行 + 全权限 = 灾难放大器。一个最底层的小 review Agent 的错误,能直接炸穿你整个主机,能力越强,单点故障的破坏半径就越大,这根本不是 prompt 能解决的,是架构级的 bug 3. “跑了几百次都没事” 是最致命的安全感。AI 的错误逻辑和人完全不一样,它不会像人一样 “熟能生巧”,就是会在你最放松、最不设防的时候,给你干票毁灭性的大的 4. 模型厂商的安全底线从根上就不一样。OpenAI 的 Sol 追求极致能力和自主性,guardrail 基本裸奔;Anthropic 的 Fable 从设计上就更保守,对危险操作天生谨慎 —— 这也是为什么 Matt 事后第一句话是:“这就是我为什么 1000x 更信任 Fable”怎么避免呢❓ 所有现在在跑本地 Agent、给 AI 开过高权限的兄弟们,别等自己硬盘没了才后悔,现在立刻去做这几件事: #AI #Agent #GPT5 #Claude #OpenAI #Anthropic #AIAgent知名 AI 创业者 Matt Shumer 的 Mac 硬盘被 OpenAI 最新 Agent 模型 GPT-5.6-Sol 彻底清空。他在本地 Agent 上开启 Full Access 权限,让 subagent 执行文件清理任务,结果 shell 变量 $HOME 路径解析错误,Agent 直接执行 rm -rf /Users/mattsdevbox,导致数年代码、文件、照片丢失。该任务此前已安全运行数百次。事后 Agent 自动生成事故报告承认错误。Matt 表示"1000x 更信任 Anthropic 的 Fable"。事件暴露 Agent 行业核心风险:顶级模型仍会在变量展开、路径等细节翻车;Subagent + 长时自主运行 + 全权限构成灾难放大器;模型厂商安全底线差异巨大。

Matt Shumer: 我太生气了……OpenAI 团队正在调查此事,但这感觉像是 GPT-3.5 时代才该发生的问题。 而不是 2026 年中的前沿模型,在最高推理层级上出现这种问题。


推荐理由:顶级模型在基础操作上的致命失误,暴露了当前 Agent 架构的脆弱性,对每个放权给 AI 的人都应敲响警钟。

7月10日7月10日周五

星期五 · 4 条
22:00
公众号:百度智能云(文心)精选
AI 评分 71/100
百度搭子在成都AI Day发布四项更新:个人版升级、自媒体套件、企业版及搭子联盟

百度搭子在成都百度AI Day上发布四项更新。个人版新增浏览器调用、智能路由(平均任务耗时降20%,Token利用率提升25%)、多端共享记忆及强化PPT生成,并上架“一镜”数字人制作、“灵医”报告解读等Skill。行业首个自媒体专业套件支持选题到复盘全链路。企业版支持团队协作与权限管理。搭子联盟启动,中国联通等已加入。上线三个月,日均提问量增长20倍。


推荐理由:百度搭子这次更新算不上行业事件,但浏览器调用和自媒体套件确实在缩减创作链路,企业版尝试把AI能力沉淀为组织资产,对深度使用百度的团队有实际价值。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
微软发布Flint:面向AI智能体的可视化语言

微软研究院推出Flint,一种可视化中间语言,让AI智能体通过简洁的人类可编辑spec自动生成美观图表。用户只需提供数据、语义类型和图表类型,Flint编译器即可推导坐标轴、配色、布局等底层参数。支持46种图表类型,可渲染到Vega-Lite、ECharts和Chart.js三个后端。项目通过npm安装(TypeScript/JavaScript),并提供MCP服务器用于智能体工作流集成。采用弹性布局模型自动优化图表尺寸与间距,已开源。

另有 1 家信源报道IT之家(RSS)
推荐理由:微软这个 Flint 用语义类型代替了低层图表参数,是给 AI 代理装上了一双会画图的手,开发者现在就能装 MCP server 跑起来,做数据可视化代理的不用再跟 Vega-Lite 的细节搏斗了。
01:12
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体

OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。

另有 12 家信源报道TechCrunch:AI(RSS)公众号:卡尔的AI沃茨Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)OpenAI:官网动态(RSS · 排除企业/客户案例)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Sam Altman (@sama)X:Kim (@kimmonismus)X:OpenAI (@OpenAI)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)
推荐理由:ChatGPT Work 把代理能力真正派发给了普通用户,配合插件、定时任务和电脑控制,这是 ChatGPT 从问答工具迈向自主完成复杂工作的关键一步。但我更关心 GPT-5.6 的推理提升到底多大,案例里没给数字。