卧槽真的有点炸裂兄弟们,我在国内连 TikTok 都装不了,结果在手机里发了条 iMessage,一个远在美国的 AI Agent 竟然替我注册了一个TikTok号,还帮我刷完了 10 条 TikTok 热门视频,把视频总结都直接发了回来,...
Agent 智能体
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
精选归档 · 第 14 页
第 261–280 条 · 共 1,120 条
7月15日
阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。
作者基于 API 版 Fable5 和 Codex 开发了开源 TODO Skill“阿福”,用于将收件箱中的待办资料自动转为 Markdown 任务卡,识别信息不完整项(如视频链接需通过 yt-dlp 和本地 Whisper 提取字幕),并支持批量排期、AI 分组合并、拖拽调整周视图及同步到 Mac 日历或飞书日历。项目已开源在 GitHub,安装仅需一条命令。
作者每天Vibe Coding约16小时,认为Claude Fable 5在大型方案初版设计上“当世独一档”,GPT-5.6 Sol能有效纠错并优化方案。核心流程为:Fable 5出方案初版 → GPT-5.6 Sol审查纠错 → 在Codex中开启“目标模式”全自动化执行,最长曾连续运行17小时。
Juggler 是一款开源 GUI 编程智能体,提供可视化工作台,支持可检查的工具调用、分支线程和可编辑上下文。会话以树状结构组织,而非线性聊天记录,用户可创建子线程、回溯、比较和编辑。所有关键信息以 Finder 风格 Miller 列展示。Juggler 支持本地、远程或同时运行,桌面应用与浏览器可连接同一会话。模型支持包括 Claude Code、OpenAI、Gemini、Ollama、OpenRouter、Z.AI、Deepseek 等。后端使用 Go 和 Wails,UI 为 HTML/JS。
7月14日
小红书以 3 人 3 天推出内测版本,约一个月实现全员覆盖,核心是 AI Native 项目运作机制。技术选型基于 OpenClaw 二次开发,通过 Seal AI Zone 隔离集群与 NEX 沙箱解决安全,Self-GC 使输入 Token 下降 10%~15%、Auto 模式路由使成本降低 69%,并自研 LLM Wiki 三层记忆架构与 Skill Hub 生态。
Google 发布 ADK 2.4.0,允许将 Workflow 直接注册为 Agent 的工具列表中的一等工具,使协调 Agent 能自动调用动态工作流。该模式通过 @node 装饰器定义动态执行节点,支持在运行时根据用户输入的任务列表迭代调用子 Agent 生成执行计划。示例使用 gemini-3.5-flash 模型实现任务协调,代码已开源至 devrel-demos 仓库。
LibTV推出Agent功能并内置Skill Hub,提供100多个覆盖武侠电影、皮克斯动画广告、电商口播等类型的视频Skill。用户输入想法后,Agent会分析需求并询问方向,自动生成视频分镜并串联成完整节点工作流,每个节点可查看和修改提示语。生成后LibTV会启动自查机制,自动检测并返修有问题的镜头。故事板视图提供图片与视频资产总览,支持在成片中直接打开剪辑时间线进行精细调整。用户还可自行创建Skill,上传三个文件即可,无需编程。实测中,Agent能输出剧情连贯、带粤语配音的成片,并支持双语字幕生成。
7月13日
最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 ,...
另有 4 家信源报道X:腾讯混元 (@TencentHunyuan)X:阿易 AI Notes (@AYi_AInotes)公众号:腾讯混元IT之家(RSS)7月12日
Mindwalk 是一款可视化工具,可将 Claude Code 和 Codex 的会话日志在代码库的 3D 地图上回放。它将仓库绘制成夜间地图,代理搜索、读取和编辑过的文件会发光,未触及区域保持黑暗,让用户一眼看清代理对任务的理解范围。单个 Go 二进制文件即可运行,所有会话数据完全本地处理,不会离开机器。支持树状图/地形图两种视图,文件触达状态分为未访问、已查看、已读取、已编辑四种颜色标记。播放界面包含错误率、文件修改量等摩擦信号面板,以及上下文压缩、子代理启动、用户交互等时间轴标记。支持键盘快捷键控制播放速度、跳转编辑点或错误点。
7月11日
蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。
GPT-5.6 has changed how we think about knowledge work. Your job shifts from handling individual tasks to tending systems...
7月10日
百度搭子在成都百度AI Day上发布四项更新。个人版新增浏览器调用、智能路由(平均任务耗时降20%,Token利用率提升25%)、多端共享记忆及强化PPT生成,并上架“一镜”数字人制作、“灵医”报告解读等Skill。行业首个自媒体专业套件支持选题到复盘全链路。企业版支持团队协作与权限管理。搭子联盟启动,中国联通等已加入。上线三个月,日均提问量增长20倍。
Grok Build 真的太疯狂了。 先不管 GPT-5.6 到底有没有发布、好不好用。 先来大力称赞一下 @grok 的 Grok Build,这是目前唯一一个集大成的 coding agentic workflow。 Grok Buil...
微软研究院推出Flint,一种可视化中间语言,让AI智能体通过简洁的人类可编辑spec自动生成美观图表。用户只需提供数据、语义类型和图表类型,Flint编译器即可推导坐标轴、配色、布局等底层参数。支持46种图表类型,可渲染到Vega-Lite、ECharts和Chart.js三个后端。项目通过npm安装(TypeScript/JavaScript),并提供MCP服务器用于智能体工作流集成。采用弹性布局模型自动优化图表尺寸与间距,已开源。
另有 1 家信源报道IT之家(RSS)OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。
另有 12 家信源报道TechCrunch:AI(RSS)公众号:卡尔的AI沃茨Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)OpenAI:官网动态(RSS · 排除企业/客户案例)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Sam Altman (@sama)X:Kim (@kimmonismus)X:OpenAI (@OpenAI)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)