Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,184条收录
1,120条精选

精选归档 · 第 15 页

281300 条 · 共 1,120

7月9日7月9日周四

星期四 · 4 条
22:30
AI at Meta@AIatMeta精选
AI 评分 65/100
Meta 发布 Muse Spark 1.1 模型Straight from @finkd — Muse Spark 1.1 is live.来自 @finkd 的消息 - Muse Spark 1.1 已上线。

Mark Zuckerberg: (1) 今天我们发布了 Muse Spark 1.1--一款价格极低但能力强大的智能体与编程模型。该模型已通过我们全新的 Meta Model API 以及 Meta AI 开放使用。

另有 6 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)X:Elvis Saravia (@omarsar0, DAIR.AI)Simon Willison 博客The Decoder:AI News(RSS)
推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。
22:15
OpenBMB@OpenBMB精选
AI 评分 71/100
TeXada:基于MiniCPM的本地数学Agent发布What can lightweight AI models do on your local device?Meet TeXada, a local-first Math Agent powered by MiniCPM5-1B and MiniCPM-V 4.6 🚀Built by our community developer @CacinieAvery, TeXada makes LaTeX input as natural as conversation: ✨ Natural language → LaTeX ✏️ Handwritten / image formulas → editable LaTeX (OCR) 🔧 LaTeX completion & error fixing ⚡ Fast local inference with privacy protectionInstead of relying on cloud services, TeXada runs locally and helps students, researchers, and developers handle mathematical expressions anytime, anywhere.More features, including a dedicated app, are coming soon!🥳🔗Check out TeXada: http://github.com/CacinieP/TeXada-the-Math-AgentPowered by MiniCPM models: MiniCPM5-1B Hugging Face: https://huggingface.co/openbmb/MiniCPM5-1BMiniCPM-V 4.6 Hugging Face: https://huggingface.co/openbmb/MiniCPM-V-4_6Big thanks to our community developer for building this amazing case with MiniCPM models 🙌社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。

推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。
07:38
Tomer Tunguz 博客(VC 分析)精选
AI 评分 57/100
AI预检检查:智能体工作记忆架构

一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。


推荐理由:Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。
02:50
xAI:News(网页)精选
AI 评分 85/100
xAI 发布 Grok 4.5

xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。

另有 7 家信源报道X:Elon Musk (@elonmusk, xAI)Cursor BlogX:Michael Truell (@mntruell)Hacker News 热门(buzzing.cc 中文翻译)MarkTechPost(RSS)IT之家(RSS)The Decoder:AI News(RSS)
推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。

7月8日7月8日周三

星期三 · 11 条
16:44
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 81/100
GitLost:Noma Labs 发现 GitHub AI 代理提示词注入漏洞

Noma Labs 在 GitHub Agentic Workflows 中发现严重提示词注入漏洞 GitLost。未认证攻击者仅需在属于同一组织的公共仓库中创建一个嵌有恶意指令的 Issue,即可诱使基于 Claude 或 GitHub Copilot 的 AI 代理读取并公开该组织内私有仓库的内容。攻击无需编码技能或凭证,根源在于代理将用户可控内容视为可信指令,且 GitHub 的防护措施因 "Additionally" 关键词被绕过。Noma Labs 已公开 PoC 并建议限制跨仓库权限、隔离用户输入。


推荐理由:GitLost 是第一个有完整复现的 GitHub AI 代理泄露私有仓库漏洞,展示了 AI 代理的上下文窗口即攻击面,做 AI 应用或 CI/CD 的人都该看一下。
15:17
Ars Technica:AI(RSS)精选
AI 评分 78/100
黑客可利用9款最流行的AI工具组装大规模僵尸网络

提示注入已成为AI安全的首要威胁——大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。


推荐理由:这项研究首次揭示了利用 LLM 幻觉进行大规模 botnet 攻击的可行路径,影响范围覆盖几乎所有主流 AI 编程助手,每个依赖这些工具的开发者都该看一眼。
09:10
公众号:蚂蚁百灵(Ling)精选
AI 评分 64/100
蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先

蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从“更多Token”转向“更高Token密度”策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升显著,千亿参数模型在Agent任务中超越部分更大模型;小模型flash吞吐达2.4倍,五轮对话成本下降10倍以上。


推荐理由:蚂蚁百灵副总裁周俊这次分享,把大模型效率问题从零散优化推到了架构、训练、智能体协同设计的范式层面,7+1 混合注意力方案和 Kpop 算法对做模型的人是实质参考。
09:00
公众号:蚂蚁百灵(Ling)精选
AI 评分 60/100
蚂蚁集团周俊:如何用混合线性改造提升万亿参数模型的Token密度

蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。


推荐理由:7:1 的混合注意力配比、将真实错误纳入训练以及区分工具调用与自然语言的奖励函数,为同时追求长上下文效率和智能体可靠性的工作提供了可参照的技术路线。
06:11
Hacker News:AI 热帖精选
AI 评分 73/100
Rowboat:开源、本地优先的桌面AI助手

Rowboat 是一个开源、本地优先的桌面 AI 助手,将邮件、会议、Slack 等数据索引为 Obsidian 风格的知识图谱,提供持久上下文记忆。内置邮件客户端、浏览器、会议记录器、代码模式(可调用 Claude Code 或 Codex 代理),并支持按事件或定时运行的背景代理。用户可通过 MCP 协议接入 Exa 搜索、GitHub 等外部工具。所有数据以纯 Markdown 格式本地存储,无供应商锁定,支持 Ollama/LM Studio 本地模型或使用 API 密钥的托管模型。


推荐理由:Rowboat 把整个工作台搬到了本地,知识图谱长期记忆的设计比大多数『聊天+搜索』的 AI 桌面工具更深,如果你受够了云端的隐私焦虑和冷启动,这个开源项目值得关注。
02:12
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
YC CEO声称每日用AI部署3.7万行代码,开发者审查发现前端代码大量臃肿低效

Y Combinator CEO Garry Tan在X上宣称,他与AI编码代理每天在五个项目中部署37000行代码,并保持连续72天发布记录。波兰开发者Gregorein深入审查Tan网站前端代码,发现大量臃肿与低效问题:页面加载169次请求、总计6.42MB数据(对比Hacker News仅7次12KB);包含28个测试文件、78个未使用的JavaScript控制器、八种格式Logo(含空文件)、未压缩的旧PNG等。Gregorein指出,AI虽能快速生成代码,但质量仍应优先于数量。


推荐理由:Garry Tan 日行三万七千行的神话被代码审查拆穿,这不是节奏问题,是 AI 编码‘有量无质’的典型病征。认为 AI 编码能光速开发的人该冷静一下了。
01:10
BAIR:Berkeley AI Research Blog精选
AI 评分 62/100
智能免费,然后呢?--Data Systems for, of, and by Agents

AI推理成本急剧下降。GPT-4级能力从2023年初每百万token约30美元降至今天不到1美元,部分供应商已低于0.10美元。推理价格每年下降9至900倍,中位数约50倍。知识工作级智能即将近乎免费。这给数据系统带来三重变革:面向智能体的数据系统需支持智能体推测式探索——单个


推荐理由:当推理成本趋近免费,数据系统将经历从服务人到服务智能体的根本变革,这篇文章把'为智能体设计系统、用智能体运行系统、让智能体构建系统'三大挑战梳理得很清晰,做数据和 agent 基础设施的人应该读。
00:53
Google Blog:AI(RSS)精选
AI 评分 69/100
Gemini API Managed Agents 新增后台执行、远程 MCP 与自定义函数等能力

Google 为 Gemini API 的 Managed Agents 新增后台执行、远程 MCP 服务器集成、自定义函数调用与凭证刷新功能。后台执行通过传入 background: true 异步运行任务,立即返回 ID 供轮询状态或流式获取进度。Managed Agents 可直接连接远程 MCP 服务器,无需自定义代理中间件,并能与内置沙箱工具(如 Google 搜索、代码执行)混合使用。自定义函数调用支持本地执行业务逻辑,内置工具自动在服务端运行。凭证刷新通过传递现有环境 ID 和新网络配置完成,沙箱内文件系统、已安装包和仓库保持不变。这些更新旨在帮助开发者构建可靠的生产级 AI 智能体。


推荐理由:Managed Agents 这次更新解决了异步执行和远程工具调用的痛点,让 Gemini 代理能真正跑在后台,对已经在用 Gemini API 做产品的开发者属于必读更新。
00:24
Claude:Blog(网页)精选
AI 评分 71/100
Claude Cowork 向移动端和网页端开放

Claude Cowork 正在向移动端和网页端开放,让会话和文件跨设备同步。Beta 版将在未来几周内首先面向 Max 用户推出。Cowork 可让 Claude 跨文件、日历、邮件、即时通讯等工具完成复杂任务,其中超过 90% 的使用场景并非软件开发,而是日常知识工作(业务运营和内容创作)。工作可跨设备跟随用户:在桌面端开始任务,从手机查看进度;关闭笔记本后 Claude 可继续后台运行,支持定时任务(如周一 6 点自动准备客户简报)。当需要用户决策时,Claude 会将问题推送到手机。桌面端保留完整 Cowork 体验,支持无法安装桌面应用的用户。聊天和 Cowork 已在网页端和桌面端合并。为庆祝上线,双倍 Cowork 使用额度延长至 8 月 5 日。

另有 1 家信源报道Claude:Blog(网页)
推荐理由:Claude Cowork 把它从桌面解放到手机和浏览器,90% 的日常知识工作被它接住了,跨设备、后台运行让 AI 助手真正能替你干活,不是聊天。

7月7日7月7日周二

星期二 · 5 条
23:10
Apple Machine Learning Research(RSS)精选
AI 评分 56/100
Weblica:面向视觉网页智能体的可扩展可复现训练环境

苹果研究团队提出Weblica框架,通过HTTP级缓存保存网页稳定视觉状态并保留交互行为,结合大语言模型基于真实网站与核心导航技能合成环境,构建可复现、可扩展的训练环境。该框架将强化学习训练扩展到数千个多样化的环境和任务。最佳模型Weblica-8B在多个网页导航基准上超越同等规模的开源模型,推理步骤更少,测试时计算扩展性良好,性能与API模型相当。


推荐理由:Apple 的研究把 web agent 训练从零散数据中解放出来,可复现环境是规模化 RL 的关键一步,做 web 自动化的值得关注。
23:09
elvis@omarsar0精选
AI 评分 77/100
Elvis Saravia 通过 HITL 和 DialAgent 提升 agentic loops 可靠性Loop engineering is great until something breaks.Here is how I improve the reliability of my agentic loops.I use human-in-the-loop (HITL). It's easy and extremely effective. Anyone can build this.My setup:I recorded a quick demo of how it all works.I shared recently that I now use more voice agents to build and communicate with agents. I also use them to verify.I hate the idea of being tied down to my computer or in a Slack channel to communicate with my agents.Here is what I have done to streamline communication with my agents.All my Claude and Codex agent sessions now use the @DialAgent MCP server. It has a bunch of tools and provisions my agents with their own number that can place calls as native tools, with voice, SMS, and iMessage behind one interface.As my loops/automations work on PRs and new features, my agents escalate decisions to me via a short phone call. This is extremely useful when I am on the road or away from my desk.If you want to try this with Claude Code or Codex, paste this into your agent and get started right away:"Get yourself a Dial phone number and call me. Say hello and that setup is working, then hang up. Follow https://getdial.ai/skills.md"@NVoitenkov and team are building something special here. Go check them out. Give your agent a phone number now: http://getdial.ai ($5 free credit)Elvis Saravia 介绍使用 human-in-the-loop(HITL)来提升 agentic loops 的可靠性。他所有 Claude 和 Codex agent 会话都通过 @DialAgent MCP 服务器,该服务器为 agent 提供专属号码,支持语音、SMS、iMessage 作为原生工具。当循环/自动化处理 PR 或新功能时,agent 会通过简短电话将决策升级给人类,尤其适合在路上或离开电脑时。用户可粘贴指令让 agent 拨打电话测试。DialAgent 提供 $5 免费额度:http://getdial.ai

推荐理由:给AI Agent装电话号直接打电话请示,这个实操方案能大幅减少循环失败,Claude Code和Codex用户有$5免费额度马上可试,出差党尤其友好。
13:17
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
LLM-as-a-Verifier:一种通用验证框架

LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。


推荐理由:把验证当作新的缩放轴,这个思路很扎实,尤其直接给 Claude Code 搭了扩展。做 agent 系统的开发者现在可以试试把评估模块换成连续概率打分,也许比离散判断有效。
12:22
字节 Seed:Research Papers(网页内嵌数据)精选
AI 评分 74/100
EdgeBench:从真实世界环境中揭示学习缩放定律

字节跳动Seed团队发布EdgeBench,包含134个真实世界任务,覆盖科学发现、软件工程等6个领域,每任务支持至少12小时连续智能体运行。基于约38,000小时交互数据,发现总体性能与环境交互时间呈精确对数S形缩放定律(R²=0.998),且智能体学习速度约每三个月翻倍。已公开51个任务及完整评估框架。

另有 1 家信源报道字节 Seed:Research Feed(网页内嵌数据)
推荐理由:这篇论文首次量化了智能体在134个长周期真实任务中从环境学习的性能曲线,发现log-sigmoid缩放定律精确度极高,且学习速度约每三个月翻倍。对于正在设计长期自主agent的团队,这是一份必须看的底层规律报告。
12:19
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 72/100
蚂蚁 inclusionAI 开源多智能体协作基础设施 Avernet V0.1

蚂蚁 inclusionAI 开源的多智能体协作基础设施 Avernet V0.1 正式发布。该项目聚焦 Agent 注册、发现、邀请等协作层问题,不替代 Agent 自身推理能力。通过群组、会话和共享上下文构建多方共识,支持自由聊天、领导-跟随等协作模式,并利用协作反馈形成观察、评估到复用、优化的自动进化闭环。支持 OpenClaw、自定义 Agent、第三方 Agent 引擎及现有 bot 平台等异构生态,提供 Docker 与本地两种快速部署路径。


推荐理由:蚂蚁开源的Avernet把多agent协作的发现、连接、共识和可追踪执行做成基础设施,做agent应用的团队可以拿来即用,虽早期但方向对。