Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,184条收录
1,120条精选

精选归档 · 第 45 页

881900 条 · 共 1,120

4月24日4月24日周五

星期五 · 9 条
20:00
OpenRouter:Announcements(RSS)精选
AI 评分 57/100
OpenRouter Agent SDK:构建多轮智能体工作流

OpenRouter Agent SDK 提供 callModel 函数,能将聊天补全转换为支持工具调用、停止条件和成本追踪的多步智能体,覆盖 300 多个模型。

另有 1 家信源报道OpenRouter:Announcements(RSS)
推荐理由:OpenRouter把agent构建压缩进一个callModel函数,内置工具调用、停止条件和成本追踪,对已在它生态里的开发者省下不少样板代码,可惜时效过了。
20:00
OpenRouter:Announcements(RSS)精选
AI 评分 61/100
OpenRouter Agent SDK:构建多轮智能体工作流

OpenRouter Agent SDK 提供 callModel 函数,将单次聊天补全转换为支持工具调用、停止条件与成本追踪的多步智能体工作流,覆盖 300 多个模型。

另有 1 家信源报道OpenRouter:Announcements(RSS)
推荐理由:如果你在用 OpenRouter 拼 agent,这个 SDK 把多模型调用和工具链包成一行 callModel,省了适配 300+ 模型的体力活,值得看一眼。
20:00
OpenRouter:Announcements(RSS)精选
AI 评分 55/100
OpenRouter Agent SDK 发布 `create-agent-tui` 与 `create-headless-agent` 技能,可快速搭建个性化编码智能体

OpenRouter Agent SDK 推出 create-agent-tuicreate-headless-agent 两类技能(skills),用于快速搭建(scaffold)个性化编码智能体。前者提供终端 UI(terminal UI),后者为无头模式(headless),适用于脚本和流水线(scripts and pipelines)。

另有 1 家信源报道OpenRouter:Announcements(RSS)
推荐理由:一个用 OpenRouter Agent SDK 快速搭建编码 agent 的脚手架,适合想省时间的开发者,但内容本身是常规文档,42 天前的教程现在已经没什么新意。
20:00
OpenRouter:Announcements(RSS)精选
AI 评分 55/100
Agent SDK:在 OpenRouter 上构建多轮智能体工作流

OpenRouter 发布 Agent SDK,其核心是 callModel 函数。该函数可将一次聊天完成转化为具备工具调用、停止条件与成本追踪功能的多步骤智能体工作流。这一工具兼容平台上的 300 多个模型,使开发者能够便捷地构建复杂的多轮交互智能体应用。


推荐理由:OpenRouter 把多轮 agent 编排封装成一个 callModel 函数,300+ 模型统一调用,做 agent 产品的人可以少写不少胶水代码,但本质上是工程封装而非技术突破。
12:19
Anthropic:Newsroom(网页)精选
AI 评分 59/100
Anthropic与NEC合作,共建日本最大AI工程团队

Anthropic与NEC达成战略合作,旨在打造日本规模最大的AI原生工程团队。NEC将成为Anthropic在日本的首个全球合作伙伴,为集团全球约3万名员工部署Claude AI工具。双方将针对金融、制造和地方政府等领域,联合开发安全的行业专用AI解决方案,并将Claude集成到NEC的安全运营中心及下一代网络安全服务中。NEC内部将设立卓越中心,通过技术培训构建AI工程团队,并广泛应用Claude Code等工具。目前,全球员工的工具部署与行业解决方案的联合开发已同步启动。


推荐理由:NEC 三万人上 Claude,是 Anthropic 在日本市场拿下的最大企业单子,信号意义大于产品本身。做 To B 的可以观察日本企业 AI 采购节奏,但对普通开发者没什么可抄的。
10:56
公众号:DeepSeek(深度求索)精选
AI 评分 85/100
DeepSeek-V4 预览版上线,百万上下文成标配

DeepSeek-V4 预览版正式上线并开源,拥有 1M 超长上下文,Agent 能力、世界知识和推理性能均达国内与开源领先水平。模型分 V4-Pro 与 V4-Flash 两版,API 已同步更新,支持 OpenAI 与 Anthropic 接口,最大上下文均为 1M,并支持思考模式与 reasoning_effort 参数。


推荐理由:百万上下文成为标配,长文档处理与多步 Agent 任务从实验走向生产,原先受限于输入长度的应用有了新的落地空间。
08:00
Hugging Face:Blog(RSS)精选
AI 评分 78/100
DeepSeek-V4:智能体可实际使用的百万token上下文

DeepSeek发布新一代模型DeepSeek-V4,其核心突破在于实现了长达百万token的上下文窗口,并确保智能体能够有效利用这一扩展的上下文能力。该模型延续了通过开源与开放科学推动人工智能发展与普及的使命,标志着大模型在长上下文理解和实际应用方面迈出重要一步。

另有 3 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)Simon Willison 博客
推荐理由:DeepSeek 把上下文窗口推到百万 token 不稀奇,关键是「agent 能实际用」这六个字。如果实测成立,RAG 的很多工程妥协可以扔掉了,做长文档和复杂 agent 的人该第一时间跑一遍。
03:37
Claude:Blog(网页)精选
AI 评分 77/100
Claude Managed Agents 的内置记忆功能

Claude Managed Agents 推出内置记忆功能,现已进入公测阶段。该功能基于文件系统的记忆层,允许代理从每个会话中学习,优化跨会话性能。记忆以文件形式存储,开发者可通过API导出和管理,并拥有完全控制权,支持权限范围、审计日志和并发访问。实际应用中,Rakuten的代理减少97%首过错误;Wisedocs的文档验证流程加快30%;整体上,代理实现97%首过错误减少、成本降低27%和延迟降低34%。Netflix、Ando等团队利用该功能实现上下文跨会话传递和基础设施简化,提升代理的持续学习能力。


推荐理由:Claude Managed Agents 的记忆功能把跨会话持续学习变为内置能力,Rakuten 等客户已实现 97% 错误减少,对做长期代理的团队是基础设施级更新。
03:18
The Decoder:AI News(RSS)精选
AI 评分 74/100
OpenAI 发布 GPT-5.5,宣称其为"新型智能"并实现 API 价格翻倍

OpenAI 正式推出 GPT-5.5,该模型被定义为一种代理模型,能够通过自主切换多种工具来完成复杂任务。公司宣称其代表了一种“新型智能”。与此同时,GPT-5.5 的 API 调用价格将提升至原来的两倍。

另有 3 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Ethan Mollick:One Useful Thing(RSS)OpenAI:官网动态(RSS · 排除企业/客户案例)
推荐理由:GPT-5.5 是 OpenAI 的又一次代际发布,核心在 agentic 能力,但 API 价格翻倍可能让中间层开发者犹豫。基准上领先但非全面碾压,值得关注长上下文和 Pro 版的重度研究场景。

4月23日4月23日周四

星期四 · 5 条
17:50
公众号:腾讯混元精选
AI 评分 67/100
Hy3 preview发布并开源:混元重建后首个模型,Agent能力大幅提升

腾讯混元发布并开源Hy3 preview,这是其重建预训练与强化学习基础设施后训练的首个模型,也是迄今最智能的版本。该模型为快慢思考融合的混合专家架构,总参数295B,激活参数21B,支持256K上下文,在SWE-Bench Verified等代码与搜索智能体基准上取得强竞争力结果。模型权重已开源,腾讯云API个人版定价最低28元/月。


推荐理由:混元重建后的第一枪,Agent能力大幅提升且直接开源,虽然已过首发热度,但对关注国产模型Agent能力的人还是个值得拉下来跑的repo。
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 63/100
Claude Managed Agents 记忆功能进入公开 Beta 测试

Claude Managed Agents 的记忆功能现已进入公开 Beta 测试,可通过标准 managed-agents-2026-04-01 请求头使用。该功能允许智能体在对话间保持上下文,具体集成指南见官方文档。


推荐理由:Claude托管Agent的记忆功能进入公测,这步让Agent从一问一答走向有上下文记忆的长期助手,做复杂任务的开发者可以试试。
08:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 67/100
Ling-2.6-flash 发布:更快响应、更强执行、更高 Token Efficiency

针对智能体任务中Token消耗快速增长的问题,Ling-2.6-flash模型正式发布。该模型采用混合线性架构等技术进行系统性优化,旨在实现更高推理效率和更低使用成本。其推理速度在4卡H20条件下最快可达340 tokens/s,在Artificial Analysis评测中仅消耗约对比模型1/10的Tokens。模型在多个Agent相关基准测试中达到同尺寸SOTA水平,保持了强大的任务执行与工具调用能力。


推荐理由:蚂蚁百灵这次打的是「省 token」这张牌,104B 总参但只激活 7.4B,Agent 场景评测对齐同尺寸 SOTA,输出 token 消耗只有竞品的 1/10。做 Agent 产品、被推理成本卡脖子的团队值得认真看看这个路线。
00:22
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 78/100
利用 Responses API 中的 WebSockets 加速智能体工作流

Responses API 集成 WebSockets 技术优化 Codex 智能体循环架构。通过建立持久化连接并引入连接级缓存机制,该方案显著降低 API 通信开销,有效缩短模型响应延迟。这一技术改进解决了传统请求模式下的性能瓶颈,为高频交互的智能体工作流提供更高效的实时数据传输能力。


推荐理由:OpenAI 的 Responses API 引入 WebSocket 模式,把 agentic 工作流端到端延迟压低了 40%,关键不在数字而在架构上从无状态 HTTP 转向持久连接,做 agent 的团队可以认真看技术决策。
00:05
公众号:小米 MiMo精选
AI 评分 79/100
Xiaomi MiMo-V2.5 系列大模型开启公测

Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。


推荐理由:在自主完成编译器构建和视频编辑器开发的长程任务演示中,展示了结构化的逐层搭建和自我修正能力,其效率对比数据有助于判断复杂Agent任务的成本边界。

4月22日4月22日周三

星期三 · 2 条
08:00
Google Developers Blog(RSS)精选
AI 评分 61/100
Agent Platform 中的 Agents CLI:从创建到生产,一栈式实现

Google Cloud 推出 Agents CLI 工具,专为连接本地开发与生产级 AI 智能体部署而设计。该 CLI 为编码助手提供对完整 Google Cloud 技术栈的机器可读访问,显著减少脚手架过程中的上下文过载与 token 消耗。通过将评估、基础设施配置和部署流程整合至统一的程序化主干,开发者能够将项目从初始概念推进至实时服务的时间从数周缩短至数小时。


推荐理由:对用 Google Cloud 搭智能体的开发者,这个 CLI 把碎片化的本地到云端流程压进一条命令,能省掉大量翻文档的 token,值得试试。
06:17
Cursor Blog精选
AI 评分 68/100
Cursor与SpaceX就模型训练达成合作

智能编程助手Cursor宣布与SpaceX合作,以突破算力瓶颈,加速其模型训练进程。该公司在不到半年内快速迭代了Composer系列模型:首款智能编码模型Composer问世后,Composer 1.5将强化学习规模扩大20倍以上,而Composer 2通过持续预训练,以极低成本达到了前沿性能水平。此次合作将使Cursor团队利用xAI的Colossus基础设施,大幅提升训练规模,从而显著增强模型的智能水平。


推荐理由:Cursor 抱上 xAI 的算力大腿,意味着 AI 编程工具的竞争正式进入「谁的 GPU 多」阶段。对开发者来说,Composer 系列模型接下来的进化速度会明显加快,值得持续关注。

4月20日4月20日周一

星期一 · 2 条
17:31
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 69/100
DR-Venus:基于开放数据的边缘级深度研究智能体

DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体,基于Qwen3-4B-Thinking-2507架构,支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练,在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型,而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。


推荐理由:4B 参数、仅用 1 万条公开数据就能在多个 deep research benchmark 上碾压 8B 对手,蚂蚁 inclusionAI 这次证明了小模型做 Agent 的关键不在参数量而在数据管线,做端侧 Agent 的团队值得拆一下它的 SFT+RL 流程。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
AI科学家产生结果却不进行科学推理

一项针对LLM科学智能体的评估通过25,000余次运行发现,基础模型贡献了解释方差的41.4%,而脚手架仅占1.5%。数据显示,68%的推理轨迹忽略证据,仅26%出现反驳驱动的信念修正,且趋同多测试证据罕见。这些认知缺陷在工作流执行或假设探究中均存在,即使提供成功推理示例也无法改善。当前智能体虽能执行科学工作流,但不具备自我修正的科学推理模式,且基于结果的评估无法检测此类失败。


推荐理由:这篇论文给所有‘AI科学家’泼了冷水,LLM代理能跑出结果但根本不按科学推理来,证据忽视率68%,靠评估结果根本看不出问题,做科研自动化的该重新审视了。

4月17日4月17日周五

星期五 · 2 条
09:00
公众号:智谱(GLM)精选
AI 评分 64/100
AutoClaw上线自进化机制与Skill商店,GLM Office Skills五件套同步上架

AutoClaw(澳龙)正式上线自进化机制与Skill商店,每轮对话后扫描用户纠正、新教方法或踩坑经验,经用户审批后写入永久记忆,支持关键词触发和自动检测两种方式,并保持每周1-3次高质量进化。


推荐理由:自进化把偏好校准转为永久记忆,Office Skills则让一次指令同时生成PPT、讲稿和图表,对需要频繁产出标准化材料的团队有直接提效。
02:39
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
我们给一个人工智能签订了一份为期3年的零售租赁合同,并要求它盈利

Andon Labs 启动一项为期三年的实体零售实验,为人工智能系统签订真实店铺租赁合同,要求其独立运营并实现盈利。该实验将 AI 从数字场景延伸至实体商业环境,需自主处理选品、库存、定价及客户服务等环节,在真实租金成本和市场竞争压力下验证其商业决策与持续经营能力。


推荐理由:AI当老板,从装修面试到选品营销一手包办,还学会在招聘时隐瞒身份——这个真实实验让我们看到AI管理人类的未来可能比预想的更近,也暴露了伦理上的灰色地带。