精选归档 · 第 37 页

721740 条 · 共 1,340

5月29日5月29日周五

星期五 · 12 条
11:29
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
WorldMemArena:通过行动-世界交互循环评估多模态智能体记忆

针对现有基准无法精确诊断多模态智能体记忆在动态环境中的具体失败阶段,研究提出了“行动-世界交互循环”记忆模型,并构建了WorldMemArena基准。该基准包含400个多会话多模态任务,涵盖“终身进化”和“智能体执行”两类场景,支持对记忆写入、维护、检索和使用的阶段级评估。研究首次对长上下文、RAG等手工设计系统与基于框架的记忆智能体进行直接比较,发现记忆写入与存储质量的提升不直接带来性能改善,且多模态记忆在利用视觉证据及跨领域稳定性上仍存在挑战。


推荐理由:首个能定位多模态 Agent 记忆“写、维、取、用”哪一步出问题的基准,头对头比较长上下文、RAG 和自管理记忆,结论是写得好未必用得上,做 Agent 的值得认真看。
08:02
公众号:阶跃星辰(Step)精选
AI 评分 61/100
阶跃发布 Step 3.7 Flash,面向生产级 Agent 的高效率 Flash 模型

阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ²-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode 等主流架构及 MCP/Skills 协议,支持云端与本地部署,已在 Kilo Code 等生态中完成接入验证。


推荐理由:Step 3.7 Flash 用激活仅 11B 的 MoE 架构把 Agent 工作流稳定性做透了,兼容主流框架还开源,对需要低延迟、高可靠性的生产环境 Agent 是真正可用的选择。
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 63/100
Claude Platform on AWS 新增 Managed Agents webhooks、多智能体编排与自托管沙箱

Claude Platform on AWS 现已支持 Managed Agents webhooks、多智能体编排和自托管沙箱。新增了 IAM 操作及 AnthropicSelfHostedEnvironmentAccess 托管策略,用于在 AWS 上管理 Claude 智能体的触发、协作与安全执行环境。


推荐理由:这次更新让 Claude 托管代理直接跑在 AWS 上,对已经在用 Claude Platform 的企业算是好消息,webhooks 和多代理编排能简化不少工作流,但并不会改变行业格局。
05:12
Google Research:Blog(网页)精选
AI 评分 79/100
创新时代:Google Research 在 I/O 2026

Google Research 在 I/O 2026 大会上展示了其在多个前沿领域的技术进展,包括应用AI、基础机器学习算法以及量子AI等。本次大会的核心主题是展示其在将科学发现与研究成果转化为现实世界影响方面的持续努力。


推荐理由:Google 把研究成果直接发 Nature,ERA 和 Co-Scientist 这套工具让 AI 从写诗进化到做实验,健康 AI 的临床验证数据也很扎实,搞科研的可以蹲一下访问资格。
03:22
MiniMax (official)@MiniMax_AI精选
AI 评分 76/100
MiniMax M2.7 免费智能体编程限时开放Free agentic coding with MiniMax M2.7 on @OpenHandsDev?Yes, please! Available for a limited time ⚡👀在 @OpenHandsDev 上使用 MiniMax M2.7 进行免费智能体编程? 是的,请给我!限时提供 ⚡👀

OpenHands: We have also partnered with @MiniMax_AI to provide *free access to agents with MiniMax-M2.7* for a limited time! This is...


推荐理由:MiniMax把M2.7免费接到OpenHands里跑Agent编码,而且限时,这对个人开发者是实打实的免费用机会,不妨上去跑几个任务体验下性价比。
02:44
Rohan Paul@rohanpaul_ai精选
AI 评分 81/100
hexoai开源SIA框架:AI智能体实现递归自我改进Big release - Open Source Recursive Self Improvement from @hexoaiShows AI agent can improve both how it works and what it internally knows after seeing its own task results. i.e. by repeatedly training on its own task feedback, not by relying on a human to hand-code every strategy.Most agents today are frozen workers: you can give them better prompts, better tools, better retry rules, and better code, but the actual model usually stays the same.SIA (Self Improving AI framework) changes the outer workflow, called the harness, and also changes the model’s weights, which are the internal settings that store learned patterns. which means task feedback changes the model’s internal parameters, pushing it toward domain knowledge.The paper reports a 56.6% gain on LawBench, 91.9% runtime reduction on GPU kernels, and 502% improvement on single-cell RNA denoising over baseline.hexoai开源了SIA(自我改进AI)框架。该框架展示了AI智能体不仅能优化其外部工作流(harness),还能通过任务反馈直接更新自身的模型权重,从而在领域知识和能力上实现自主提升,而非仅依赖人类提供的提示或工具改进。论文报告显示,SIA在LawBench基准上性能提升56.6%,在GPU kernels运行上耗时减少91.9%,在单细胞RNA去噪任务中相比基线提升502%。

Kunal Bhatia: Superintelligence will be built on Self Improvement. Today @hexoai, we’re excited to release ‘SIA’ - an open-source Self...


推荐理由:不再只是给AI换提示词,SIA框架连模型自己的权重都更新了,在三个任务里分别提升了56%、502%和91%加速,开源出来会让整个Agent开发范式重新思考。
02:39
Claude Code:GitHub Releases(RSS)精选
AI 评分 73/100
Claude Code v2.1.154 发布:新增 Opus 4.8 与动态工作流

Claude Code 更新至 v2.1.154 版本,正式引入 Opus 4.8 模型。新功能包括“动态工作流”,可通过 /workflows 指令让 Claude 在后台编排数十到数百个 AI 智能体协同处理复杂任务。Opus 4.8 的快速模式现已可用,成本降低为 2 倍标准费率可实现 2.5 倍速度提升。其他更新有:精简系统提示词成为默认设置(除 Haiku、Sonnet 及 Opus 4.7 及更早版本外),优化多选题决策逻辑,简化 /simplify 命令。此次更新修复了包括后台会话管理、终端渲染在内的多个 bug,并增强了自动模式对数据外泄的检测能力。

另有 3 家信源报道Claude Code:GitHub Releases(RSS)X:Claude Devs (@ClaudeDevs)X:Thariq (@trq212)
推荐理由:Claude Code 这版把多 agent 编排做成了产品功能,动态工作流让一个 prompt 能调度上百个 agent,再加上 Opus 4.8 快速模式只要 2 倍价格,做复杂任务的开发者可以试一下。
01:21
Claude:Blog(网页)精选
AI 评分 78/100
在Claude Code中引入动态工作流

Claude Code 推出“动态工作流”功能,使 Claude 能端到端处理复杂任务。该功能通过动态编写脚本,在单个会话中并行运行数十到数百个子智能体来完成工作,并会在结果呈现前进行验证。它适用于跨代码库的 bug 查找、大规模迁移(如将 Bun 从 Zig 移植到 Rust)等需要多角度分析的任务。该功能现已在研究预览阶段可用,支持 Claude Code CLI、桌面端、VS Code 扩展以及 API、Amazon Bedrock、Vertex AI 等平台,面向 Max、Team 及已启用的 Enterprise 计划用户。


推荐理由:动态工作流第一次让 Claude Code 能独立搞定需要并行协调的大规模工程任务,Bun 从 Zig 到 Rust 只用了十一天,这对复杂代码库的维护和迁移是降维打击。
01:14
TechCrunch:AI(RSS)精选
AI 评分 72/100
Anthropic 发布 Opus 4.8 并推出新型"动态工作流"工具

Anthropic 发布了最新的 Opus 4.8 大语言模型,并为该模型引入了一个名为“Dynamic Workflows”的新工具。该工具旨在协调由多个子代理组成的群组,以执行复杂任务。

另有 12 家信源报道Hacker News 热门(buzzing.cc 中文翻译)MarkTechPost(RSS)The Decoder:AI News(RSS)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:Claude Devs (@ClaudeDevs)X:洪明 (@hongming731)X:Kim (@kimmonismus)X:OpenRouter (@OpenRouter)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)X:Thariq (@trq212)
推荐理由:Opus 4.8 是 Anthropic 对 Opus 4.7 失望反应的快速回应,亮点不在跑分而在模型能主动标记不确定性,这比正确率更实用。动态工作流让跨子 agent 的代码迁移成为现实,开发团队值得关注。
01:05
Anthropic:Newsroom(网页)精选
AI 评分 85/100
Claude Opus 4.8 发布:在编码、智能体技能与推理方面实现全面升级

Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中均取得进步。Claude Opus 4.8 现已可用,价格与前代相同。同步推出的新功能包括:用户可控制任务投入程度、Claude Code 新增“动态工作流”特性,以及 Opus 4.8 的 2.5 倍速模式价格降低为以往的三分之一。早期测试者反馈其在智能体任务中的判断力更可靠、工具调用更高效。该模型在 Online-Mind2Web 测评中得分 84%,超越了 Opus 4.7 和 GPT-5.5。此外,其诚实度与对齐表现也得到提升,代码错误漏检率降低了约 75%。


推荐理由:Opus 4.8看着是常规升级,但动态工作流让Claude Code能啃下跨十万行代码迁移这种硬骨头,快速模式降价三倍更是直接拉低了实时场景的入场券。
00:33
Tomer Tunguz 博客(VC 分析)精选
AI 评分 61/100
AI智能体时代下的安全变革

Lemonade的CISO Jonathan Jaffe探讨了AI智能体时代的安全新挑战。他指出,AI对攻击者和防御者同样强大,但可被利用的漏洞窗口正在缩小,因为AI能更快地生成、审查和修补代码。为此,安全团队正向工程团队转型,例如Lemonade的安全部门均由工程师组成,并构建了包含智能体的内部AI平台。同时,每个智能体(单个终端上可能运行200到10000个)都需要被赋予身份,并在操作点由策略进行更复杂的管控,这超越了当前身份与访问管理系统的能力。


推荐理由:Jaffe 给出的结论很提气,AI 对防御方的加成被市场严重低估了,尤其每个 Agent 必须拥有身份和策略控制这个预判,值得所有在做 Agent 架构的人看一遍。

5月28日5月28日周四

星期四 · 8 条
11:35
公众号:面壁智能(MiniCPM)精选
AI 评分 61/100
PilotDeck 开源:以 WorkSpace 为核心的智能体操作系统

清华大学 THUNLP 实验室、面壁智能、OpenBMB 与 AI9stars 联合研发并开源的智能体操作系统 PilotDeck,以 WorkSpace(工作舱)替代传统对话框,每个工作舱拥有独立文件系统、记忆和技能,实现项目隔离。三大核心能力:记忆白盒化,全链路可见可控,支持一键修改和回滚;智能路由,自动识别任务难度动态分配模型,开启后成本节省近 70%,复杂任务仅用 1/6 成本即可反超顶级模型方案;Always-on 常驻任务,AI 主动发现并持续推进工作。支持端云协同,可调用端侧模型作为子 Agent,自动部署 VoxCPM 等模型完成多语言播客等任务。


推荐理由:PilotDeck把Agent从对话框解放进「工作舱」,记忆可见、成本锐减、能无人值守运行。已开源,值得所有被多任务折磨的开发者试试。
11:28
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
AI研究智能体窄化科学探索

本研究将AI研究智能体视为科学搜索系统进行评估。通过四个框架和六个大语言模型,从共享种子文献中生成了37,802个科学想法,并与人类论文、后续研究及种子文献进行对比。实验揭示了四个一致的模式:AI生成的想法比同领域人类论文更为集中;更贴近其起始文献,而非后续人类研究;与AI想法最相似的论文后续引用量往往较低;当AI想法与已有工作不同时,差异主要源于对现有技术方法的重组,而非引入全新的研究问题。总体而言,当前的AI研究智能体更擅长局部细化,而非拓展科学探索的广度。


推荐理由:这篇论文用3万多个AI生成的想法证明,当前AI研究代理更像是在现有研究上修修补补,而不是开拓新方向。所有想靠AI加速科研的团队都该看一下,别高估了AI的「创造力」。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
恢复策略引发的错误:鲁棒GUI智能体的基准测试与轨迹合成

针对GUI智能体缺乏从自身错误中恢复能力的问题,本研究提出了GUI-RobustEval基准测试和RoTS轨迹合成框架。GUI-RobustEval包含1216个可执行测试用例,系统评估智能体在多种错误模式下的恢复能力。RoTS框架通过基于树的流程合成了80万条高质量数据。在此基础上训练的RoTS-7B和RoTS-32B模型,在GUI-RobustEval及传统基准上均获得显著提升。其中RoTS-32B在OSWorld上取得了47.4%的成功率和33.8%的All-Pass@4分数,表明长时程错误恢复能力的增强对鲁棒性和整体性能均有贡献。


推荐理由:GUI Agent 能不能从自己犯的错里爬起来,才是落地的关键,阿里这篇论文给出了一个不错的基准和训练方案,做 Agent 的可以看看。
07:07
Anthropic:Research(发表成果 · 网页)精选
AI 评分 69/100
社会科学中的编码智能体

一项针对1260名定量社会科学家的调查显示,虽然81%的受访者用过AI聊天机器人,但仅有20%将Claude Code、Codex等编码智能体常规应用于工作。采用率存在显著差异:以男性名字命名的研究者使用率是女性研究者的两倍;顶尖大学研究者可能性高出40%。用户产出更多工作论文和基金申请,但这可能反映早期采用者自身差异。研究者对AI助力撰写可发表论文更乐观,但对重塑整个社会科学领域持保留态度。这是一项初步调查,更深入研究仍在进行中。


推荐理由:Anthropic 这份调查把编码代理在社科领域的真实渗透率摸清了,只有 20% 的研究者真在用,而且男女、校际差距比 AI 聊天工具大得多,做学术工具的可以认真看看。
06:07
Claude:Blog(网页)精选
AI 评分 77/100
使用大语言模型保障源代码安全

本文分享了使用 Claude Opus 构建威胁模型、发现代码漏洞并进行验证、分类和修复的最佳实践。其核心流程是一个六步循环:威胁建模、沙箱隔离、漏洞发现、验证、分类和修复。作者指出,漏洞发现现在易于并行化,瓶颈已转移到后续的验证与处理阶段。以他们对开源软件的扫描为例,截至2026年5月22日已披露1,596个漏洞,其中97个已修补。指南建议结合代码库文档和专家访谈来构建准确的威胁模型,以降低误报,提升发现的可利用性。


推荐理由:Anthropic把这套用Claude扫代码漏洞的方法全公开了,1596个已披露漏洞,验证成了最大瓶颈,安全工程师的饭碗可能要重新定义。
03:33
Tomer Tunguz 博客(VC 分析)精选
AI 评分 61/100
软件之后是AI时代

软件时代正过渡至“智能体框架”时代。AI作为强大但需驯化的“野马”,其智能驯化包含七个核心组成部分:上下文与记忆、工具与行动、编排与循环、状态与持久性、沙箱与计算、可观测性与治理、成本与工作流优化。这些组件共同构成了一个生产级的智能体系统。这一转变将重塑软件竞争格局,模型通用化的未来中,最佳的智能体驾驭者将获胜。


推荐理由:Tomer 把 agent 时代的竞争拆成七个组件,不是空谈,而是给了创业公司一个具体的 check-list,做 agent 产品的值得对照一下。
03:23
swyx@swyx精选
AI 评分 75/100
Cognition成为全球最大独立智能体实验室cognition is now the largest independent agent lab in the world. take the 200% utilization that everyone is hitting from this chart and run out the sales growth from this, i encourage you to go thru the exercise if you are new to investinga lot of you have read my cog initation post, but when i talk to people they do not sufficiently appreciate that this is the perfect storm of all the trends:• first* koding agent • first* cloud dev infra • best reviewed code review/security guy • first* llm wiki knowledge base • s-tier GTM • most IOI golds • somehow also cracked at Smash Bros and Pokeragent lab gets you: • long model diversity • long reasoning/toolcalling models • long harnesses • long domain specific RLFT • long coding data/expertise/evals • long full agentic SDLC • chief partner to CIOs in combating tokenmaxxing slop from humans and from agents • SOTA foodbench from house chefsand this is why you can see this is Peter Thiel's biggest AI bet*i dont like "first" as an adjective, but "first + 2 years of serious scaling" really serves as a shorthand for "most enterprise battle tested" - see customer list in screenshot - literally 10s of thousands of devs, 10s of thousands of repos, PER CUSTOMER is the kind of weight I put on the simple word "first"Cognition宣布已成为全球最大的独立智能体实验室。公司完成超10亿美元融资,估值达260亿美元,由Lux Capital、General Catalyst等领投。其企业使用量自年初增长超10倍,年化收入增至4.92亿美元。Cognition于两年前推出Devin,定位为首个AI软件工程师。公司强调其拥有多项领先优势,包括首个编码智能体、顶级代码审查能力等,并得到了Peter Thiel的重大投资。

Cognition: 1/ We’ve raised over $1B at a $26B valuation, led by @Lux_Capital, @generalcatalyst, and @8vc. Our enterprise usage has ...

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:Devin 母公司 Cognition 完成 10 亿美元融资,估值 260 亿,年度经常性收入近 5 亿美元,这是 agent 赛道从故事走向现金流的拐点,swyx 对「first mover 加两年规模化」的分析比数据本身更有看点。