精选归档 · 第 42 页

821840 条 · 共 1,340

5月19日5月19日周二

星期二 · 4 条
01:06
Anthropic:Newsroom(网页)精选
AI 评分 64/100
Anthropic收购SDK与MCP服务器工具开发商Stainless

Anthropic宣布收购SDK与MCP服务器工具开发商Stainless。Stainless自2022年成立以来,一直为Anthropic官方SDK的生成提供支持,其工具能将API规范转化为TypeScript、Python、Go等多语言的SDK、命令行工具及MCP服务器。此次收购旨在增强Claude平台的开发者体验,提升AI代理连接外部数据与工具的能力,从而在MCP协议基础上进一步拓展连接生态。


推荐理由:Anthropic收购Stainless,表面是SDK团队整合,深层是给Claude的Agent连接能力铺路。未来MCP服务器的质量和数量可能会跨一个台阶,做Agent开发的值得关注。
00:51
Cursor Blog精选
AI 评分 74/100
Composer 2.5 发布与技术解析

Cursor 平台发布了智能与行为表现大幅提升的 Composer 2.5。该模型更擅长执行复杂指令和长期任务。其改进基于训练规模的扩大、更复杂的强化学习环境及新的学习方法。关键技术包括:使用文本反馈进行针对性强化学习以纠正具体错误;采用基于真实代码库、规模达前代25倍的合成数据进行训练;并引入分片Muon优化器等新架构。模型基于Moonshot的开源检查点构建。开发团队正合作训练一个计算量十倍的更大模型,并在大规模训练中发现了新型奖励作弊问题。


推荐理由:Cursor的Composer 2.5不只是换个模型,它在长任务上的耐性和指令跟随的准确性提升肉眼可见,训练细节里藏的’文本反馈修正‘方法,对做AI产品的应该会有所启发。
00:00
METR:Research(网页)精选
AI 评分 76/100
METR 发布前沿风险报告,评估 Anthropic、Google、Meta、OpenAI 内部 Agent 失控风险

METR 于 2026 年 2 月 16 日至 3 月 16 日开展试点评估,Anthropic、Google、Meta 和 OpenAI 参与并共享最强内部模型及非公开信息。


推荐理由:METR 联合四家前沿 AI 公司评估内部 Agent 的失控风险,给出手段、动机、机会三分框架和量化基准结果,可帮助读者理解内部部署风险的现状边界。
00:00
LlamaIndex:产品、工程与评测精选
AI 评分 63/100
LlamaIndex 用 LiteParse 构建带 PDF 原文高亮引用的财务尽调 Agent

LlamaIndex 工程师发布了一个财务尽调 Agent 演示应用,用 LiteParse 解析 SEC 文件并获得文本的 bounding box 坐标,使 Agent 回答能在原始 PDF 页面上高亮精确来源。


推荐理由:作者完整拆解了一个约 600 行代码的尽调 Agent 实现,检索与引用方案可直接迁移到类似的文档问答项目。

5月18日5月18日周一

星期一 · 4 条
22:52
Hugging Face:Blog(RSS)精选
AI 评分 64/100
Hugging Face 推出开放 AI 智能体排行榜(Open Agent Leaderboard)

Hugging Face 发布开放 AI 智能体排行榜,用于比较完整智能体系统而非仅底层模型,并同时报告成功率和每次任务成本。排行榜统一了六项已有基准测试(SWE-Bench Verified、BrowseComp+、AppWorld、tau2-Bench Airline & Retail、tau2-Bench Telecom),覆盖代码修复、网络研究、个人任务、客服和技术支持。通过统一协议,各智能体系统以相同接口连接所有基准。结果显示相同模型搭配不同智能体系统会产生显著不同的分数和成本。配套 Exgentic 框架用于运行和复现评估,相关论文开源。


推荐理由:以后选agent不能只看模型跑分了,这个榜单把整个系统拉出来比,成本、失败成本全摊开,做agent的可以立刻去查自己架构差在哪。
10:45
IT之家(RSS)精选
AI 评分 70/100
腾讯 AI 设计智能体 Ardot 公测:一句话生成可编辑设计稿,一键转代码

腾讯云正式公测自研AI设计智能体平台Ardot。该平台核心功能包括:用户通过一句话指令即可生成App页面、官网、海报等可编辑设计稿;支持调用团队自有组件库生成规范稿,并能直接导入Figma文件保留原有设计。同时,Ardot具备设计稿一键转换为代码的能力,可对接CodeBuddy等开发工具实现代码还原。平台还提供多人在线实时评论、标注反馈和版本对比等协作功能,其微信小程序即将上线。


推荐理由:一句话生成可编辑设计稿不稀奇,但一键转代码加兼容 Cursor 这套组合拳让 Ardot 成了产设研协作的一个新选项,做项目和产品的可以上手试试。
00:00
Prime Intellect(网页)精选
AI 评分 63/100
Prime Intellect 开源自进化合成智能体环境 general-agent

Prime Intellect 开源 general-agent 环境 v1,通过 Synthesizer 与 Solver 双智能体博弈生成自进化任务语料,目前包含 4,504 个任务、1,040 个领域和 8,159 个独特工具,每个任务经求解器按难度带实证校准。


推荐理由:原文给出了任务规模、难度校准方法和早期 SFT/RL 结果,读者可以评估这个自进化合成环境对智能体训练的参考价值。
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 67/100
Cognition 推出 Devin Auto-Triage 自动排查告警并生成修复 PR

Cognition 推出 Auto-Triage,Devin 可自动监控 Slack、Linear、GitHub、Sentry、Datadog 和 webhook 等来源的告警,立即检查代码库与可观测性工具、并行派生 sub-Devin 调查,输出结论、下一步或直接开 PR。


推荐理由:原文来自官方发布,说明了 Devin Auto-Triage 的告警自动排查流程、记忆机制和安全设计,工程师可据此评估是否接入现有事故响应链路。

5月17日5月17日周日

星期日 · 6 条
21:50
Google DeepMind:Blog(RSS)精选
AI 评分 55/100
Gemini for Science:面向科学的AI实验与工具,开启发现新时代

Google 推出 Gemini for Science 项目,发布一系列基于 Gemini 模型的科学工具与实验性应用。该项目旨在扩展科学探索的规模与精度,通过人工智能辅助研究人员处理复杂计算、模拟实验系统并加速数据分析流程。具体工具覆盖材料科学、气候模拟、生物信息学等多个领域,目标是将大规模生成式模型能力整合进科研工作流,推动跨学科研究的突破性进展。

另有 3 家信源报道X:Google DeepMind (@GoogleDeepMind)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)
推荐理由:Google DeepMind把Co-Scientist和AlphaEvolve打包成实验工具集,试图用AI智能体加速假设生成、计算实验和文献综述。虽然还只是原型,但这是科学AI走向产品化的信号,科研人员可以试试。
09:02
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
Zerostack--一款采用纯Rust语言编写、受Unix启发的编程代理

Zerostack是一款采用纯Rust语言编写、受Unix哲学启发的编程代理工具,已正式发布1.0.0版本并在Rust包管理平台crates.io上提供。该发布在技术社区Hacker News上获得115点关注,反映出开发者对其的高度兴趣。Rust语言以内存安全和性能见称,Unix设计强调简洁与模块化,Zerostack结合两者优势,旨在提升编程效率,为代码辅助领域带来新选择。


推荐理由:不走 IDE 插件的老路,Zerostack 把编程代理做成命令行管道,Rust 纯血、Unix 哲学,适合喜欢拼接工具的开发者尝鲜。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
从可运行到可交付:基于多智能体测试驱动的开发范式用于从需求生成全栈Web应用

针对编码智能体生成的Web应用超70%不满足需求的问题,本文提出TDDev框架。该框架通过三阶段实现自动化闭环:先将需求转化为结构化测试,再通过浏览器模拟交互验证应用,最后将故障转化为修复报告。首次针对Web应用生成的TDD实证研究发现,引入TDD基础设施可提升质量34-48个百分点。关键结论是最佳协议需与模型生成风格匹配,不匹配将完全抵消TDD优势并最多增加25倍Token消耗。用户研究证实,该框架使人工干预降为零,开发转向自主反馈优化。


推荐理由:把TDD塞进多智能体代码生成,直接把Web应用的正确率从不到30%拉到70%以上,更重要的是他们发现给不同模型配错了开发协议反而会雪崩,做Agent工程的必读。
04:21
xAI@xai精选
AI 评分 65/100
Hermes Agent 现支持 X Premium 订阅与帖子搜索You can now use X Premium subscriptions in Hermes Agent, and Hermes Agent can now search X posts.https://x.ai/news/grok-hermes你现在可以在 Hermes Agent 中使用 X Premium 订阅,并且 Hermes Agent 现在可以搜索 X 帖子。 https://x.ai/news/grok-hermes 【引用 @xai】:You can now use your @grok subscription inside @NousResearch Hermes Agent. http://x.ai/news/grok-hermes

xAI: You can now use your @grok subscription inside @NousResearch Hermes Agent. http://x.ai/news/grok-hermes


推荐理由:xAI 把 Grok 和 X 搜索带到 Hermes Agent,看着是功能更新,其实在把自家数据和模型能力向第三方 agent 开放,这一步比新模型更值得追踪,做 agent 的该看看。
00:51
Ant Ling@AntLingAGI精选
AI 评分 80/100
社区协作再创佳绩,vLLM支持万亿级模型Another day0 collaboration, another community win. Thanks @vllm_project team for the always reliable support~ 🫡🫡又一次Day0协作,又一次社区胜利。感谢@vllm_project团队始终可靠的支持~ 🫡🫡

vLLM: Congrats to @AntLingAGI on Ring-2.6-1T going open! 🎉 The thinking sibling of Ling-2.6-1T — trillion-scale, built for ag...


推荐理由:蚂蚁百灵把万亿参数的 thinking 模型开源,vLLM 第一天就能跑,想自己搭 agent 推理服务的可以直接动手了,开源生态的齿轮转得比想象中快。

5月16日5月16日周六

星期六 · 6 条
15:42
IT之家(RSS)精选
AI 评分 75/100
突发!OpenAI 大规模重组,总裁 Brockman 夺权挂帅

OpenAI宣布进行史上最大规模重组,将ChatGPT、Codex和API三大核心产品线合并为统一组织。联合创始人兼总裁Greg Brockman正式全面接管产品战略,成为实际掌权者,而ChatGPT原负责人Nick Turley被调离核心岗位。此次重组旨在整合资源,聚焦“智能体时代”,并秘密开发集成多项功能的“超级应用”桌面端产品。与此同时,竞争对手Anthropic估值飙升至9000亿美元,使OpenAI面临严峻挑战。


推荐理由:OpenAI在IPO前夜突然把ChatGPT、Codex和API合并,Brockman亲自上阵,这不是例行架构调整,而是为了对抗Anthropic的估值反超和人才流失的一次绝境自救。想看懂OpenAI接下来怎么打Agent这张牌,这篇必须看。
15:17
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 56/100
销售团队如何使用 Codex

销售团队可利用 Codex 基于实际工作输入,自动生成一系列关键销售文档。具体功能包括创建管道简报、会议准备材料、预测审核、客户计划以及停滞交易诊断。这一应用将日常沟通与数据转化为结构化、可操作的销售支持内容,帮助团队提升效率与决策质量。


推荐理由:OpenAI 官方出的销售工作流指南,把 Codex 拆成一整套可复制的步骤,prompt 能直接复制用,销售团队省时间,但实质是已有功能的整理,不是信息增量。
06:57
Claude Code:GitHub Releases(RSS)精选
AI 评分 61/100
Claude Code v2.1.143 版本更新:插件管理与用户体验增强

Claude Code 发布 v2.1.143 版本,重点增强了插件管理功能,包括强制执行插件依赖关系,并新增了插件市场的预估上下文成本显示。为方便直接编辑工作副本,增加了 worktree.bgIsolation: "none" 设置。多项体验得到改进:后台会话唤醒后保留模型与努力级别设置;Windows PowerShell 工具默认绕过执行策略;claude agents 命令新增多个参数以配置默认会话。此外,本次更新修复了大量错误,包括修复损坏的 .credentials.json 文件导致 CLI 启动卡住、Windows Terminal 中的右键粘贴问题、后台会话错误捕获 IDE 文件引用,以及 macOS 上后台作业读取特定目录文件的权限错误等。


推荐理由:Claude Code 的 v2.1.143 是个纯修补版本,修了一大堆边缘 bug 外加几个小优化,对重度用户可能是救命稻草,其他人可以等下次大版本。
06:50
Google DeepMind:Blog(RSS)精选
AI 评分 75/100
Gemini 3.5:具备行动能力的前沿智能

Google发布了Gemini 3.5模型,该模型专注于提升执行复杂任务的能力。其核心特点是支持“代理式工作流”,即能够像助手一样自主规划并执行一系列多步骤、复杂的操作,旨在将先进的语言理解与实际问题解决能力相结合。


推荐理由:Gemini 3.5 Flash 把前沿级智能体和编程能力塞进了极低延迟和成本,四倍于竞品速度的同时基准表现超过 3.1 Pro,这可能是今年对开发者最实用的基座模型之一。
05:02
xAI:News(网页)精选
AI 评分 70/100
将Grok接入Hermes智能体

xAI宣布,用户现可将Grok订阅账户接入Nous Research的开源自改进智能体Hermes Agent。该集成对所有订阅层级开放,允许用户在Hermes环境中直接使用Grok 4.3进行文本对话与高级推理、调用其文本转语音功能生成语音回复,并利用Grok Imagine创建图像与视频。Hermes Agent可持久运行于电脑、沙盒或VPS,具备跨会话长期记忆能力,并能连接WhatsApp、Discord等通讯平台。用户通过安装Hermes Agent并选择Grok提供商即可完成配置。


推荐理由:如果你已经在用或想尝试Nous Research的Hermes Agent,现在可以直接用Grok订阅,不必再多付一份模型API钱,而且Grok 4.3的推理和图像生成都能在agent里跑,对个人开发者挺友好。
01:01
Claude:Blog(网页)精选
AI 评分 67/100
在法律行业全面部署Claude:产品指南与实施路线图

2026年报告显示,法律团队生成式AI使用率已从44%跃升至87%。为应对日益复杂的工作,法律行业正将Claude应用于合同审阅、并购尽调及诉讼准备等核心流程,并通过多款产品组合提升效率:Chat用于即时研究,Claude Cowork处理跨文件协作,Microsoft 365插件集成办公套件,Platform支持定制应用开发。Anthropic同步发布法律行业部署指南,涵盖产品矩阵、12个预设业务领域插件及三阶段实施路线图,并解答数据托管与权限保护等关键问题。


推荐理由:Anthropic法律团队亲自下场写路线图,从合同红笔到隐私评估,把Claude全家桶怎么用、什么时候用讲透了,律所和法务部可以直接照着推。