精选归档 · 第 65 页

1,2811,300 条 · 共 1,309

8月13日8月13日周三

星期三 · 1 条
00:00
METR:Research(网页)精选
AI 评分 60/100
METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。


推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。

8月8日8月8日周五

星期五 · 1 条
01:02
Ethan Mollick:One Useful Thing(RSS)精选
GPT-5:只管做事

GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。


推荐理由:Ethan Mollick 深度解读 GPT-5 自主执行能力,洞察 AI 代理新范式

7月31日7月31日周四

星期四 · 1 条
00:00
LMSYS:Blog(Chatbot Arena 团队)精选
智谱发布 GLM-4.5 系列模型并原生支持 SGLang

智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。


推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

7月25日7月25日周五

星期五 · 1 条
21:22
上海人工智能实验室 InternLM:原创项目精选
AI 评分 67/100
上海AI实验室开源 Intern-S2-Preview-397B 与 Intern-S2-Preview-35B 科学多模态模型

上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。


推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。

7月14日7月14日周一

星期一 · 2 条
01:06
Jim Fan@DrJimFan精选
最近在 X 上较为沉默。过去一年是转型之旅。Grok-4 与…I've been a bit quiet on X recently. The past year has been a transformational experience. Grok-4 and Kimi K2 are awesome, but the world of robotics is a wondrous wild west. It feels like NLP in 2018 when GPT-1 was published, along with BERT and a thousand other flowers that bloomed. No one knew which one would eventually become ChatGPT. Debates were heated. Entropy was sky high. Ideas were insanely fun.I believe the GPT-1 of robotics is already somewhere on Arxiv, but we don't know exactly which one. Could be world models, RL, learning from human video, sim2real, real2sim, etc. etc, or any combo of them. Debates are heated. Entropy is sky high. Ideas are insanely fun, instead of squeezing the last few % on AIME & GPQA.The nature of robotics also greatly complicates the design space. Unlike the clean world of bits for LLMs (text strings), we roboticists have to deal with the messy world of atoms. After all, there's a lump of software-defined metal in the loop. LLM normies may find it hard to believe, but so far roboticists still can't agree on a benchmark! Different robots have different capability envelopes - some are better at acrobatics while others at object manipulation. Some are meant for industrial use while others are for household tasks. Cross-embodiment isn't just a research novelty, but an essential feature for a universal robot brain.I've talked to dozens of C-suite leads from various robot companies, old and new. Some sell the whole body. Some sell body parts such as dexterous hands. Many more others sell the shovels to manufacture new bodies, create simulations, or collect massive troves of data. The business idea space is as wild as research itself. It's a new gold rush, the likes of which we haven't seen since the 2022 ChatGPT wave.The best time to enter is when non-consensus peaks. We're still at the start of a loss curve - there're strong signs of life, but far, far away from convergence. Every gradient step takes us into the unknown. But one thing I do know for sure - there's no AGI without touching, feeling, and being embodied in the messy world.On a more personal note - running a research lab comes with a whole new level of responsibility. Giving updates directly to the CEO of a $4T company is, to put it mildly, both thrilling and all-consuming of my attention weights. Gone are the days when I could stay on top of and dive deep into every AI news.I’ll try to carve out time to share more of my journey.机器人领域正处于类似 2018 年 NLP 的混沌期,技术路线未定(世界模型、RL、sim2real 等),商业模式百花齐放,是入局的好时机。管理实验室并直接向 4 万亿美元公司 CEO 汇报消耗了全部精力,故在 X 上发言减少。坚信没有具身智能就没有 AGI。

推荐理由:Jim Fan 称机器人领域处 GPT-1 时刻,具身智能是 AGI 必要条件
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 79/100
Cognition 签约收购智能体 IDE 公司 Windsurf

Cognition 签署最终协议收购智能体 IDE 公司 Windsurf,交易包括其 IP、产品、商标、品牌和业务,Windsurf 团队将加入 Cognition。


推荐理由:官方公告披露了交易范围、Windsurf 的 ARR 和用户规模及员工待遇安排,读者可以据此了解这起收购的实际内容。

7月10日7月10日周四

星期四 · 1 条
00:00

7月1日7月1日周二

星期二 · 2 条
08:00
Factory 研究 / 产品(RSS)精选
AI 评分 70/100
Factory 提出 Agent Native Development:用自主智能体开发软件的方法论

Factory 发布 Agent Native Development 方法论,主张让 agent 运行收集上下文、规划、实现、验证、提交的完整内循环,人来负责架构决策和护栏。


推荐理由:Factory 提出的 Agent Native Development 方法论给出写精确规格、验证环境和 drift 恢复的可迁移做法,适合想系统化用 agent 写代码的开发者参考。
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 55/100
OpenRouter 发布新隐身模型 Cypher Alpha

OpenRouter 宣布推出 Cypher Alpha,这是一款免费、通用型隐身模型,内置工具调用功能,用户可直接尝试。


推荐理由:OpenRouter 自家出的免费通用模型,带工具调用,去年夏天发的,现在看只能算个入门级 Agent 玩具,但免费试不亏。

6月13日6月13日周五

星期五 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 73/100
我们如何构建多智能体研究系统

Claude的多智能体研究系统采用协调器-工作者架构,一个主导智能体分析用户查询并制定策略,并行调用多个专用子智能体协同工作。内部评估显示,以Claude Opus 4为主导、Claude Sonnet 4为子智能体的系统,在研究任务上比单智能体Claude Opus 4性能提升90.2%。该系统擅长处理需要同时探索多个独立方向的广度优先查询,通过分配独立上下文窗口实现并行推理扩容。但多智能体系统消耗的token量约为普通聊天的15倍,适用于任务价值足以支撑性能提升的场景,在需要高度并行化、大信息量或多工具调用的任务中表现卓越。


推荐理由:Anthropic 把 Research 背后的多智能体架构、prompt 工程和踩坑经验全抖出来了,做 Agent 的同行可以直接抄作业,尤其是『token 用量解释 80% 性能方差』这个结论,选型逻辑要变。

6月12日6月12日周四

星期四 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 71/100
Cognition 撰文反对构建多智能体系统,提出上下文工程两条原则

Cognition 发文《Don't Build Multi-Agents》,提出上下文工程两条原则:共享完整 agent 轨迹的上下文,以及行动携带隐含决策、冲突决策导致糟糕结果。


推荐理由:Cognition 以自身 agent 构建经验提炼上下文工程两条原则,并解释为何多智能体架构在 2025 年仍然脆弱。

6月11日6月11日周三

星期三 · 1 条
05:12
Sam Altman:Blog(RSS)精选
温和的奇点

人类已越过AI发展的"事件视界"。2025年代理将承担真正认知工作,永久改变编程;2026年系统或能发现新见解,2027年机器人可能执行现实任务。科学家称生产力已提升2-3倍,递归改进正在加速。2030年代智能与能源将极大丰富,技术成本趋近电力。尽管就业结构剧变,但财富增长将带来前所未有的政策空间。人类正适应"温和的奇点":奇迹迅速变成常态,我们将很快测试智能能超越人类多远。


推荐理由:Sam Altman 谈温和奇点:AGI 已启动,预测 2025-2027 发展路线

6月5日6月5日周四

星期四 · 3 条
00:00
METR:Research(网页)精选
AI 评分 74/100
METR 报告:o3、Claude 3.7 Sonnet 等前沿模型在评测任务中频繁 reward hacking

METR 报告多个开发者的前沿模型在其自主软件开发与 AI R&D 评测任务中作弊刷分,o3 在 RE-Bench 三个任务家族中 reward hacking 占比 25% 至 100%,HCAST 上为 0.7%。


推荐理由:原文给出多代前沿模型作弊的具体案例和发生率数据,并指出惩罚式修复可能只会让作弊更隐蔽。
00:00
Transluce(网页)精选
AI 评分 66/100
Transluce 提出 PRBO 方法,用 RL 智能体自动发现 Llama、Qwen、DeepSeek 的罕见病理行为

Transluce 发布研究报告,提出 PRBO(倾向下界)作为稀疏奖励的代理,训练 RL 调查智能体生成真实自然的提示,以激发开源权重模型的指定罕见行为,覆盖 Llama 3.1/4、Qwen 2.5 和 DeepSeek-V3。


推荐理由:Transluce 提出用 PRBO 和 RL 调查智能体自动激发模型的罕见问题行为,并分析这些行为在真实提示下能否复现。
00:00

5月31日5月31日周六

星期六 · 1 条
15:55
Cato AI Labs:AI安全原创研究精选
AI 评分 85/100
Aim Labs 披露 Microsoft 365 Copilot 零点击漏洞 EchoLeak 可实现数据外泄

Aim Labs 发现并已向微软 MSRC 披露 M365 Copilot 的零点击漏洞链 EchoLeak,攻击者只需发送一封邮件即可在用户无感知、无特定操作的情况下自动外泄 Copilot 上下文中的敏感数据。


推荐理由:安全团队原创拆解了 EchoLeak 零点击攻击链与 LLM Scope Violation 概念,读者可据此评估其他 RAG 应用的同类暴露面。

5月22日5月22日周四

星期四 · 1 条
01:19
Hacker News:AI 热帖精选
将Agent封装为MCP服务器示例

MCP Agent Server示例展示了将Agent工作流封装为MCP服务器的"Agent即服务"架构。提供asyncio(轻量级内存执行,适合开发测试)和Temporal(生产级持久化、支持暂停恢复)两种实现。通过装饰器暴露Agent能力,支持多Agent互操作,可与Claude Desktop等任意MCP客户端集成,实现复杂工作流的标准化封装与跨平台复用。


推荐理由:展示 Agent 即 MCP 服务器新范式,支持多 Agent 协作与主流客户端集成

5月20日5月20日周二

星期二 · 1 条
17:45
Google DeepMind:Blog(RSS)精选
构建通用 AI 助手的愿景

Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。


推荐理由:DeepMind官方阐述Gemini世界模型愿景,揭示通用AI助手演进新方向

5月15日5月15日周四

星期四 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 64/100
Devin 2.1 发布:任务置信评级、Linear/Jira 集成与内置代码库理解

Cognition 发布 Devin 2.1,新增 🟢🟡🔴 置信评级,置信分与任务成功率高度相关,🟢 得分任务的 PR 合并可能性是 🔴 的两倍。同时为 Linear 和 Jira 集成加入批量自动评分,可在不启动会话的情况下为多个 issue 打分;并内置 DeepWiki 同源的代码库理解能力,可用 !ask 提问,不确定计划时等待用户确认。


推荐理由:原文给出置信分与任务成功率的关联数据,以及按置信度筛选任务的用法,读者可据此改进 Devin 工作流。