精选归档 · 第 62 页

1,2211,240 条 · 共 1,267

9月11日9月11日周四

星期四 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 73/100
为智能体编写高效工具--与智能体协作

文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。


推荐理由:Anthropic 把自家内部反复打磨的 agent 工具开发方法论完整公开了,从评估流程到 prompt 工程细节全是实操干货,做 MCP server 或 agent 工具链的人可以直接抄作业。

9月8日9月8日周一

星期一 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 69/100
Cognition 融资超 4 亿美元,估值达 102 亿美元

Cognition 宣布融资超 4 亿美元,投后估值 102 亿美元,由 Founders Fund 领投。Devin 的 ARR 从 2024 年 9 月的 100 万美元增至 2025 年 6 月的 7300 万美元,公司历史总净消耗低于 2000 万美元;收购 Windsurf 使 ARR 翻倍以上,并购后七周合并企业级 ARR 增长超 30%。


推荐理由:官方披露融资估值的同时给出 ARR、净消耗和并购后的增长数字,读者可以据此评估其 AI 编码业务的真实成色。

9月3日9月3日周三

星期三 · 1 条
22:03
Linear:Now(RSS)精选
AI 评分 61/100
Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单

Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。


推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。

8月28日8月28日周四

星期四 · 1 条
08:00
xAI:News(网页)精选
xAI发布轻量级编程模型Grok Code Fast 1

xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。


推荐理由:xAI发布专为Agentic Coding优化的极速编程模型,已集成Cursor、Copilot等主流工具,价格极具竞争力

8月25日8月25日周一

星期一 · 1 条
00:00
Claude:Blog(网页)精选
Anthropic发布Claude浏览器扩展:AI自动操作功能向付费用户开放

Anthropic正式发布Claude for Chrome扩展,允许AI在浏览器中执行点击、填表等操作。该功能已从1000名Max用户试点扩展至所有付费订阅者,新增Claude Code集成、定时任务及多标签工作流。针对提示词注入攻击,Anthropic通过站点权限、操作确认等防护措施,基于123个测试案例的红队测试,将攻击成功率从23.6%降至11.2%,并屏蔽高风险网站以确保安全。


推荐理由:Claude浏览器代理正式开放,自动操作网页同时攻克提示注入安全难题

8月21日8月21日周四

星期四 · 4 条
22:46
Linear:Now(RSS)精选
AI 评分 60/100
Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体

Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。


推荐理由:Cursor 代理现在能直接从 Linear 任务面板接手编码工作,后台自动提 PR、更新进度,对那些积压 P2/P3 的团队来说,这是把 AI 真正嵌入工作流的信号。
14:25
公众号:DeepSeek(深度求索)精选
AI 评分 80/100
DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。


推荐理由:混合推理架构统一思考与非思考模式,Agent基准提升具体,API兼容Anthropic格式直接降低Claude Code接入门槛。
14:25
公众号:DeepSeek(深度求索)精选
AI 评分 63/100
DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。


推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。
00:00
DeepSeek:API 更新日志精选
AI 评分 71/100
DeepSeek-V3.1 发布,升级 chat 与 reasoner 双模式

DeepSeek-V3.1 正式发布,deepseek-chat 与 deepseek-reasoner 分别对应其非思考与思考模式。新模型采用混合推理架构,思考效率较 DeepSeek-R1-0528 更高,并通过 Post-Training 优化提升工具使用与智能体任务表现。


推荐理由:DeepSeek 把推理和非思考模式合并到一个模型,解决了之前切模型的体验割裂,Agent 能力提升对做工具调用的开发者是直接利好。

8月19日8月19日周二

星期二 · 2 条
00:00
ARC Prize:官方博客精选
AI 评分 61/100
ARC Prize 发布 ARC-AGI-3 Preview 30天测试总结与Agent竞赛结果

ARC Prize Foundation 总结 ARC-AGI-3 Preview 发布30天的数据:超1200人玩了3900多局游戏,人类大多能通关,AI Agent 进展低效。竞赛冠军 StochasticGoose 得分12.58%、完成18关,前三名Agent均基于智能随机探索;官方指出部分游戏可被暴力搜索破解,未来将按动作效率对人类基线评分并增加撤销按钮、离线引擎等改进。


推荐理由:原文公布了30天竞赛的完整人类与Agent得分对比,读者可以看到交互式推理基准用动作效率区分人类和AI的具体依据。

8月15日8月15日周五

星期五 · 1 条
19:57
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 58/100
inclusionAI/UI-Venus

UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。


推荐理由:蚂蚁这个纯截图驱动的 UI Agent 在当时算是早期探索,代码开源可直接用,做 GUI 自动化的值得看看底层怎么实现元素定位和导航。

8月13日8月13日周三

星期三 · 1 条
00:00
METR:Research(网页)精选
AI 评分 60/100
METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。


推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。

8月8日8月8日周五

星期五 · 1 条
01:02
Ethan Mollick:One Useful Thing(RSS)精选
GPT-5:只管做事

GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。


推荐理由:Ethan Mollick 深度解读 GPT-5 自主执行能力,洞察 AI 代理新范式

7月31日7月31日周四

星期四 · 1 条
00:00
LMSYS:Blog(Chatbot Arena 团队)精选
智谱发布 GLM-4.5 系列模型并原生支持 SGLang

智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。


推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

7月14日7月14日周一

星期一 · 2 条
01:06
Jim Fan@DrJimFan精选
最近在 X 上较为沉默。过去一年是转型之旅。Grok-4 与…I've been a bit quiet on X recently. The past year has been a transformational experience. Grok-4 and Kimi K2 are awesome, but the world of robotics is a wondrous wild west. It feels like NLP in 2018 when GPT-1 was published, along with BERT and a thousand other flowers that bloomed. No one knew which one would eventually become ChatGPT. Debates were heated. Entropy was sky high. Ideas were insanely fun.I believe the GPT-1 of robotics is already somewhere on Arxiv, but we don't know exactly which one. Could be world models, RL, learning from human video, sim2real, real2sim, etc. etc, or any combo of them. Debates are heated. Entropy is sky high. Ideas are insanely fun, instead of squeezing the last few % on AIME & GPQA.The nature of robotics also greatly complicates the design space. Unlike the clean world of bits for LLMs (text strings), we roboticists have to deal with the messy world of atoms. After all, there's a lump of software-defined metal in the loop. LLM normies may find it hard to believe, but so far roboticists still can't agree on a benchmark! Different robots have different capability envelopes - some are better at acrobatics while others at object manipulation. Some are meant for industrial use while others are for household tasks. Cross-embodiment isn't just a research novelty, but an essential feature for a universal robot brain.I've talked to dozens of C-suite leads from various robot companies, old and new. Some sell the whole body. Some sell body parts such as dexterous hands. Many more others sell the shovels to manufacture new bodies, create simulations, or collect massive troves of data. The business idea space is as wild as research itself. It's a new gold rush, the likes of which we haven't seen since the 2022 ChatGPT wave.The best time to enter is when non-consensus peaks. We're still at the start of a loss curve - there're strong signs of life, but far, far away from convergence. Every gradient step takes us into the unknown. But one thing I do know for sure - there's no AGI without touching, feeling, and being embodied in the messy world.On a more personal note - running a research lab comes with a whole new level of responsibility. Giving updates directly to the CEO of a $4T company is, to put it mildly, both thrilling and all-consuming of my attention weights. Gone are the days when I could stay on top of and dive deep into every AI news.I’ll try to carve out time to share more of my journey.机器人领域正处于类似 2018 年 NLP 的混沌期,技术路线未定(世界模型、RL、sim2real 等),商业模式百花齐放,是入局的好时机。管理实验室并直接向 4 万亿美元公司 CEO 汇报消耗了全部精力,故在 X 上发言减少。坚信没有具身智能就没有 AGI。

推荐理由:Jim Fan 称机器人领域处 GPT-1 时刻,具身智能是 AGI 必要条件
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 79/100
Cognition 签约收购智能体 IDE 公司 Windsurf

Cognition 签署最终协议收购智能体 IDE 公司 Windsurf,交易包括其 IP、产品、商标、品牌和业务,Windsurf 团队将加入 Cognition。


推荐理由:官方公告披露了交易范围、Windsurf 的 ARR 和用户规模及员工待遇安排,读者可以据此了解这起收购的实际内容。

7月10日7月10日周四

星期四 · 1 条
00:00