精选归档 · 第 32 页

621640 条 · 共 648

8月13日8月13日周三

星期三 · 1 条
00:00
METR:Research(网页)精选
AI 评分 60/100
METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。


推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。

8月7日8月7日周四

星期四 · 3 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 68/100
GPT-5 已在 OpenRouter 上线

GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。

另有 1 家信源报道X:ChatGPT (@ChatGPTapp)
推荐理由:GPT-5 是 AI 史上的分水岭,长上下文和推理能力直接催生了一整代 agent 工具,哪怕过了快一年回头看,仍然值得搞清楚它改变了什么。
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 68/100
GPT-5 现已上线

OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。

另有 1 家信源报道X:ChatGPT (@ChatGPTapp)
推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 66/100
GPT-5 现已上线

GPT-5 已在 OpenRouter 平台正式推出。该模型具备长上下文处理能力,专门针对复杂推理任务与代码工作流进行了优化。此次发布标志着新一代大语言模型开始接入开放路由网络,为开发者与用户提供更强大的多步骤逻辑处理和编程辅助功能。


推荐理由:OpenRouter 上架 GPT-5 本身不算新闻,但对用 OpenRouter 做多模型路由的开发者来说,这是终于能切到最新旗舰的信号,值得第一时间跑一遍自己的 benchmark。

7月31日7月31日周四

星期四 · 1 条
00:00
LMSYS:Blog(Chatbot Arena 团队)精选
智谱发布 GLM-4.5 系列模型并原生支持 SGLang

智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。


推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

7月14日7月14日周一

星期一 · 2 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 56/100
OpenRouter 模型现可在 Cursor 中使用:试试月之暗面 Kimi K2

OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。

另有 1 家信源报道X:OpenRouter (@OpenRouter)
推荐理由:一篇将 OpenRouter 模型接入 Cursor 的实操指南,虽然已过时三百多天,但对想免配置用 Kimi K2 的 Cursor 用户仍有参考价值。
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 79/100
Cognition 签约收购智能体 IDE 公司 Windsurf

Cognition 签署最终协议收购智能体 IDE 公司 Windsurf,交易包括其 IP、产品、商标、品牌和业务,Windsurf 团队将加入 Cognition。


推荐理由:官方公告披露了交易范围、Windsurf 的 ARR 和用户规模及员工待遇安排,读者可以据此了解这起收购的实际内容。

7月11日7月11日周五

星期五 · 1 条
00:00
Moonshot AI:Kimi Blog精选
Kimi 发布 K2 模型

Kimi K2 采用混合专家(MoE)架构,拥有 320 亿激活参数和 1 万亿总参数,在非推理模型的前沿知识、数学和编程任务上达到 SOTA 性能。

另有 1 家信源报道Moonshot AI:Kimi Blog
推荐理由:月之暗面发布 Kimi K2,万亿参数 MoE 架构,多基准 SOTA

7月10日7月10日周四

星期四 · 1 条
00:00

7月1日7月1日周二

星期二 · 1 条
08:00
Factory 研究 / 产品(RSS)精选
AI 评分 70/100
Factory 提出 Agent Native Development:用自主智能体开发软件的方法论

Factory 发布 Agent Native Development 方法论,主张让 agent 运行收集上下文、规划、实现、验证、提交的完整内循环,人来负责架构决策和护栏。


推荐理由:Factory 提出的 Agent Native Development 方法论给出写精确规格、验证环境和 drift 恢复的可迁移做法,适合想系统化用 agent 写代码的开发者参考。

6月17日6月17日周二

星期二 · 1 条
09:33
Saining Xie@sainingxie精选
所以这不是一个针对软件工程智能体的基准测试。它旨在通过编程测试核心推理与智能--由一些顶尖竞技程序员撰写的 71 页深度分析作为支撑。So this is not a benchmark for software engineering agents. It’s meant to test core reasoning and intelligence through coding—backed by 71 pages of deep analysis from some of the best competitive programmers out there.This effort was carried out by students across multiple institutions (I’m mostly just a cheerleader here!) It was led by @ZihanZheng71803 (an undergrad who represented NYU in the ICPC World Finals), @wenhaocha1, and many of their Olympiad medalist friends. They built the live benchmark and offered expert analysis of how elite human coders compare to top LLMs. The results are now public: on the hard problems, LLMs essentially score 0%. They're good at implementation-heavy tasks that rely on memorization, but still struggle badly with observation-heavy or logic-heavy problems—those where the implementation is easy once you’ve had the critical "aha" insight. They also struggle with detail-oriented tasks—often getting the basics right but failing to account for edge cases.Some more thoughts on why this benchmark matters: I’ve always been surrounded by top competitive programmers. My undergrad program at SJTU is renowned for ICPC success and primarily admits students with a strong high school competitive programming background. While I’ve never won an olympiad medal myself, I deeply admire my peers who did—friends who trained for years as teens and competed at the highest international levels. One of them is my classmate and key collaborator on this project, Prof @shangjingbo, who earned ICPC world final gold for SJTU. For us, competitive programming was the ultimate badge of intelligence for CS students. Competitive programming emphasizes reasoning and problem solving under pressure, which differs from standard software engineering—but the skills carry over surprisingly well. That’s why so many startups love to show off their IOI gold medalists!Beating this benchmark would be like AlphaGo beating Lee Sedol. We're not at that level yet—not even for problems with clearly verifiable outcomes. And if you care about fundamental intelligence and reasoning, this result might be worth a close look.所以这不是一个针对软件工程智能体的基准测试。它旨在通过编程测试核心推理与智能--由一些顶尖竞技程序员撰写的 71 页深度分析作为支撑。

Zihan Zheng: We introduce LiveCodeBench Pro, a live, exceptionally challenging benchmark comprising competitive programming problems ...


推荐理由:o3与Gemini 2.5在IOI级竞赛题上零分,LLM推理天花板显现

6月12日6月12日周四

星期四 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 71/100
Cognition 撰文反对构建多智能体系统,提出上下文工程两条原则

Cognition 发文《Don't Build Multi-Agents》,提出上下文工程两条原则:共享完整 agent 轨迹的上下文,以及行动携带隐含决策、冲突决策导致糟糕结果。


推荐理由:Cognition 以自身 agent 构建经验提炼上下文工程两条原则,并解释为何多智能体架构在 2025 年仍然脆弱。

6月5日6月5日周四

星期四 · 1 条
00:00

5月15日5月15日周四

星期四 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 64/100
Devin 2.1 发布:任务置信评级、Linear/Jira 集成与内置代码库理解

Cognition 发布 Devin 2.1,新增 🟢🟡🔴 置信评级,置信分与任务成功率高度相关,🟢 得分任务的 PR 合并可能性是 🔴 的两倍。同时为 Linear 和 Jira 集成加入批量自动评分,可在不启动会话的情况下为多个 issue 打分;并内置 DeepWiki 同源的代码库理解能力,可用 !ask 提问,不确定计划时等待用户确认。


推荐理由:原文给出置信分与任务成功率的关联数据,以及按置信度筛选任务的用法,读者可据此改进 Devin 工作流。

5月6日5月6日周二

星期二 · 1 条
23:06

5月5日5月5日周一

星期一 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 74/100
Cognition 发布 DeepWiki,为任意 GitHub 仓库生成免费 AI 文档

Cognition 推出 DeepWiki,将 Devin Wiki 和 Devin Search 免费公开,把 URL 中的 github.com 换成 deepwiki.com 即可查看任意仓库的 AI 文档。已索引超过 50,000 个热门公开仓库,涵盖 Model Context Protocol、LangChain 等;公开仓库可免费添加,私有仓库需 Devin 账号。


推荐理由:原文给出了使用方式和已索引规模,读者可以据此判断如何用 DeepWiki 快速理解陌生代码仓库。

4月18日4月18日周五

星期五 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 77/100
Claude Code:智能体编码最佳实践指南

Claude Code 提供了一套完整的智能体编程工具与框架。其核心遵循“先探索、再计划、后编码”的工作流,并通过配置 CLAUDE.md 文件、管理权限和连接 MCP 服务器来优化环境。最佳实践强调为 Claude 提供工作验证方法、积极管理上下文、使用子代理进行调查,以及利用检查点回退来处理复杂任务。文档还详细介绍了在 VS Code、JetBrains IDE、Slack 及 CI/CD 中的集成使用,并提供了避免常见失败模式的实用建议。


推荐理由:Anthropic 官方出的 Claude Code 最佳实践,不是泛泛而谈的入门指南,而是从 CLAUDE.md 配置到 subagent 编排的完整工程手册,用 Claude Code 做日常开发的人直接照抄就能少踩一半坑。

4月3日4月3日周四

星期四 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 67/100
Cognition 发布 Devin 2.0,推出 Agent 原生 IDE 并新增 $20 起的灵活方案

Cognition 发布 Devin 2.0,带来 Agent 原生 IDE 体验和 $20 起的新方案。用户可并行运行多个 Devin,各自配备云端 IDE,可在 IDE 内用 Cmd+I、Cmd+K 等快捷键审查和修改 Devin 的代码。


推荐理由:官方公告列出新 IDE 体验、三项新功能和 $20 起的新定价,读者可据此评估 Devin 在编码工作流中的可用性变化。

3月24日3月24日周一

星期一 · 1 条
00:00
DeepSeek:API 更新日志精选
AI 评分 72/100
DeepSeek 将 deepseek-chat 升级为 DeepSeek-V3-0324

DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V3-0324,推理能力增强,MMLU-Pro 升至 81.2,AIME 升至 59.4。同时优化了 Web 前端开发、中文写作(对齐 R1 风格)、中文搜索及 Function Calling 准确率,并修复了此前问题。


推荐理由:这是 DeepSeek V3 发布后的一次重要版本更新,推理和代码能力提升显著,AIME 提升近 20 分,前端和中文写作体验优化,API 用户应该尽快切换。

2月13日2月13日周四

星期四 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 64/100
Linktree 复盘用 Devin 一个月写约 300 个 PR 的实践经验

Linktree 团队分享使用 Cognition 的 AI 智能体 Devin 一个月的成果:Devin 完成约 300 个 PR,其中约 100 个已合并,主要是修复客户报告的 bug、实现小功能和原型验证。


推荐理由:Linktree 官方复盘 Devin 落地细节,给出任务筛选标准、多 Devin 协作和 API 用法等可直接迁移的经验。