Topic · 主题全部主题 →

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

5,049条收录
580条精选

精选归档 · 第 2 页

2140 条 · 共 580

9月3日

星期四 · 2 条
02:25
Cursor Blog精选
AI 评分 67/100
Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。


推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
01:01
Claude:Blog(网页)精选
AI 评分 78/100
Anthropic 发布 Claude 电商智能体构建指南及参考实现

Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

另有 1 家信源报道Claude:Blog(网页)
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

9月2日

星期三 · 8 条
23:58
Google DeepMind:Blog(RSS)精选
AI 评分 78/100
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。

另有 19 家信源报道X:fofr (@fofrAI)Ars Technica:AI(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)MarkTechPost(RSS)X:Google DeepMind (@GoogleDeepMind)The Decoder:AI News(RSS)IT之家(RSS)X:Artificial Analysis (@ArtificialAnlys)X:Ammaar Reshi (@ammaar)X:Gemini (@GeminiApp)X:Logan Kilpatrick (@OfficialLoganK)X:Sundar Pichai (@sundarpichai)X:Testing Catalog (@testingcatalog)X:Josh Woodward (@joshwoodward, Google Labs VP)X:Demis Hassabis (@demishassabis)X:OpenRouter (@OpenRouter)X:Rohan Paul (@rohanpaul_ai)X:Google AI (@GoogleAI)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
23:48
Google AI:DEV 作者专属(RSS)精选
AI 评分 69/100
什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环

Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。


推荐理由:原文解释了 harness 工程的构成要素,并给出可运行的沙箱与修复循环示例代码,方法可直接迁移到自己的 Agent 工作流。
12:05
Meituan LongCat@Meituan_LongCat精选
AI 评分 67/100
美团 LongCat-2.0 上线 Cline 免费试用LongCat-2.0 is now free to try in @cline ! 🐱LongCat-2.0 现已在 @cline 中免费试用!🐱 【引用 @cline】:LongCat-2.0 目前在 Cline 中免费使用。 这是一款来自 @Meituan_LongCat 的 1.6T 开源权重 MoE 模型,拥有 1M 上下文,得分与 Claude Opus 4.7 和 Gemini 3.1 Pro 相近。 立即尝试:npm i -g cline /model 在免费模型下选择 LongCat-2.0

Cline: LongCat-2.0 现在在 Cline 中免费开放使用。 这是一款 1.6T 参数的开源权重 MoE 模型,拥有 1M 上下文窗口,来自 @Meituan_LongCat,得分与 Claude Opus 4.7 和 Gemini 3.1...


推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。
11:40
公众号:数字生命卡兹克精选
AI 评分 65/100
UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验

UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。


推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。
10:07
Qwen@Alibaba_Qwen精选
AI 评分 68/100
Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿🏆 #1 overall on Code Arena, and top of the Pareto frontier at $5/MToken. Thanks! @arena Give Qwen3.8-Max-0902 a spin on QwenCloud.🥳通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。

Arena.ai: Qwen3.8-Max-0902 由 @Alibaba_Qwen 发布,刚刚在 Code Arena: WebDev 中以 1,691 分的成绩登顶总榜第一,并以混合 $5/MToken 的价格成为 Pareto 前沿上得分最高的模型! 在...

另有 5 家信源报道IT之家(RSS)X:Kim (@kimmonismus)X:通义千问 / Qwen (@Alibaba_Qwen)X:阿易 AI Notes (@AYi_AInotes)X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。
02:29
Anthropic:Newsroom(网页)精选
AI 评分 87/100
Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。

另有 4 家信源报道The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)IT之家(RSS)
推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。
02:29
Claude Platform:开发者版本说明(RSS)精选
AI 评分 72/100
Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。

另有 11 家信源报道X:Thariq (@trq212)Hacker News 热门(buzzing.cc 中文翻译)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:Testing Catalog (@testingcatalog)X:小北 (@frxiaobei)The Decoder:AI News(RSS)MarkTechPost(RSS)TechCrunch:AI(RSS)The Verge:AI(RSS)IT之家(RSS)
推荐理由:官方版本说明给出定价、缓存和 API 兼容性变化,开发者可据此评估迁移成本与新特性用法。
02:18
ClaudeDevs@ClaudeDevs精选
AI 评分 55/100
Claude Fable 5.1 上线 Claude Code 与 Claude Platform,缓存读取降价 75%Fable 5.1 is now live in Claude Code and the Claude Platform.It's priced the same as Fable 5, with 75% cheaper API cache reads. It gets a lot further into a long task before it needs your input, is better at telling you when it's stuck, and its writing style is more natural.Claude Fable 5.1 现已上线 Claude Code 和 Claude Platform,定价与 Fable 5 相同,API 缓存读取便宜 75%。模型在长任务中能更久自主推进、更善于提示用户它已卡住,写作风格也更自然。Anthropic 同时发布了 Claude Fable 5.1 和 Claude Mythos 5.1,称其为编码与知识工作领域最先进的模型。

Claude: We’re introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world’s most advanced models for coding and knowle...

另有 13 家信源报道X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)The Verge:AI(RSS)IT之家(RSS)X:OpenRouter (@OpenRouter)X:Kim (@kimmonismus)X:Thariq (@trq212)Hacker News 热门(buzzing.cc 中文翻译)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:小北 (@frxiaobei)The Decoder:AI News(RSS)TechCrunch:AI(RSS)
推荐理由:原文给出 Fable 5.1 的定价变化与长任务、卡点提示、写作风格上的改进,读者可对照现有工作流评估是否切换。

8月30日

星期日 · 1 条
09:44
AYi@AYi_AInotes精选
AI 评分 76/100
Uber 用 Agent 接管 70% 代码 PR,AI 账单零增长当很多公司都在哀嚎 AI 账单贵到用不起,Uber 刚发的这篇技术长文直接把全行业看傻了: 全公司 70% 的代码 PR 全由 Agent 接管,调用量半年狂飙近 10 倍, 但总 AI 账单被死死按在原地一分没涨,单次会话成本硬生生砍掉了 52%, 他们直接把软件工程做成了一座全自动的软件工厂,真的牛逼,以前是人打开聊天框求 AI 帮一把, 现在 Uber 养了一整支托管 Agent 舰队: 审代码、修挂掉的 CI、分诊报警全是专职 AI 自动上班, 人变成了抽查质检的厂长,每天跑 3 万多次流水线任务他们最狠的地方,是把 AI 账单拆成了一道极其冷酷的乘法题, 用量可以疯涨,但零价值的废 Token 必须被物理抹杀:1️⃣ 规划用大脑,干活全用便宜子 Agent: 任务拆解用顶级大模型,具体搬砖的子任务全部默认切给轻量模型,这一招直接成了全厂杠杆最高的开关;2️⃣ 把 5 分钟缓存改成 1 小时: 工程师去倒杯水开个会回来,上下文缓存依然在,原价 1 折直接续上,40 万 token 强制写摘要压缩,绝不把整本历史无限复印;3️⃣ 别把一千种工具说明书塞进大脑: 1000 多个内部 MCP 工具统一走网关,模型要用时先搜索再按需挂载,绝不在开局就傻傻灌入 7 万 token 的工具定义;4️⃣ Code-mode 砍掉话痨轮询: 跑 SQL 和批处理让模型自己写脚本去跑,只交回最终结果,避免一问一答的无效 ping-pong,单项 token 直接暴省 90%;5️⃣ 2400 万节点知识图谱导航: 给 Agent 发一张包含全公司服务和事故的活地图,以前翻代码盲搜 20 分钟还报错,现在 38 秒精准定位用量涨不可怕,浪费涨才可怕, 从人机对话迈向托管工厂舰队,大厂把 AI 真正落地的账本,算是彻底算明白了Uber 技术长文显示,全公司 70% 的代码 PR 已由 AI Agent 接管,调用量半年增长近 10 倍,但总 AI 账单未涨,单次会话成本降低 52%。

Uber Engineering: https://x.com/i/article/2090828118454071296


推荐理由:原文拆解了Uber在Agent用量增长下压住账单的具体做法,读者可以对照检查自己团队的Token浪费点。

8月29日

星期六 · 3 条
13:26
IT之家(RSS)精选
AI 评分 72/100
智谱开源 GLM-5.3 模型权重,主打智能体编程与网络防御

智谱宣布开源 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查。


推荐理由:许可条款把强制安全审查限定在百亿美元级外部模型服务,自有部署和中小团队实际不受影响,开源可用性比表面限制更宽。
10:07
Tibo@thsottiaux精选
AI 评分 69/100
OpenAI 终止与 Cursor 合作,11 月 12 日生效We unfortunately have decided that we cannot continue providing access to our models through Cursor and are ending our partnership. It boils down to trust and we’ve asked that this takes effect on November 12 to give you some time to plan.Many have used the GPT models through Cursor and here are options we know should work in the future:• We will continue to allow using your own OpenAI API key and similarly will continue to provide access through our IDE extensions for Cursor. • We will keep working with the broadest range of tools and harnesses, some of which are OSS, but also many many closed-source ones.We are as committed as ever to continue supporting developers and the flourishing ecosystem of tools, harnesses and products. We will also continue to invest in our own open-source initiatives and believe in broad optionality for developers.You can read more about our decision in the blog: https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/OpenAI 因 SpaceX 收购 Cursor 后信任问题,决定终止向其提供模型访问,合作于 11 月 12 日结束。开发者仍可通过自有 OpenAI API 密钥及 IDE 扩展继续使用 GPT 模型。OpenAI 表示将继续支持广泛的工具生态与开源计划。

OpenAI: 我们正在终止与 Cursor 的合作关系,原因是其被 SpaceX 收购。根据我们的提议,Cursor 对我们模型的直接访问权限将于 11 月 12 日结束。 我们知道,受此决定影响最大的是那些在 Cursor 中依赖 OpenAI 模型的...

另有 9 家信源报道X:Kim (@kimmonismus)X:OpenAI (@OpenAI)The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)X:Yuchen Jin (@Yuchenj_UW)X:小北 (@frxiaobei)
推荐理由:终止合作把信任作为前提,依赖 Cursor 内嵌 OpenAI 模型的团队将需要在 11 月 12 日前重新确认编码工作流的模型访问路径。
09:56
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 69/100
OpenAI 决定终止向 Cursor 提供模型,因 SpaceX 收购后合规风险

OpenAI 已通知 SpaceX,将终止向 Cursor 提供 OpenAI 模型的合同,拟定关停日期为 2026 年 11 月 12 日,并给予合同允许的最长通知期。OpenAI 称此举源于无法确信 SpaceX 会遵守服务条款,并援引马斯克旗下公司此前违反合同及 xAI 违反 OpenAI 服务条款的先例。OpenAI 表示将尽力支持受影响的开发者过渡。

另有 6 家信源报道X:Kim (@kimmonismus)X:OpenAI (@OpenAI)X:阿易 AI Notes (@AYi_AInotes)The Decoder:AI News(RSS)IT之家(RSS)X:Yuchen Jin (@Yuchenj_UW)
推荐理由:OpenAI 把合同终止与收购后的控制权变更挂钩,11 月 12 日的关闭日期将直接改变 Cursor 开发者对模型替代和迁移窗口的规划。

8月25日

星期二 · 1 条
04:04
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 59/100
GPT-5.6 登陆 Kiro,为开发者提升性价比

GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,旨在以更少迭代和更高 token 价值帮助开发者产出更高质量的代码。


推荐理由:在 Terminal-Bench 2.1 上,GPT‑5.6 Terra 在 Kiro 中完成任务的成本约下降 82%,为长周期编码任务的投入产出评估提供了一个量化基准。

8月21日

星期五 · 1 条
22:28
Claude:Blog(网页)精选
AI 评分 73/100
AI 原生 SDLC 实战手册:Anthropic 如何用 Claude 重塑软件开发生命周期

Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。


推荐理由:把各阶段产物固化为可版本化 markdown 并让下一阶段读取,人工审查就从逐行看代码转向在关卡看代理标记,对改造研发流程的团队有直接参考价值。

8月20日

星期四 · 1 条
21:26
Claude:Blog(网页)精选
AI 评分 65/100
Claude Code 初创公司指南:五大规则与创始人洞见

Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出“人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化”五大规则。


推荐理由:指南把十几家创业公司实践归纳为五个可操作规则,其中「修复原则而非修复个案」对搭建自改进 agent 流程具有直接参考价值。

8月19日

星期三 · 2 条
22:17
公众号:百度智能云(文心)精选
AI 评分 64/100
百度千帆上架GLM-5.3

百度千帆今日上架智谱开源旗舰模型GLM-5.3,API定价与智谱官方保持一致。该模型与上代同架构、同参数,依靠后训练Scaling在代码与网络安全能力上表现超预期,AA综合智能指数取得60分,与Kimi K3并列开源模型第一。开发者可通过API调用或订阅Token Plan企业版接入Claude Code等AI工具使用。


推荐理由:GLM-5.3 与上代同参数却靠后训练 Scaling 进入前沿,单任务成本又是同档最低,这让原本受调用成本限制的长链路智能体和编码任务有了开源可选项。
09:11
公众号:智谱(GLM)精选
AI 评分 79/100
GLM-5.3上线:AA智能指数60分并列开源第一,成本更低

GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。

另有 5 家信源报道X:X.PIN (@thexpin)The Decoder:AI News(RSS)IT之家(RSS)X:Artificial Analysis (@ArtificialAnlys)X:智谱 Z.ai (@Zai_org)
推荐理由:GLM-5.3 把前沿智能的单任务成本压到同档最低,模型选型时成本与智能可以放在同一优先级比较,而不必默认高价闭源旗舰。