Topic · 主题全部主题 →

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

5,049条收录
580条精选

精选归档 · 第 4 页

6180 条 · 共 580

8月8日

星期六 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Ouroboros:具备评审式核心进化的自开发前沿编程智能体

Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。


推荐理由:相比固定提示词的智能体,Ouroboros通过自我进化持续优化工具和上下文,在多个基准上达到最高分,161天实验展示了长期部署的可行性。

8月7日

星期五 · 1 条
03:53
GitHub Blog精选
AI 评分 69/100
GitHub Copilot 应用中的斜杠命令使用指南

GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。


推荐理由:文章不是罗列命令,而是提供了可复用的场景模板,为 /plan、/spar 等命令配好了规划、评审和实现的具体提示词,省去从零组织任务描述的时间。

8月6日

星期四 · 1 条
09:39
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
Prime Agent:一个具有自我改进能力的RLM代理

Prime Agent 是一个自我改进的编码代理,围绕递归语言模型(RLM)和持续框架(Continual Harness)两大抽象构建,将上下文视为变量、子代理委派视为 REPL 内的函数调用,并允许代理对其提示词、技能、记忆和子代理进行 CRUD 操作。它完全开源,可通过 curl 命令安装,支持与前沿模型即时使用,并具备后台守护进程、会话恢复、分支分叉和异步内核压缩等特性。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:不同于固定工具调用模式,Prime Agent 将上下文视为可编程变量并允许智能体自行改进技能和记忆,为长程自主任务提供了新的基准方案。

8月5日

星期三 · 2 条
18:01
公众号:卡尔的AI沃茨精选
AI 评分 74/100
烧了5亿token后,我给Codex和Claude Code做Skill上下文瘦身的新技巧

作者为Codex和Claude Code中300多个Skill做上下文瘦身,发现每次新会话仅Skill列表就占约9.9k token,按7月使用强度粗算,多余Skill列表约吃掉4到5亿token的上下文空间。


推荐理由:把低频 Skill 从全局暴露转为触发词动态加载,提供了工具多而上下文有限时的一种治理思路,量化了 token 节省,方法可迁移到其他 Agent 管理。

8月3日

星期一 · 1 条
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

8月2日

星期日 · 1 条
19:00
AYi@AYi_AInotes精选
AI 评分 75/100
Codex 用 Sol 指挥 Luna Max 省额度翻倍产出刚发的Codex Luna Max省钱tip,现在有进阶版了——而且是让Sol自己帮你配好,现在Codex圈中高阶玩家都在用。思路很简单:别让Sol什么都自己干,Sol很贵,额度烧得快,但它规划和审核确实强。Luna Max便宜,写代码改文件跑测试这些有明确边界的体力活,它干得跟Sol差不了太多。所以最佳模式是:Sol当包工头,Luna Max当工人。具体怎么搞,让Sol自己帮你弄,你就跟它说:在~/.codex/agents/下创建一个luna-worker.toml,模型设gpt-5.6-luna,reasoning effort设max,写好描述和指令,专门用来处理有明确边界的委托任务。创建完验证配置,给我看diff。Sol会自己把这个子代理配好 之后你干活的时候,Sol负责拆任务、做架构决策、审代码,具体的实现、改bug、跑测试、重构,它会自动delegate给luna_worker去跑。主线程的Sol额度省下来只花在刀刃上,体力活全让便宜的Luna Max扛,同一个订阅,产出量直接翻倍。还有个更懒的办法:不建配置文件,直接告诉Sol,遇到需要批量执行的子任务,自己spawn独立的Luna Max对话线程去跑,跑完把结果汇总回来。效果差不多,就是没那么结构化。去看DeepSWE那个榜就懂了,gpt-5.6-luna max的分数跟Sol Medium咬得很近,但成本差了一个数量级。Sol指挥+Luna Max干活,等于用一个Sol的钱,同时跑好几个工人。别再拿Sol当苦力使了,让它当老板才是正确的打开方式:#Codex #OpenAI #AI编程Codex 高阶玩法:让 Sol 在 ~/.codex/agents/ 下创建 luna-worker.toml 子代理,模型设 gpt-5.6-luna、reasoning effort 设 max,Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max。

AYi: 刚发现一个OpenAI订阅的隐藏用法,感觉像白捡的。 GPT-5.6不是分三档吗——Sol最强最贵,Terra中间,Luna最便宜最快。大部分人默认选Sol,觉得贵的就是好的。 但现在一堆重度用户测出来一个组合:Luna + Max rea...


推荐理由:把 Sol 定位为「包工头」而非全栈苦力,用配置实现任务委托,给出了一个可复用的省额度方案,但长期可靠性待真实验证。

7月31日

星期五 · 2 条
01:51
GitHub Blog精选
AI 评分 65/100
GitHub Copilot 应用新增堆叠会话与拉取请求功能

GitHub Copilot 应用推出堆叠会话功能,允许用户在同一个仓库中创建一系列相互承接的任务,每个会话可基于前一个会话的成果继续工作。作者通过一个十余年历史的个人项目演示了该功能:先使用 Plan 模式制定前端现代化计划,再通过堆叠会话将 React-Bootstrap 替换工作拆分为独立会话,并自动为每个会话创建对应的拉取请求,避免范围蔓延。


推荐理由:GitHub Copilot 的堆叠会话让多步骤 PR 拆分成链,Cassidy 用十年老项目演示如何避免巨型改动,对 Copilot 用户是可直接套用的实操指南。
00:00
DeepSeek:API 更新日志精选
AI 评分 72/100
DeepSeek-V4-Flash 正式版 API 上线公测

DeepSeek-V4-Flash 正式版 API 上线公测,模型名设为 deepseek-v4-flash 即可使用,调用方式不变。其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。

另有 9 家信源报道X:Elvis Saravia (@omarsar0, DAIR.AI)公众号:卡尔的AI沃茨X:DeepSeek (@deepseek_ai)X:阿易 AI Notes (@AYi_AInotes)公众号:数字生命卡兹克X:Kim (@kimmonismus)X:Emad Mostaque (@EMostaque)X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)
推荐理由:DeepSeek V4-Flash 正式版 Agent 能力大幅跃升,多个编码 agent 基准分数翻倍,对做代码助手的团队是个高性价比的生产力入口。虽然是 Flash 版,但后训练打磨的成果让人更期待 Pro 正式版。

7月30日

星期四 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
删除回避:LLM 代码编辑中的系统性缺陷与缓解之道

研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。


推荐理由:这项研究将代码AI补丁的可维护性痛点归结为一种系统性偏差,其基准和训练方法为团队在实际采纳前评估模型提供了更具体的指标。

7月29日

星期三 · 2 条
12:00
公众号:数字生命卡兹克精选
AI 评分 63/100
我的Claude账号被封了

Anthropic因支付系统SEPA验证漏洞引发“零元购”事件,随后大规模回收漏洞账号并封禁关联账户,作者自用半年多的账号于7月29日被封。作者认为当前已非Claude一家独大,推荐编程用户使用Kimi K3和GPT-5.6 Sol,办公用户选择WorkBuddy+Kimi K3,并指出国产模型已凭二十分之一算力摸到第一梯队。


推荐理由:卡兹克被封号后的心态转变是个标志性信号,Claude的护城河正在消失,他的替代方案很务实,尤其GPT-5.6 Sol写作和Kimi K3编码的组合,做开发的朋友可以直接抄作业。

7月28日

星期二 · 4 条
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 66/100
AI Harness 对性能的影响超过模型本身:GPT-5.5 与 Opus 4.7 在第三方工具中得分更高

Endor Labs 测试显示,同一模型在不同 harness 中性能差异巨大:GPT-5.5 在 Cursor 中功能正确率 87.2%,远超其在 Codex 原生环境中的 61.5%;Opus 4.7 在 Cursor 中得分 91.1%,高于 Claude Code 的 87.2%。Harness 决定发送的上下文与缓存策略,智能缓存可节省 40-80% 成本并提速 13-31%。


推荐理由:作者引用同一模型在不同 harness 下的分数差与缓存研究,说明 harness 而非模型决定成本和表现,读者可借此审视自己的工具链选择。
03:50
GitHub Blog精选
AI 评分 74/100
GitHub Copilot 发布"Harness"工作流:用单一工具完成原型、规划、实现与代码审查

GitHub Copilot 推出“Harness”工作流,让开发者通过单一 AI 工具完成从原型设计、规划、实现到代码审查的完整软件开发流程,无需追逐多种新 AI 工具。该工作流强调实用性与集成性,旨在减少工具切换带来的效率损耗。


推荐理由:GitHub Copilot 官方出的实用工作流,不追新工具,把现有功能用透,用 Copilot 的开发者直接能套的「内功心得」。
02:27
MarkTechPost(RSS)精选
AI 评分 72/100
用Claude和Python构建技能驱动的金融分析智能体

本教程基于Anthropic的financial-services仓库,用纯Python复现其技能驱动架构。通过解析SKILL.md文件构建可搜索技能注册表,并创建可复用SkillAgent,将金融分析剧本注入Anthropic Messages API,支持迭代工具调用循环。


推荐理由:这个教程把手教你将 Anthropic 的金融技能库打包成可运行的 Python 代理,不是概念演示而是完整工作流,做金融 AI 落地的可以直接抄。
00:50
GitHub Blog精选
AI 评分 68/100
GitHub Copilot app 入门指南:多 Agent 会话工作区与 Canvas 预览

GitHub Copilot app 将 AI 编码工具升级为多 Agent 会话工作区,支持同时管理多个任务线程而不丢失进度。用户可为每个会话绑定项目上下文,通过 /create-canvas 命令在浏览器 Canvas 中预览 UI 并直接点选修改,还能启用 Agent Merge 自动处理 PR 审查反馈和合并冲突。


推荐理由:GitHub Copilot 应用把 AI 编程拆成多会话、画布和 Agent Merge,让 '一键修 bug' 变成真·项目管理流,Copilot 用户该上手试试。

7月27日

星期一 · 1 条
15:51
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 64/100
当编码不再是瓶颈:Berkeley RDI 提出软件自主开发三级框架

Berkeley RDI等机构提出三级软件自主开发框架:代码自主(AI完成设计与实现,人类决定构建内容并审核PR)、流水线自主(AI运行从设计到部署的全流程,人类仅评估结果)、需求自主(AI自主决定构建内容)。该框架旨在为能力声明、部署选择与问责提供清晰分类。


推荐理由:Berkeley团队提出软件自主开发三层框架,把模糊的“自主编程”拆成清晰阶梯,关键不在能力而在责任转移,开发团队该看看自己到了哪一级。

7月25日

星期六 · 1 条
11:08