跳到正文

技术方向

AI 编码 最新动态

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

787 条精选近 30 天 107 条共收录 5,028 条

更新

精选归档 · 第 40 页

5月12日周日第 781–787 条
  1. Eugene Yan:Writing82

    Applied LLMs:一年 LLM 应用开发的经验总结

    Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。

    推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

3月15日周五
  1. Cognition 模型 / Devin 博客68

    Cognition 发布 Devin 的 SWE-bench 技术报告

    Cognition 发布 Devin 在 SWE-bench 上的技术报告,Devin 在随机抽取的 570 个测试集中解决 79 个问题,成功率 13.86%,高于此前最强的辅助设定基线 Claude 2 的 4.80% 和无辅助设定的 1.96%。

    推荐理由:Cognition 公开了评测方法和 Devin 的代码编辑结果,读者可以对照复现并理解智能体在真实仓库上解题的边界。

3月12日周二
  1. Cognition 模型 / Devin 博客68

    Cognition 发布 AI 软件工程师 Devin,SWE-bench 端到端解决 13.86% 问题

    Cognition 发布 AI 软件工程师 Devin,可规划并执行需要数千次决策的复杂工程任务,配备 shell、代码编辑器和浏览器等沙盒开发环境,并能实时汇报进度、接受反馈与用户协作。

    推荐理由:官方宣布 Devin 并给出 SWE-bench 13.86% 的成绩与具体能力示例,读者可据此评估智能体在真实工程任务中的可用性。

12月27日周三
  1. Andrej Karpathy:Blog

    Licklider 1960《人机共生》评述

    Licklider 1960年论文《人机共生》提出"智能增强"(IA)是通向AI的过渡阶段,预测人机能力互补——计算机处理机械工作、人类负责思考,这一范式延续64年直至LLM打破界限。他预见云计算雏形,但误判技术路径:当时看好的逻辑推理AI成死胡同,而因缺乏数据被忽视的统计方法(LLM)终成主流。对交互预测也偏离现实:设想的多人协作大屏未普及,键盘鼠标仍是主导;对语音识别"5年实现"的乐观估计,实际耗时64年未成熟。

    推荐理由:Karpathy 借 1960 年文献反思人机共生与 AI 发展路径,历史洞察深刻

12月8日周五
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 发布 AutoTranslateDoc 命令行工具,用 GPT 模型自动翻译技术文档

    LlamaIndex 发布 AutoTranslateDoc,一款命令行工具,可从 GitHub 仓库抓取 .md 和 .mdx 文档,用 GPT-3.5、GPT-4 分块翻译并自动校验后合并输出。

    推荐理由:工具通过分块翻译加多重校验来保证文档翻译质量,并支持差量更新,适合需要维护多语言文档的开发者参考。

8月10日周二
7月7日周三