跳到正文

内容形态

教程实践 最新动态

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

486 条精选近 30 天 66 条共收录 2,567 条

更新

精选归档 · 第 24 页

4月18日周五第 461–480 条
  1. Anthropic:Engineering77

    Claude Code:智能体编码最佳实践指南

    Claude Code 提供了一套完整的智能体编程工具与框架。其核心遵循“先探索、再计划、后编码”的工作流,并通过配置 CLAUDE.md 文件、管理权限和连接 MCP 服务器来优化环境。最佳实践强调为 Claude 提供工作验证方法、积极管理上下文、使用子代理进行调查,以及利用检查点回退来处理复杂任务。文档还详细介绍了在 VS Code、JetBrains IDE、Slack 及 CI/CD 中的集成使用,并提供了避免常见失败模式的实用建议。

    推荐理由:Anthropic 官方出的 Claude Code 最佳实践,不是泛泛而谈的入门指南,而是从 CLAUDE.md 配置到 subagent 编排的完整工程手册,用 Claude Code 做日常开发的人直接照抄就能少踩一半坑。

3月26日周三
3月20日周四
  1. Anthropic:Engineering71

    “思考”工具:让Claude在复杂工具使用场景中停下来思考

    Anthropic为Claude引入了“思考”工具,允许其在生成最终响应前插入一个专门的思考步骤,以处理多步骤工具调用链、分析外部信息并遵循复杂策略。该工具与更早发布的“扩展思考”功能不同,更侧重于在响应生成过程中对新信息进行针对性推理。在τ-Bench基准测试中,该工具显著提升了Claude在客户服务场景的表现。文章建议在需要复杂工具调用、长链分析或高成本序列决策的场景中使用它,并提供了标准的工具实现格式。

    推荐理由:Anthropic 官方给出的 think tool 实操指南,附带 τ-Bench 和 SWE-bench 的真实数据,做 Agent 或 tool use 的开发者可以直接抄 prompt 模板,比自己瞎试强太多。

2月13日周四
  1. Cognition 模型 / Devin 博客64

    Linktree 复盘用 Devin 一个月写约 300 个 PR 的实践经验

    Linktree 团队分享使用 Cognition 的 AI 智能体 Devin 一个月的成果:Devin 完成约 300 个 PR,其中约 100 个已合并,主要是修复客户报告的 bug、实现小功能和原型验证。

    推荐理由:Linktree 官方复盘 Devin 落地细节,给出任务筛选标准、多 Devin 协作和 API 用法等可直接迁移的经验。

1月6日周一
  1. Anthropic:Engineering72

    Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中刷新纪录

    升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。

    推荐理由:Anthropic 把自家 SWE-bench agent 的 prompt、工具设计和踩坑经验全公开了,做 coding agent 的人可以直接抄作业,比看十篇二手解读都管用。

12月19日周四
  1. Anthropic:Engineering80

    构建高效智能体:从简单模式开始

    Anthropic基于实践经验指出,成功的LLM智能体往往采用简单、可组合的模式,而非复杂框架。文章区分了工作流(预定义路径编排)与智能体(LLM动态自主决策),建议开发者优先采用最简单方案,仅在必要时增加复杂性。许多核心模式直接调用LLM API仅需几行代码即可实现。文中介绍了增强型LLM、提示链等基础构建模块,强调应为特定用例定制检索、工具等增强功能,并推荐通过Model Context Protocol集成第三方工具生态。

    推荐理由:Anthropic 官方把过去一年踩过的坑浓缩成一篇 Agent 架构指南,核心观点是「别上框架,先用最简单的模式」。做 Agent 产品的开发者,这篇比任何第三方教程都值得当 checklist 用。

9月19日周四
  1. Anthropic:Engineering72

    引入上下文检索:大幅提升RAG系统准确性的新方法

    传统RAG系统在编码时易丢失上下文,导致检索失败。新方法“上下文检索”通过“上下文嵌入”和“上下文BM25”两项子技术,在检索前为文本块添加解释性上下文,能将检索失败次数减少49%,结合重排序后降幅可达67%,显著提升了下游任务性能。对于小于20万token的小型知识库,可直接将其完整内容放入提示词,结合Claude的提示词缓存功能,能降低超过2倍的延迟和高达90%的成本。对于大型知识库,上下文检索则提供了可扩展的解决方案。

    推荐理由:Anthropic 把 RAG 检索失败率砍了 67%,方法不复杂但数据扎实,做知识库的开发者可以直接抄 cookbook 上手,是那种读完当天就能改进生产环境的实用帖。

9月12日周四
  1. Cognition 模型 / Devin 博客60

    Cognition 评测 OpenAI o1 系列在 Devin 编码智能体上的表现并公开评测方法

    Cognition 公布在 Devin 中测试 o1-mini 和 o1-preview 数周的早期结果:在内部基准 cognition-golden 上,Devin-Base 从 GPT-4o 的 25.9% 提升到 o1-mini 的 34.6%、o1-preview 的 51.8%,生产版 Devin 达 74.2%。

    推荐理由:Cognition 作为 Devin 开发方给出 o1 系列的实测对比数据,并完整披露其内部基准 cognition-golden 的评测方法。

6月12日周三
  1. Suno:Blog55

    Audio Inputs——通过 Mikey Shulman(联合创始人兼 CEO)发布·2024 年 6 月 12 日,用任何声音创作一首歌 产品更新

    Suno 发布 Audio Inputs 功能,所有 Pro 和 Premier 用户可上传或录制 6-60 秒的音频片段,通过“Extend”模式选择起始时间戳、设定风格,并可添加歌词来创作歌曲。社区创作者已用其提供自定义音频引子来设定氛围、节奏和乐器灵感。该功能会阻止受版权保护作品的上传,且所有包含人声的输入将保持私密并不可搜索。

    推荐理由:Suno 把上传录音做歌的门槛降到极低,对音乐创作者和普通用户都友好,只是这已经是前年的更新,之后的同类功能可能更完善。

6月11日周二
  1. LlamaIndex:产品、工程与评测60

    LlamaIndex 教程:自定义属性图谱索引以提升 GraphRAG 准确率

    Neo4j 客座教程讲解如何在 LlamaIndex 中自定义属性图谱索引,用 SchemaLLMPathExtractor 做模式引导抽取、用文本嵌入加编辑距离做实体去重,并实现先识别查询实体再分别执行 VectorContextRetriever 的自定义检索器。示例使用 250 篇新闻文章和 Neo4j 图存储,最后用自定义检索器完成问答回流,代码托管在 GitHub。

    推荐理由:原文给出图谱构建、实体去重和自定义检索的完整可复现代码,读者可以迁移到自己的 GraphRAG 项目。

5月14日周二
  1. LlamaIndex:产品、工程与评测62

    用 LlamaIndex 和 llamafile 搭建本地私有研究助手

    LlamaIndex 发布 Mozilla 客座教程,讲解用 llamafile 在笔记本上本地运行 LLM,并以 TinyLlama-1.1B 作为 LLM 与嵌入后端,结合 Wikipedia 页面与私有文档构建完全本地运行的 RAG 研究助手。

    推荐理由:教程给出从下载运行 llamafile 到用 LlamaIndex 搭建本地 RAG 研究助手的完整代码路径,可迁移到其他主题。

5月12日周日
  1. Eugene Yan:Writing82

    Applied LLMs:一年 LLM 应用开发的经验总结

    Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。

    推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

1月30日周二
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 讲解 Agentic RAG:用多文档 Agent 构建可扩展的 RAG 架构

    LlamaIndex 博客介绍 Agentic RAG 架构:将最多 100 篇文档拆分后,为每篇文档创建具备嵌入搜索与摘要能力的文档 Agent,再由顶层 meta-agent 通过工具检索和 CoT 回答用户问题,并用 Rerank 端点对文档按相关性排序。

    推荐理由:原文拆解了多文档 Agent 与顶层 meta-agent 的编排结构,并给出可运行的 Colab 示例,读者可据此理解 Agentic RAG 的扩展方式。

1月25日周四
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 教程:用 LlamaIndex、Qdrant 和 Render 构建可学习的 Slack 机器人

    LlamaIndex 发布分步教程,教读者用 LlamaIndex、Qdrant 和 Render 构建并部署一个监听 Slack 对话、存储事实并回答问题的 Slackbot。

    推荐理由:LlamaIndex 官方教程从零搭建一个能监听 Slack 消息、用向量索引存储记忆并用 Qdrant 持久化的机器人,步骤完整可复现。

12月21日周四
  1. LlamaIndex:产品、工程与评测71

    LlamaIndex 教程:用 Ollama 本地运行 Mixtral 8x7b 并构建 RAG 应用

    LlamaIndex 发布教程,讲解如何用 Ollama 在本地运行 Mixtral 8x7b 并结合 LlamaIndex 使用。Mixtral 是 Mistral AI 发布的八专家混合模型,各含 7B 参数,博客称其在多项基准上匹敌或超过 GPT-3.5 和 Llama2 70b。

    推荐理由:原文提供从安装到建 API 的完整本地 Mixtral 流程,含代码和硬件要求,读者可以直接照做搭建本地 RAG。

11月6日周一
  1. LlamaIndex:产品、工程与评测71

    LlamaIndex 集成 LongLLMLingua:用提示词压缩缓解 RAG 的 Lost in the Middle 并降本

    LlamaIndex 介绍如何在 RAG 中使用 LongLLMLingua,通过问题感知的粗粒度重排、细粒度提示词压缩和子序列恢复来增强 LLM 对关键信息的感知。

    推荐理由:原文拆解了 LongLLMLingua 的粗细粒度压缩与重排细节,并给出在 LlamaIndex 中作为 NodePostprocessor 的用法,可迁移到自己的 RAG 成本优化。

11月3日周五
  1. LlamaIndex:产品、工程与评测64

    LlamaIndex 评测:如何为 RAG 挑选最佳 Embedding 与 Reranker 模型组合

    LlamaIndex 用其 Retrieval Evaluation 模块,以 Hit Rate 和 MRR 两项指标评测多种 Embedding 模型(OpenAI、Cohere、Voyage、Jina、bge-large、Google PaLM 等)搭配不同 Reranker 的检索效果。

    推荐理由:原文提供了可复现的评测脚本和各嵌入与重排模型组合的 Hit Rate 与 MRR 数据,读者可以照此在自己的数据上选型。

10月18日周三
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 介绍用 LayoutPDFReader 提取 PDF 的章节、标题、段落和表格

    LlamaIndex 发布教程,介绍 LayoutPDFReader 如何结合层级布局信息解析 PDF,实现章节识别、段落合并、表格与列表处理等内容感知分块。文章给出接入 llmsherpa API 和构建 LlamaIndex 向量查询引擎的示例代码,并说明该工具仅支持带文本层的 PDF,暂不支持 OCR。

    推荐理由:文章解释了 PDF 解析难点并给出 LayoutPDFReader 的层级解析与智能分块方法,含可直接复用的代码。

10月5日周四
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 实测 RAG 系统的最佳 chunk size

    LlamaIndex 演示如何用 Response Evaluation 模块评测 RAG 系统的最佳 chunk size,以 Uber 2021 10K 文件为数据。

    推荐理由:原文给出可复现的评测流程和具体数据,读者可以据此在自己的 RAG 场景中测试并选定合适的 chunk size。

8月25日周五