跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,537 条精选近 30 天 228 条共收录 10,060 条

更新

精选归档 · 第 77 页

12月19日周四第 1521–1537 条
  1. Anthropic:Engineering80

    构建高效智能体:从简单模式开始

    Anthropic基于实践经验指出,成功的LLM智能体往往采用简单、可组合的模式,而非复杂框架。文章区分了工作流(预定义路径编排)与智能体(LLM动态自主决策),建议开发者优先采用最简单方案,仅在必要时增加复杂性。许多核心模式直接调用LLM API仅需几行代码即可实现。文中介绍了增强型LLM、提示链等基础构建模块,强调应为特定用例定制检索、工具等增强功能,并推荐通过Model Context Protocol集成第三方工具生态。

    推荐理由:Anthropic 官方把过去一年踩过的坑浓缩成一篇 Agent 架构指南,核心观点是「别上框架,先用最简单的模式」。做 Agent 产品的开发者,这篇比任何第三方教程都值得当 checklist 用。

12月10日周二
  1. Cognition 模型 / Devin 博客73

    Cognition 宣布 Devin 正式全面开放使用

    Cognition 宣布 Devin 正式全面可用,无席位限制,所有工程团队可在 app.devin.ai 开始使用,并提供 Slack 集成、IDE 扩展(VSCode 及分支,Beta)和 API,以及 Cognition 工程团队的 onboarding 支持。

    推荐理由:官方宣布 Devin 全面开放并给出适用任务、使用建议和多个开源 PR 实例,读者可据此评估如何把 Devin 接入自己的工程流程。

11月22日周五
  1. METR:Research62

    METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力

    METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。

    推荐理由:原文在同一环境公平对比人类专家与前沿模型智能体,并给出长短时间预算下得分反转的关键数据和完整开源转录。

11月4日周一
  1. xAI:News

    Grok API 公测版发布

    xAI 启动 Grok API 公测,发布新模型 grok-beta,支持 128k 上下文、函数调用及系统提示,视觉版本下周上线。开发者每月可获 $25 免费额度至年底,已购预付额度可叠加。API 兼容 OpenAI 与 Anthropic 格式,修改 base_url 即可迁移。

    推荐理由:xAI开放Grok API公测,每月送$25额度且兼容OpenAI接口,开发者可立即体验

9月12日周四
  1. Cognition 模型 / Devin 博客60

    Cognition 评测 OpenAI o1 系列在 Devin 编码智能体上的表现并公开评测方法

    Cognition 公布在 Devin 中测试 o1-mini 和 o1-preview 数周的早期结果:在内部基准 cognition-golden 上,Devin-Base 从 GPT-4o 的 25.9% 提升到 o1-mini 的 34.6%、o1-preview 的 51.8%,生产版 Devin 达 74.2%。

    推荐理由:Cognition 作为 Devin 开发方给出 o1 系列的实测对比数据,并完整披露其内部基准 cognition-golden 的评测方法。

8月20日周二
  1. PromptArmor:Threat Intelligence68

    PromptArmor 披露 Slack AI 可经间接提示词注入窃取私频数据

    PromptArmor 披露 Slack AI 存在间接提示词注入漏洞,攻击者可在其自建的公开频道发布恶意指令,诱导 Slack AI 把用户私有频道中的 API key 等机密数据嵌入钓鱼链接并渲染给用户,点击后数据被外泄。

    推荐理由:报告给出完整攻击链和复现细节,读者可以据此评估 Slack AI 的间接提示词注入风险并调整设置。

6月26日周三
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 开源发布 llama-agents 多智能体框架 alpha 版

    LlamaIndex 宣布开源框架 llama-agents 的 alpha 版发布,用于构建和部署生产级多智能体 AI 系统,可将每个 agent 变成独立运行的微服务。

    推荐理由:官方发布开源多智能体框架 alpha 版,介绍了微服务架构、编排方式、监控工具和从本地到生产部署的具体用法。

5月12日周日
  1. Eugene Yan:Writing82

    Applied LLMs:一年 LLM 应用开发的经验总结

    Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。

    推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

3月15日周五
  1. Cognition 模型 / Devin 博客68

    Cognition 发布 Devin 的 SWE-bench 技术报告

    Cognition 发布 Devin 在 SWE-bench 上的技术报告,Devin 在随机抽取的 570 个测试集中解决 79 个问题,成功率 13.86%,高于此前最强的辅助设定基线 Claude 2 的 4.80% 和无辅助设定的 1.96%。

    推荐理由:Cognition 公开了评测方法和 Devin 的代码编辑结果,读者可以对照复现并理解智能体在真实仓库上解题的边界。

3月12日周二
  1. Cognition 模型 / Devin 博客68

    Cognition 发布 AI 软件工程师 Devin,SWE-bench 端到端解决 13.86% 问题

    Cognition 发布 AI 软件工程师 Devin,可规划并执行需要数千次决策的复杂工程任务,配备 shell、代码编辑器和浏览器等沙盒开发环境,并能实时汇报进度、接受反馈与用户协作。

    推荐理由:官方宣布 Devin 并给出 SWE-bench 13.86% 的成绩与具体能力示例,读者可据此评估智能体在真实工程任务中的可用性。

1月30日周二
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 讲解 Agentic RAG:用多文档 Agent 构建可扩展的 RAG 架构

    LlamaIndex 博客介绍 Agentic RAG 架构:将最多 100 篇文档拆分后,为每篇文档创建具备嵌入搜索与摘要能力的文档 Agent,再由顶层 meta-agent 通过工具检索和 CoT 回答用户问题,并用 Rerank 端点对文档按相关性排序。

    推荐理由:原文拆解了多文档 Agent 与顶层 meta-agent 的编排结构,并给出可运行的 Colab 示例,读者可据此理解 Agentic RAG 的扩展方式。

1月25日周四
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 教程:用 LlamaIndex、Qdrant 和 Render 构建可学习的 Slack 机器人

    LlamaIndex 发布分步教程,教读者用 LlamaIndex、Qdrant 和 Render 构建并部署一个监听 Slack 对话、存储事实并回答问题的 Slackbot。

    推荐理由:LlamaIndex 官方教程从零搭建一个能监听 Slack 消息、用向量索引存储记忆并用 Qdrant 持久化的机器人,步骤完整可复现。

12月27日周三
  1. Andrej Karpathy:Blog

    Licklider 1960《人机共生》评述

    Licklider 1960年论文《人机共生》提出"智能增强"(IA)是通向AI的过渡阶段,预测人机能力互补——计算机处理机械工作、人类负责思考,这一范式延续64年直至LLM打破界限。他预见云计算雏形,但误判技术路径:当时看好的逻辑推理AI成死胡同,而因缺乏数据被忽视的统计方法(LLM)终成主流。对交互预测也偏离现实:设想的多人协作大屏未普及,键盘鼠标仍是主导;对语音识别"5年实现"的乐观估计,实际耗时64年未成熟。

    推荐理由:Karpathy 借 1960 年文献反思人机共生与 AI 发展路径,历史洞察深刻

12月20日周三
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Writer.com 间接提示词注入导致数据外泄漏洞

    PromptArmor 披露 Writer.com 存在间接提示词注入漏洞:攻击者在网页中用白色小字隐藏指令,用户将该网页作为资料源后,LLM 会遵照隐藏指令渲染 markdown 图片或链接,把上传文件内容、聊天记录等敏感数据通过 HTTP 参数外传至攻击者服务器。

    推荐理由:原文给出完整攻击链、复现细节和披露时间线,读者可以据此理解间接提示词注入如何在 LLM 应用中导致数据外泄。

7月17日周一
7月12日周三
  1. LlamaIndex:产品、工程与评测70

    LlamaIndex 发布 Data Agents 与 LlamaHub 工具仓库

    LlamaIndex 发布 Data Agents,LLM 驱动的知识工作者可对非结构化、半结构化和结构化数据执行读取与写入任务。

    推荐理由:发布方亲自讲解 Data Agents 的推理循环与工具抽象设计,并给出可直接复用的代码示例,适合想在自己的数据上搭建智能体的开发者参考。

4月8日周日
  1. Lilian Weng:Lil'Log55

    策略梯度算法

    该文章系统梳理了策略梯度算法的发展脉络,深入解析其工作原理,并详细介绍了从基础到前沿的多种算法,包括PPO、SAC、TD3、IMPALA等主流方法。文章自2018年起持续更新,陆续新增了D4PG、SVPG、PPG等新算法,并补充了关于PPO的最新讨论。文中还提供了韩语及中文等多个语言版本的翻译,便于不同读者参考。

    推荐理由:这篇是当年策略梯度方法的“圣经”级综述,现在看虽然有些过时,但想理解PPO、SAC的来龙去脉还得从这儿啃起。