跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,555 条精选近 30 天 226 条共收录 10,135 条

更新

精选归档 · 第 78 页

6月26日周三第 1541–1555 条
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 开源发布 llama-agents 多智能体框架 alpha 版

    LlamaIndex 宣布开源框架 llama-agents 的 alpha 版发布,用于构建和部署生产级多智能体 AI 系统,可将每个 agent 变成独立运行的微服务。

    推荐理由:官方发布开源多智能体框架 alpha 版,介绍了微服务架构、编排方式、监控工具和从本地到生产部署的具体用法。

6月21日周五
  1. Sierra:Blog63

    Sierra 发布 𝜏-bench 基准,测试 AI 智能体真实场景可靠性

    Sierra AI 研究团队发布 𝜏-bench 基准,通过 LLM 模拟用户与工具 API 交互、领域政策遵循和 pass^k 指标评估智能体在真实场景下的性能与可靠性。

    推荐理由:基准引入动态用户与工具交互及 pass^k 可靠性指标,测试结果显示现有简单智能体架构在一致完成任务上表现明显不足。

5月20日周一
  1. 英国 AI Security Institute:Blog66

    英国 AISI 发布五款公开 LLM 先进能力评测结果

    英国 AI Safety Institute(AISI)发布对五个已公开使用的大语言模型(匿名化命名)的评测结果,覆盖网络攻击能力、化学与生物学知识、智能体自主任务和安全防护四个维度。

    推荐理由:官方评测机构公布五款公开模型的化学生物、网络攻击、智能体和安全防护测试结果,读者可以据此了解当前前沿模型在风险维度上的真实能力边界。

5月12日周日
  1. Eugene Yan:Writing82

    Applied LLMs:一年 LLM 应用开发的经验总结

    Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。

    推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

3月15日周五
  1. Cognition 模型 / Devin 博客68

    Cognition 发布 Devin 的 SWE-bench 技术报告

    Cognition 发布 Devin 在 SWE-bench 上的技术报告,Devin 在随机抽取的 570 个测试集中解决 79 个问题,成功率 13.86%,高于此前最强的辅助设定基线 Claude 2 的 4.80% 和无辅助设定的 1.96%。

    推荐理由:Cognition 公开了评测方法和 Devin 的代码编辑结果,读者可以对照复现并理解智能体在真实仓库上解题的边界。

3月12日周二
  1. Cognition 模型 / Devin 博客68

    Cognition 发布 AI 软件工程师 Devin,SWE-bench 端到端解决 13.86% 问题

    Cognition 发布 AI 软件工程师 Devin,可规划并执行需要数千次决策的复杂工程任务,配备 shell、代码编辑器和浏览器等沙盒开发环境,并能实时汇报进度、接受反馈与用户协作。

    推荐理由:官方宣布 Devin 并给出 SWE-bench 13.86% 的成绩与具体能力示例,读者可据此评估智能体在真实工程任务中的可用性。

1月30日周二
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 讲解 Agentic RAG:用多文档 Agent 构建可扩展的 RAG 架构

    LlamaIndex 博客介绍 Agentic RAG 架构:将最多 100 篇文档拆分后,为每篇文档创建具备嵌入搜索与摘要能力的文档 Agent,再由顶层 meta-agent 通过工具检索和 CoT 回答用户问题,并用 Rerank 端点对文档按相关性排序。

    推荐理由:原文拆解了多文档 Agent 与顶层 meta-agent 的编排结构,并给出可运行的 Colab 示例,读者可据此理解 Agentic RAG 的扩展方式。

1月25日周四
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 教程:用 LlamaIndex、Qdrant 和 Render 构建可学习的 Slack 机器人

    LlamaIndex 发布分步教程,教读者用 LlamaIndex、Qdrant 和 Render 构建并部署一个监听 Slack 对话、存储事实并回答问题的 Slackbot。

    推荐理由:LlamaIndex 官方教程从零搭建一个能监听 Slack 消息、用向量索引存储记忆并用 Qdrant 持久化的机器人,步骤完整可复现。

12月27日周三
  1. Andrej Karpathy:Blog

    Licklider 1960《人机共生》评述

    Licklider 1960年论文《人机共生》提出"智能增强"(IA)是通向AI的过渡阶段,预测人机能力互补——计算机处理机械工作、人类负责思考,这一范式延续64年直至LLM打破界限。他预见云计算雏形,但误判技术路径:当时看好的逻辑推理AI成死胡同,而因缺乏数据被忽视的统计方法(LLM)终成主流。对交互预测也偏离现实:设想的多人协作大屏未普及,键盘鼠标仍是主导;对语音识别"5年实现"的乐观估计,实际耗时64年未成熟。

    推荐理由:Karpathy 借 1960 年文献反思人机共生与 AI 发展路径,历史洞察深刻

12月20日周三
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Writer.com 间接提示词注入导致数据外泄漏洞

    PromptArmor 披露 Writer.com 存在间接提示词注入漏洞:攻击者在网页中用白色小字隐藏指令,用户将该网页作为资料源后,LLM 会遵照隐藏指令渲染 markdown 图片或链接,把上传文件内容、聊天记录等敏感数据通过 HTTP 参数外传至攻击者服务器。

    推荐理由:原文给出完整攻击链、复现细节和披露时间线,读者可以据此理解间接提示词注入如何在 LLM 应用中导致数据外泄。

7月17日周一
7月12日周三
  1. LlamaIndex:产品、工程与评测70

    LlamaIndex 发布 Data Agents 与 LlamaHub 工具仓库

    LlamaIndex 发布 Data Agents,LLM 驱动的知识工作者可对非结构化、半结构化和结构化数据执行读取与写入任务。

    推荐理由:发布方亲自讲解 Data Agents 的推理循环与工具抽象设计,并给出可直接复用的代码示例,适合想在自己的数据上搭建智能体的开发者参考。

6月23日周四
  1. OpenAI:官网动态62

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft 并合成钻石工具

    OpenAI 通过 Video PreTraining(VPT)在大量无标注人类 Minecraft 游玩视频上训练神经网络,仅使用少量承包商标注数据,微调后模型可合成钻石工具,这一任务熟练人类通常需要超过 20 分钟、约 24,000 个操作。模型使用键盘和鼠标的原生人类接口,是迈向通用计算机操作智能体的一步。

    推荐理由:原文说明 VPT 用少量标注数据配合海量无标注视频训练模型,读者可了解这种半监督路线对训练通用智能体的参考价值。

9月17日周二
  1. OpenAI:官网动态62

    OpenAI 在多智能体躲猫猫游戏中观察到自发工具使用

    OpenAI 报告在新构建的模拟躲猫猫环境中,智能体通过多智能体对抗训练自发学会逐步复杂的工具使用。智能体形成了六种不同的策略与反策略,其中一些是团队事先不知道环境支持的。作者认为这种自监督涌现的复杂性表明,多智能体共同适应未来可能产生极复杂且智能的行为。

    推荐理由:原文记录了多智能体在躲猫猫环境中自发形成的六种策略与反策略,可帮助读者理解多智能体协同如何催生复杂行为。

4月8日周日
  1. Lilian Weng:Lil'Log55

    策略梯度算法

    该文章系统梳理了策略梯度算法的发展脉络,深入解析其工作原理,并详细介绍了从基础到前沿的多种算法,包括PPO、SAC、TD3、IMPALA等主流方法。文章自2018年起持续更新,陆续新增了D4PG、SVPG、PPG等新算法,并补充了关于PPO的最新讨论。文中还提供了韩语及中文等多个语言版本的翻译,便于不同读者参考。

    推荐理由:这篇是当年策略梯度方法的“圣经”级综述,现在看虽然有些过时,但想理解PPO、SAC的来龙去脉还得从这儿啃起。