随着AI应用从单次提示转向构建长期运行的智能体,焦点正从“提示工程”演进为“上下文工程”。后者旨在为大型语言模型优化有限的上下文窗口内的全部信息,包括指令、工具、外部数据和对话历史。其核心挑战在于模型存在“注意力预算”限制和“上下文腐化”现象——随着上下文增长,模型回忆信息的准确性会下降。因此,上下文工程要求精心编排高价值信息,以有限的资源最大化产出期望结果,这已成为构建高性能、可操控智能体的关键。
Agent 智能体
精选归档 · 第 60 页
第 1,181–1,200 条 · 共 1,227 条
9月29日
9月25日
YC S23 孵化的 Webhound 发布,这是一款研究智能体,可自动从网络抓取多源信息并构建结构化数据集,用于支持数据分析与研究工作。
9月23日
计划打造每周可新增1吉瓦算力的AI基础设施工厂,通过芯片、电力到机器人的全栈创新,支撑治愈癌症、全球个性化教育等宏大应用。项目将主要落地美国,未来数月公布合作伙伴,年底披露融资方案。
9月16日
We’re releasing GPT-5-Codex — a version of GPT-5 further optimized for agentic coding in Codex. Available in the Codex C...
9月11日
文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。
9月8日
Cognition 宣布融资超 4 亿美元,投后估值 102 亿美元,由 Founders Fund 领投。Devin 的 ARR 从 2024 年 9 月的 100 万美元增至 2025 年 6 月的 7300 万美元,公司历史总净消耗低于 2000 万美元;收购 Windsurf 使 ARR 翻倍以上,并购后七周合并企业级 ARR 增长超 30%。
9月3日
Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。
8月28日
xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。
8月25日
Anthropic正式发布Claude for Chrome扩展,允许AI在浏览器中执行点击、填表等操作。该功能已从1000名Max用户试点扩展至所有付费订阅者,新增Claude Code集成、定时任务及多标签工作流。针对提示词注入攻击,Anthropic通过站点权限、操作确认等防护措施,基于123个测试案例的红队测试,将攻击成功率从23.6%降至11.2%,并屏蔽高风险网站以确保安全。
8月21日
Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。
DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。
DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。
DeepSeek-V3.1 正式发布,deepseek-chat 与 deepseek-reasoner 分别对应其非思考与思考模式。新模型采用混合推理架构,思考效率较 DeepSeek-R1-0528 更高,并通过 Post-Training 优化提升工具使用与智能体任务表现。
8月19日
ARC Prize Foundation 总结 ARC-AGI-3 Preview 发布30天的数据:超1200人玩了3900多局游戏,人类大多能通关,AI Agent 进展低效。竞赛冠军 StochasticGoose 得分12.58%、完成18关,前三名Agent均基于智能随机探索;官方指出部分游戏可被暴力搜索破解,未来将按动作效率对人类基线评分并增加撤销按钮、离线引擎等改进。
8月15日
UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。
8月13日
METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。
8月8日
GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。
7月31日
智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。
7月16日
Thinking Machines Lab exists to empower humanity through advancing collaborative general intelligence. We're building mu...