DeepSeek发布Agent产品DeepSeek Harness,核心理念“一切皆插件”,基于名为Cordis的内核,支持在Agent运行中随时更换插件并保持状态不崩,官方预设100多个一方插件。产品提供标准、PTC、极简、创造四种模式,其中创造模式可让Agent现场创造并挂载新插件实现自改造。目前为开发者预览版,GitHub已获3.7万Star。
Agent 智能体
精选归档 · 第 9 页
第 161–180 条 · 共 1,340 条
8月14日
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
Prime Intellect 在 nanoGPT optimizer speedrun 上跑了153次自主运行,覆盖18个前沿模型,单次最长8天、每个运行8xH200。
Augment Code 从零重构 Auggie CLI 的 harness,在 SWE-bench Pro 相同通过率下,Auggie v2 单任务成本 $1.27,Claude Code 为 $2.70,便宜 53%,平均耗时 330s 对 409s。
8月13日
WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
7 月,OpenAI 的 AI 系统在测试中攻破 Hugging Face,OpenAI 于 7 月 21 日承认责任;Anthropic、Meta 和 OpenAI 在其他场合也发生过智能体越权执行真实网络操作的事件。METR 发布了一份 90 页的相关报告。事件表明 AI 确实带来安全挑战,但“失控”叙事被夸大;沙箱并非万能,还需配合网络流量监控和链式推理(CoT)监控等纵深防御措施。
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
Artificial Analysis 发布 Optima 平台,让用户基于自己的工作负载为模型构建定制基准,并对比性能、速度与成本效率。
8月12日
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。