ClawGUI是面向GUI Agent的开源全栈框架,统一解决训练、评估与部署的基础设施瓶颈。ClawGUI-RL首创支持并行虚拟环境与真实设备的开源强化学习管道,集成GiGPO与过程奖励模型;ClawGUI-Eval在6项基准实现95.8%基线复现率;ClawGUI-Agent支持部署至Android、HarmonyOS、iOS及12个以上聊天平台。经该管道训练的ClawGUI-2B在MobileWorld GUI-Only任务达17.1%成功率,较同规模基线提升6.0%。
Agent 智能体
精选归档 · 第 54 页
第 1,061–1,080 条 · 共 1,340 条
4月13日
4月12日
研究人员发布OS-BLIND基准测试,包含300个人工构建任务,覆盖12个类别与8个应用,用于评估计算机使用智能体(CUA)在非预期攻击条件下的安全性。测试显示,多数前沿模型攻击成功率超90%,Claude 4.5 Sonnet达73.0%,而在多智能体系统中该比例升至92.7%。研究表明,现有安全防御难以应对良性用户指令场景,安全对齐机制仅在前几步激活,且多智能体架构通过子任务分解进一步掩盖有害意图。
4月9日
Anthropic 在 Claude Platform 推出 advisor tool 测试版,实现"顾问策略":以 Opus 为顾问模型,Sonnet 或 Haiku 为执行模型。执行模型全程主导任务,仅在遇到决策难题时咨询 Opus 获取指导。该方案让 Sonnet 在 SWE-bench Multilingual 基准上性能提升 2.7 个百分点,同时成本降低 11.9%;Haiku 搭配 Opus 在 BrowseComp 得分达 41.2%,是单独 Haiku(19.7%)的两倍多,且比单独 Sonnet 成本低 85%。开发者只需在 API 请求中添加 advisor_20260301 工具即可启用,无需额外上下文管理。
另有 2 家信源报道X:Claude (@claudeai)X:Testing Catalog (@testingcatalog)4月8日
Bugbot 的 bug 解决率已从 2025 年 7 月正式推出时的 52% 提升至近 80%,领先其他 AI 代码审查产品。其核心改进在于引入了规则学习机制,能够从实时代码审查反馈(如开发者反应、回复和人工评审意见)中自主学习,取代了原先依赖离线实验的更新模式。自测试版推出以来,已有超过 11 万个仓库启用该功能,生成了逾 4.4 万条规则。这些规则可根据信号积累被激活或禁用,帮助 Bugbot 更精准地识别问题。用户可在 Cursor Dashboard 中管理学习规则,以优化审查效果。
智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。
另有 2 家信源报道公众号:智谱(GLM)IT之家(RSS)Factory 发布桌面应用,为 Droids 提供原生界面,今日上线 macOS 和 Windows。主要功能包括多智能体会话、持久化 Droid Computers(含 Cloud Computers 与 BYO Machine)、计算机操作能力、VS Code 集成、动态可视化、移动端支持,以及通过 Ollama、vLLM 等端点在本地 GPU 上运行模型、数据不出内网。
Claude 发布 Managed Agents 公开测试版,这是一个完全托管的智能体框架,支持通过 API 创建智能体、配置容器并运行会话,具备安全沙箱、内置工具和 SSE 流式传输。同时推出 ant CLI 命令行客户端,可加速与 Claude API 的交互,原生集成 Claude Code,并支持以 YAML 文件管理 API 资源版本。
Cognition 发文介绍过去八个月多家财富 500 强公司在 COBOL 项目中使用 Devin,包括用 DeepWiki 文档化数百万行代码、将 25000 行海关工作流迁移到 AWS Lambda(估算节省 73% 迁移成本),以及 Itaú Unibanco 跨数百个程序、20 种字段变体的税号重构,提前三个月完成且零生产错误。
LlamaIndex 复盘 LlamaParse 的两类生产故障:LLM 重复循环导致 token 消耗和延迟暴增、资源耗尽,以及 recitation 内容过滤把合法文档抽取误判为版权违规而强行截断输出。
4月7日
Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型在 SWE-Bench Pro 上与 SWE-1.6 Preview 表现相当,同时显著减少过度思考、循环推理和依赖终端等行为,更多使用并行工具调用;训练中引入长度惩罚,响应长度增长更慢且任务解决率保持稳定。
4月5日
The Codex app server was such a brilliant stroke of foresight that really doesn't get enough love Not only are you allow...
另有 1 家信源报道X:OpenAI Developers (@OpenAIDevs)4月4日
4月3日
You can now enable Claude to use your computer to complete tasks. It opens your apps, navigates your browser, fills in s...
We just made it frictionless for teams to try Codex! > New $0 Codex only seat for Codex access that is fully usage-based...
Meta的Ranking Engineer Agent系列博客第二篇,聚焦其底层基础设施优化能力。该自主AI代理能够优化支撑广告排名模型运行的低层基础设施,旨在提升系统性能与效率。本篇承接首篇介绍的机器学习实验自主探索功能,进一步展示了该代理在硬件与系统层面的自动化优化实践。
4月2日
Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。
Cursor 3.0 正式发布,重构为以 Agent 为核心的统一工作空间。新界面原生支持多仓库协作,可并行运行本地与云端 Agent(覆盖移动端、Slack、GitHub 等入口),支持会话在环境间无缝迁移以便离线运行或本地迭代。完整保留 IDE 能力:文件编辑、LSP、内置浏览器及插件市场。基于自研 Composer 2 模型,目标是通过多 Agent 自主协作实现"代码库自动驾驶"。