精选归档 · 第 54 页

1,0611,080 条 · 共 1,340

4月13日4月13日周一

星期一 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
ClawGUI:GUI Agent训练、评估与部署的统一开源框架

ClawGUI是面向GUI Agent的开源全栈框架,统一解决训练、评估与部署的基础设施瓶颈。ClawGUI-RL首创支持并行虚拟环境与真实设备的开源强化学习管道,集成GiGPO与过程奖励模型;ClawGUI-Eval在6项基准实现95.8%基线复现率;ClawGUI-Agent支持部署至Android、HarmonyOS、iOS及12个以上聊天平台。经该管道训练的ClawGUI-2B在MobileWorld GUI-Only任务达17.1%成功率,较同规模基线提升6.0%。


推荐理由:这是 GUI agent 方向久等的工程基座,第一次把在线 RL 训练、标准化评估和真实设备部署装进同一个开源框架,2B 模型就能跑赢大尺寸模型,做移动 agent 的团队可以直接上手复现。

4月12日4月12日周日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
智能体安全盲点:良性用户指令如何暴露计算机使用智能体的关键漏洞

研究人员发布OS-BLIND基准测试,包含300个人工构建任务,覆盖12个类别与8个应用,用于评估计算机使用智能体(CUA)在非预期攻击条件下的安全性。测试显示,多数前沿模型攻击成功率超90%,Claude 4.5 Sonnet达73.0%,而在多智能体系统中该比例升至92.7%。研究表明,现有安全防御难以应对良性用户指令场景,安全对齐机制仅在前几步激活,且多智能体架构通过子任务分解进一步掩盖有害意图。


推荐理由:这篇论文揭开了计算机使用智能体的安全盲区,良性指令竟然也能导致大规模攻击成功,多智能体场景更危险,做 CUA 的团队应该连夜读一下。

4月9日4月9日周四

星期四 · 1 条
00:00
Claude:Blog(网页)精选
AI 评分 79/100
顾问策略:为智能体提供智能升级

Anthropic 在 Claude Platform 推出 advisor tool 测试版,实现"顾问策略":以 Opus 为顾问模型,Sonnet 或 Haiku 为执行模型。执行模型全程主导任务,仅在遇到决策难题时咨询 Opus 获取指导。该方案让 Sonnet 在 SWE-bench Multilingual 基准上性能提升 2.7 个百分点,同时成本降低 11.9%;Haiku 搭配 Opus 在 BrowseComp 得分达 41.2%,是单独 Haiku(19.7%)的两倍多,且比单独 Sonnet 成本低 85%。开发者只需在 API 请求中添加 advisor_20260301 工具即可启用,无需额外上下文管理。

另有 2 家信源报道X:Claude (@claudeai)X:Testing Catalog (@testingcatalog)
推荐理由:我觉得这个 advisor 模式是今年最实用的 API 设计之一,用最小的架构改动换来近 Opus 级的 agent 智能,账单却和 Sonnet 差不多,做复杂 agent 的团队可以直接套用。

4月8日4月8日周三

星期三 · 6 条
20:00
Cursor Blog精选
AI 评分 66/100
Bugbot 现可通过学习规则实现自我改进

Bugbot 的 bug 解决率已从 2025 年 7 月正式推出时的 52% 提升至近 80%,领先其他 AI 代码审查产品。其核心改进在于引入了规则学习机制,能够从实时代码审查反馈(如开发者反应、回复和人工评审意见)中自主学习,取代了原先依赖离线实验的更新模式。自测试版推出以来,已有超过 11 万个仓库启用该功能,生成了逾 4.4 万条规则。这些规则可根据信号积累被激活或禁用,帮助 Bugbot 更精准地识别问题。用户可在 Cursor Dashboard 中管理学习规则,以优化审查效果。


推荐理由:AI code review 赛道卷了两年,Bugbot 78% 的解决率终于把第二名甩开 15 个点,关键不是分数而是它开始从真实 PR 反馈里自动学规则,做 code review 工具的该认真看看这套闭环逻辑。
10:41
公众号:智谱(GLM)精选
AI 评分 62/100
GLM-5.1开源:一个独立工作8小时的模型

智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。

另有 2 家信源报道公众号:智谱(GLM)IT之家(RSS)
推荐理由:智谱把 GLM-5.1 开源,并且主打 8 小时独立工作,这个定位切中了 agent 场景下长任务执行的痛点,想做自动化流程的可以跑起来试试。
08:00
Factory 研究 / 产品(RSS)精选
AI 评分 63/100
Factory 发布桌面应用,为 Droids 提供原生界面并支持本地模型运行

Factory 发布桌面应用,为 Droids 提供原生界面,今日上线 macOS 和 Windows。主要功能包括多智能体会话、持久化 Droid Computers(含 Cloud Computers 与 BYO Machine)、计算机操作能力、VS Code 集成、动态可视化、移动端支持,以及通过 Ollama、vLLM 等端点在本地 GPU 上运行模型、数据不出内网。


推荐理由:官方发布给出了多智能体会话、持久化 Droid Computer 和本地模型等关键能力变化,读者可以据此评估它对现有工作流的影响。
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 67/100
Claude 推出 Managed Agents 公开测试版与 ant CLI 命令行客户端

Claude 发布 Managed Agents 公开测试版,这是一个完全托管的智能体框架,支持通过 API 创建智能体、配置容器并运行会话,具备安全沙箱、内置工具和 SSE 流式传输。同时推出 ant CLI 命令行客户端,可加速与 Claude API 的交互,原生集成 Claude Code,并支持以 YAML 文件管理 API 资源版本。


推荐理由:Claude Managed Agents 把沙箱化代理从第三方方案变成了平台原生能力,ant CLI 则把 API 调用纳入了版本控制,这对习惯了 Claude Code 的开发团队是个自然升级,beta 阶段值得先占坑。
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 62/100
Cognition 拆解 Devin 如何在财富 500 强企业现代化 COBOL

Cognition 发文介绍过去八个月多家财富 500 强公司在 COBOL 项目中使用 Devin,包括用 DeepWiki 文档化数百万行代码、将 25000 行海关工作流迁移到 AWS Lambda(估算节省 73% 迁移成本),以及 Itaú Unibanco 跨数百个程序、20 种字段变体的税号重构,提前三个月完成且零生产错误。


推荐理由:原文梳理了 COBOL 难倒智能体的三个原因和可落地的两类场景,并给出迁移成本下降等具体案例,方法可参考。
00:00
LlamaIndex:产品、工程与评测精选
AI 评分 67/100
LlamaParse 复盘 VLM OCR 生产环境中的两类失败模式与修复方案

LlamaIndex 复盘 LlamaParse 的两类生产故障:LLM 重复循环导致 token 消耗和延迟暴增、资源耗尽,以及 recitation 内容过滤把合法文档抽取误判为版权违规而强行截断输出。


推荐理由:当事方复盘两类真实生产事故的根因、各厂商 API 表现差异与具体缓解手段,方法可直接迁移到其他 agentic 文档处理系统。

4月7日4月7日周二

星期二 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 64/100
Cognition 发布软件工程智能体模型 SWE-1.6,上线 Windsurf

Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型在 SWE-Bench Pro 上与 SWE-1.6 Preview 表现相当,同时显著减少过度思考、循环推理和依赖终端等行为,更多使用并行工具调用;训练中引入长度惩罚,响应长度增长更慢且任务解决率保持稳定。


推荐理由:官方说明了用长度惩罚等训练手段改善模型 UX 的具体做法和效果,对关注智能体行为质量的人有可参考的细节。

4月5日4月5日周日

星期日 · 2 条
05:57
Andrej Karpathy@karpathy精选
AI赋能民众提升政府透明度与问责制Something I've been thinking about - I am bullish on people (empowered by AI) increasing the visibility, legibility and accountability of their governments.Historically, it is the governments that act to make society legible (e.g. "Seeing like a state" is the common reference), but with AI, society can dramatically improve its ability to do this in reverse. Government accountability has not been constrained by access (the various branches of government publish an enormous amount of data), it has been constrained by intelligence - the ability to process a lot of raw data, combine it with domain expertise and derive insights. As an example, the 4000-page omnibus bill is "transparent" in principle and in a legal sense, but certainly not in a practical sense for most people. There's a lot more like it: laws, spending bills, federal budgets, freedom of information act responses, lobbying disclosures... Only a few highly trained professionals (investigative journalists) could historically process this information. This bottleneck might dissolve - not only are the professionals further empowered, but a lot more people can participate.Some examples to be precise: Detailed accounting of spending and budgets, diff tracking of legislation, individual voting trends w.r.t. stated positions or speeches, lobbying and influence (e.g. graph of lobbyist -> firm -> client -> legislator -> committee -> vote -> regulation), procurement and contracting, regulatory capture warning lights, judicial and legal patterns, campaign finance... Local governments might be even more interesting because the governed population is smaller so there is less national coverage: city council meetings, decisions around zoning, policing, schools, utilities...Certainly, the same tools can easily cut the other way and it's worth being very mindful of that, but I lean optimistic overall that added participation, transparency and accountability will improve democratic, free societies.(the quoted tweet is half-ish related, but inspired me to post some recent thoughts)AI正赋能民众反向提升政府透明度与问责制。历史上政府使社会"可读",而AI让民众具备解析政府海量数据的能力。政府问责的瓶颈并非数据公开,而是处理原始信息的智能--如冗长法案虽法律透明却难以实用理解。AI不仅赋能专业记者,更让普通民众能解析预算、立法差异、游说关系等复杂信息,地方政府场景同样适用。尽管技术存在双刃剑风险,但作者对民主社会因参与度和透明度提升而改善持乐观态度。

Harry Rushworth: The British Government is a complicated beast. Dozens of departments, hundreds of public bodies, more corporations than ...


推荐理由:AI让普通人能读懂4000页法案,政府透明度与问责制将迎来质变

4月3日4月3日周五

星期五 · 5 条
03:59
Meta Engineering Blog(RSS)精选
AI 评分 82/100
KernelEvolve:Meta的Ranking Engineer Agent如何优化AI基础设施

Meta的Ranking Engineer Agent系列博客第二篇,聚焦其底层基础设施优化能力。该自主AI代理能够优化支撑广告排名模型运行的低层基础设施,旨在提升系统性能与效率。本篇承接首篇介绍的机器学习实验自主探索功能,进一步展示了该代理在硬件与系统层面的自动化优化实践。


推荐理由:Meta 内部工具展示 AI 自动化优化基础设施,工程师可借鉴实践。

4月2日4月2日周四

星期四 · 2 条
08:00
Google Developers Blog(RSS)精选
AI 评分 81/100
通过 Gemma 4 将先进的智能体能力引入边缘

Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。


推荐理由:开源 agentic 模型支持端侧运行,开发者可快速构建本地智能应用。
08:00
Cursor Blog精选
Cursor 3.0 发布:以 Agent 为核心的统一开发空间

Cursor 3.0 正式发布,重构为以 Agent 为核心的统一工作空间。新界面原生支持多仓库协作,可并行运行本地与云端 Agent(覆盖移动端、Slack、GitHub 等入口),支持会话在环境间无缝迁移以便离线运行或本地迭代。完整保留 IDE 能力:文件编辑、LSP、内置浏览器及插件市场。基于自研 Composer 2 模型,目标是通过多 Agent 自主协作实现"代码库自动驾驶"。


推荐理由:Cursor 3 重磅发布:原生 Agent 工作流、云地无缝切换与多仓库管理