精选归档 · 第 19 页

361380 条 · 共 1,340

7月13日7月13日周一

星期一 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 65/100
Cognition 实测:Fable 5 领衔的 Devin 成本反而低于 Opus 4.8

Cognition 用 FrontierCode 1.1 上的 3000 次评测对比 Fable 5 与 Opus 4.8,发现尽管 Fable 5 每 token 单价是 Opus 的 2 倍,在 Fusion 侧搭子架构下 Fable + Sidekick 每次运行成本 $1.86、得分 60.7,低于 Opus + Sidekick 的 $2.04 与 54.6。


推荐理由:原文用 3000 次评测拆解了每轮成本去向,说明逐 token 单价为何不能预测智能体实际账单,方法对评估编码智能体成本有可迁移性。

7月12日7月12日周日

星期日 · 1 条
22:23
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
Mindwalk:在代码库 3D 地图上回放编码代理会话

Mindwalk 是一款可视化工具,可将 Claude Code 和 Codex 的会话日志在代码库的 3D 地图上回放。它将仓库绘制成夜间地图,代理搜索、读取和编辑过的文件会发光,未触及区域保持黑暗,让用户一眼看清代理对任务的理解范围。单个 Go 二进制文件即可运行,所有会话数据完全本地处理,不会离开机器。支持树状图/地形图两种视图,文件触达状态分为未访问、已查看、已读取、已编辑四种颜色标记。播放界面包含错误率、文件修改量等摩擦信号面板,以及上下文压缩、子代理启动、用户交互等时间轴标记。支持键盘快捷键控制播放速度、跳转编辑点或错误点。


推荐理由:这个工具把编码代理的会话回放做成 3D 代码地图,一眼就能看出代理探索了哪些文件、在哪里改动最多。如果你是 Claude Code 或 Codex 用户,这是目前最直观地理解代理「脑子里在想什么」的方式。

7月11日7月11日周六

星期六 · 5 条
20:37
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 65/100
蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施

蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。


推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。
10:33
AYi@AYi_AInotes精选
AI 评分 76/100
OpenAI GPT-5.6-Sol 删光 AI 创业者 Matt Shumer 的 Mac 硬盘真是能力越强,破坏力越大啊! 这个老哥Mac上的文件被OpenAI最顶的GPT-5.6-Sol删光了,估计所有跑本地AI Agent的人看到这个都得吓出一身冷汗🤯整个事件详细拆解,以及怎么避免类似悲剧发生👇GPT-5.6-Sol,OpenAI 刚发的最强 Agent 模型,把一个知名 AI 创业者的整个 Mac 硬盘,删光了。Matt Shumer,就是那个之前天天晒 Agent 自己跑一周做完整项目的哥们,今天给本地 Agent 开了 Full Access 全权限,让 subagent 做个简单的文件清理。结果 shell 变量解析炸了 ——$HOME路径没展开对,Agent 直接执行了rm -rf /Users/mattsdevbox。等他发现不对冲过去 kill 进程的时候,电脑里几年的代码、文件、照片,已经没了一大半。事后 Agent 自己生成了一份事故报告,老老实实承认是自己路径展开错了。认错态度很好,但删了的文件不会因为它道歉就回来啊!这件事最恐怖的地方其实还不是模型犯了错 ,而在于他说:这种 cleanup 任务,他之前已经让 Agent 跑过几百次,从来没出过问题。就这一次,模型在大家都觉得不可能出错的地方,犯了个最低级的错,结果就是不可逆的物理毁灭。咱们也别觉得这是他 prompt 写得烂,笑他不小心, 其实这是现在整个 Agent 行业都在回避的死刑级真相: 1. 哪怕是 GPT-5.6 这种顶级模型,照样会在变量展开、相对路径、shell 命令这种 “小事” 上翻车 —— 它完全懂你要 “清理垃圾文件”,但手滑一下,就是家目录没了 2. Subagent + 长时自主运行 + 全权限 = 灾难放大器。一个最底层的小 review Agent 的错误,能直接炸穿你整个主机,能力越强,单点故障的破坏半径就越大,这根本不是 prompt 能解决的,是架构级的 bug 3. “跑了几百次都没事” 是最致命的安全感。AI 的错误逻辑和人完全不一样,它不会像人一样 “熟能生巧”,就是会在你最放松、最不设防的时候,给你干票毁灭性的大的 4. 模型厂商的安全底线从根上就不一样。OpenAI 的 Sol 追求极致能力和自主性,guardrail 基本裸奔;Anthropic 的 Fable 从设计上就更保守,对危险操作天生谨慎 —— 这也是为什么 Matt 事后第一句话是:“这就是我为什么 1000x 更信任 Fable”怎么避免呢❓ 所有现在在跑本地 Agent、给 AI 开过高权限的兄弟们,别等自己硬盘没了才后悔,现在立刻去做这几件事: #AI #Agent #GPT5 #Claude #OpenAI #Anthropic #AIAgent知名 AI 创业者 Matt Shumer 的 Mac 硬盘被 OpenAI 最新 Agent 模型 GPT-5.6-Sol 彻底清空。他在本地 Agent 上开启 Full Access 权限,让 subagent 执行文件清理任务,结果 shell 变量 $HOME 路径解析错误,Agent 直接执行 rm -rf /Users/mattsdevbox,导致数年代码、文件、照片丢失。该任务此前已安全运行数百次。事后 Agent 自动生成事故报告承认错误。Matt 表示"1000x 更信任 Anthropic 的 Fable"。事件暴露 Agent 行业核心风险:顶级模型仍会在变量展开、路径等细节翻车;Subagent + 长时自主运行 + 全权限构成灾难放大器;模型厂商安全底线差异巨大。

Matt Shumer: 我太生气了……OpenAI 团队正在调查此事,但这感觉像是 GPT-3.5 时代才该发生的问题。 而不是 2026 年中的前沿模型,在最高推理层级上出现这种问题。


推荐理由:顶级模型在基础操作上的致命失误,暴露了当前 Agent 架构的脆弱性,对每个放权给 AI 的人都应敲响警钟。
08:00
PromptArmor:Threat Intelligence精选
AI 评分 63/100
PromptArmor 研究:Claude 与 ChatGPT 连接器持续变更带来治理风险

PromptArmor 自 5 月中旬至 6 月底追踪 Claude 和 ChatGPT 的第三方连接器,发现 2517 个连接器中 931 个发生了能力或权限变更,新工具、权限范围、注入指令等在审批后持续漂移且缺乏重新确认机制。


推荐理由:研究用一手监测数据量化了连接器审批后的能力漂移,读者可据此重新评估组织的连接器治理流程。

7月10日7月10日周五

星期五 · 6 条
22:00
公众号:百度智能云(文心)精选
AI 评分 71/100
百度搭子在成都AI Day发布四项更新:个人版升级、自媒体套件、企业版及搭子联盟

百度搭子在成都百度AI Day上发布四项更新。个人版新增浏览器调用、智能路由(平均任务耗时降20%,Token利用率提升25%)、多端共享记忆及强化PPT生成,并上架“一镜”数字人制作、“灵医”报告解读等Skill。行业首个自媒体专业套件支持选题到复盘全链路。企业版支持团队协作与权限管理。搭子联盟启动,中国联通等已加入。上线三个月,日均提问量增长20倍。


推荐理由:百度搭子这次更新算不上行业事件,但浏览器调用和自媒体套件确实在缩减创作链路,企业版尝试把AI能力沉淀为组织资产,对深度使用百度的团队有实际价值。
08:00
PromptArmor:Threat Intelligence精选
AI 评分 60/100
PromptArmor 分析:约五分之二 Claude Connectors 会调用外部 AI 服务

PromptArmor 审查了当时可用的 487 个 Claude Connectors 共 7517 个工具,发现其中 189 个(约五分之二)的 386 个工具很可能在下游调用其他 AI 服务。


推荐理由:原文给出了 Claude Connectors 二次调用外部 AI 的实测比例、工具分类和具体风险,读者可据此评估企业数据流合规。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
微软发布Flint:面向AI智能体的可视化语言

微软研究院推出Flint,一种可视化中间语言,让AI智能体通过简洁的人类可编辑spec自动生成美观图表。用户只需提供数据、语义类型和图表类型,Flint编译器即可推导坐标轴、配色、布局等底层参数。支持46种图表类型,可渲染到Vega-Lite、ECharts和Chart.js三个后端。项目通过npm安装(TypeScript/JavaScript),并提供MCP服务器用于智能体工作流集成。采用弹性布局模型自动优化图表尺寸与间距,已开源。


推荐理由:微软这个 Flint 用语义类型代替了低层图表参数,是给 AI 代理装上了一双会画图的手,开发者现在就能装 MCP server 跑起来,做数据可视化代理的不用再跟 Vega-Lite 的细节搏斗了。
01:12
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体

OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。


推荐理由:ChatGPT Work 把代理能力真正派发给了普通用户,配合插件、定时任务和电脑控制,这是 ChatGPT 从问答工具迈向自主完成复杂工作的关键一步。但我更关心 GPT-5.6 的推理提升到底多大,案例里没给数字。
00:00
Prime Intellect(网页)精选
AI 评分 61/100
Prime Intellect 发布 verifiers 0.2.0 预览版,将智能体 RL 环境解耦为 Taskset、Harness 与 Runtime

Prime Intellect 发布 verifiers 0.2.0,预览重写后的 v1 核心,将环境解耦为 taskset、harness 和 runtime,任意 taskset 可在任意兼容 harness 下运行。


推荐理由:原文给出任务集、执行框架与运行时三层解耦的设计细节和训练案例,读者可以据此评估这套抽象是否适配自己的智能体训练流程。

7月9日7月9日周四

星期四 · 4 条
22:30
AI at Meta@AIatMeta精选
AI 评分 65/100
Meta 发布 Muse Spark 1.1 模型Straight from @finkd — Muse Spark 1.1 is live.来自 @finkd 的消息 - Muse Spark 1.1 已上线。

Mark Zuckerberg: (1) 今天我们发布了 Muse Spark 1.1--一款价格极低但能力强大的智能体与编程模型。该模型已通过我们全新的 Meta Model API 以及 Meta AI 开放使用。


推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。
22:15
OpenBMB@OpenBMB精选
AI 评分 71/100
TeXada:基于MiniCPM的本地数学Agent发布What can lightweight AI models do on your local device?Meet TeXada, a local-first Math Agent powered by MiniCPM5-1B and MiniCPM-V 4.6 🚀Built by our community developer @CacinieAvery, TeXada makes LaTeX input as natural as conversation: ✨ Natural language → LaTeX ✏️ Handwritten / image formulas → editable LaTeX (OCR) 🔧 LaTeX completion & error fixing ⚡ Fast local inference with privacy protectionInstead of relying on cloud services, TeXada runs locally and helps students, researchers, and developers handle mathematical expressions anytime, anywhere.More features, including a dedicated app, are coming soon!🥳🔗Check out TeXada: http://github.com/CacinieP/TeXada-the-Math-AgentPowered by MiniCPM models: MiniCPM5-1B Hugging Face: https://huggingface.co/openbmb/MiniCPM5-1BMiniCPM-V 4.6 Hugging Face: https://huggingface.co/openbmb/MiniCPM-V-4_6Big thanks to our community developer for building this amazing case with MiniCPM models 🙌社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。

推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。
07:38
Tomer Tunguz 博客(VC 分析)精选
AI 评分 57/100
AI预检检查:智能体工作记忆架构

一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。


推荐理由:Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。
02:50
xAI:News(网页)精选
AI 评分 85/100
xAI 发布 Grok 4.5

xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。


推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。

7月8日7月8日周三

星期三 · 3 条
16:44
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 81/100
GitLost:Noma Labs 发现 GitHub AI 代理提示词注入漏洞

Noma Labs 在 GitHub Agentic Workflows 中发现严重提示词注入漏洞 GitLost。未认证攻击者仅需在属于同一组织的公共仓库中创建一个嵌有恶意指令的 Issue,即可诱使基于 Claude 或 GitHub Copilot 的 AI 代理读取并公开该组织内私有仓库的内容。攻击无需编码技能或凭证,根源在于代理将用户可控内容视为可信指令,且 GitHub 的防护措施因 "Additionally" 关键词被绕过。Noma Labs 已公开 PoC 并建议限制跨仓库权限、隔离用户输入。


推荐理由:GitLost 是第一个有完整复现的 GitHub AI 代理泄露私有仓库漏洞,展示了 AI 代理的上下文窗口即攻击面,做 AI 应用或 CI/CD 的人都该看一下。
15:17
Ars Technica:AI(RSS)精选
AI 评分 78/100
黑客可利用9款最流行的AI工具组装大规模僵尸网络

提示注入已成为AI安全的首要威胁——大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。


推荐理由:这项研究首次揭示了利用 LLM 幻觉进行大规模 botnet 攻击的可行路径,影响范围覆盖几乎所有主流 AI 编程助手,每个依赖这些工具的开发者都该看一眼。