# OpenAI 推 Images 2.5，Grok Bot 获委托，Claude 托管实践

- 来源：ginobefun (@hongming731)
- 发布时间：2026-09-09 08:04
- AIHOT 分数：43
- AIHOT 链接：https://aihot.news/items/cmttcd2zz04fhrofpuycdtqgc
- 原文链接：https://x.com/hongming731/status/2097476201904472266

## AI 摘要

OpenAI 发布 ChatGPT Images 2.5，每周生成超 30 亿张图，延迟较 Images 2.0 最高降 50%，强化参考对象保持与局部编辑。Grok Bot 产品负责人复盘一个月打造可信 Agent 的委托体验。Claude 圆桌展示三家团队基于 Managed Agents 构建会议、销售与产品分析产品。

## 正文

https://x.com/i/article/2097475330886041600

BestBlogs 早报 · 09-09｜Images 升级，Grok Bot 获可信任务委托，Claude 托管

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容，如果你希望它基于你的兴趣和阅读习惯整理，可以体验「我的早报」。

导语

ChatGPT 与 API 每周生成的图片已经超过 30 亿张。到了这个规模，图像模型的竞争就不只发生在第一次生成：参考对象能否保持，局部修改会不会伤及其他细节，多轮编辑后能否继续沿用已确认的构图，都直接影响一张图从想法走到交付需要多少时间。

Images 2.5 给出的答案，是把模型更新和创作工具一起推进。再往产品层看，Grok Bot 团队讨论的是用户为何愿意把完整工作交给 Agent；三家使用 Claude Managed Agents 的创业团队，则把结果验收、记忆与沙箱放进产品运行过程。三条内容依次对应能力供给、委托体验和基础设施取舍，但各自证据类型不同：产品公告适合看功能边界，访谈适合读团队如何做选择，圆桌案例适合提炼可复用的工程部件。

近几期早报已经持续讨论组织上下文、权限、评估和成本。本期的新信息更贴近产品化的下一步：当这些原则变成具体界面、运行机制和模型选项，团队该用什么标准判断它们是否真的改善工作。后面的七条速览会把这套判断延伸到数学研究、基因变异、研发协作、端侧模型、测试自动化与向量检索。

★ 精讲一：OpenAI 推出新一代图像模型 ChatGPT Images 2.5

来源：OpenAI News · BestBlogs 评分：93

OpenAI 在 ChatGPT 和 API 两端推出 Images 2.5。公告给出的使用规模是每周超过 30 亿张图片，新模型相较 Images 2.0 的生成延迟最多降低 50%。后一个数字是官方给出的上限，不意味着每种分辨率、素材和编辑任务都会获得相同提升，但对需要反复试图、批量生成或快速预览的工作，它把等待时间变成了更直接的产品变量。

更值得关注的改进集中在创作连续性。Images 2.5 会更好地保留参考照片中的人物、宠物、产品和地点特征，让同一主体进入不同场景、风格与构图后仍然容易辨认。光线和纹理更自然只是表层变化，真正影响工作流的是参考素材可以成为后续变体的稳定锚点，团队不必每生成一个版本就重新校准人物外貌或品牌对象。

局部编辑解决的是另一种返工。用户要求替换商品、背景或一段文案时，模型会尽量只改变指定元素，保留周围的主体、构图和品牌处理。多轮编辑则让前面已经确定的调整在后续对话中延续，减少越改越偏或质量逐轮下降。对于系列广告、产品图、UI 概念和演示文稿，这种稳定性通常比偶然生成一张漂亮图片更容易形成可预测的生产流程。

ChatGPT 里的 Sketch 把输入从文字扩展到草图。用户可以画房间布局、服装轮廓或一个简单构图，再用文字补充风格与细节。模板提供海报、商品图等常见起点，图上评论让反馈落到具体位置，分享图片时还可以附上提示词，方便其他人替换自己的照片和信息继续创作。这些功能的共同作用，是减少用户把视觉意图翻译成长提示词的负担。

API 侧提供 Flare 与 Sunburst 两种模型。Flare 获得相同的质量、编辑和速度改进，官方把它定位为多数应用的默认选择，适合社交内容、视觉搜索、快速原型和高吞吐生成。Sunburst 用更长生成时间换取更细的编辑控制，面向成品广告、精修商品图等要求更高的流程。开发者因此可以按等待时间、修改精度和交付标准选择，而不必用同一个配置覆盖所有任务。

Images 2.5 继续使用提示词与图像检查、C2PA 元数据和隐形水印来标识生成内容。把这些变化放在一起看，模型的价值正在从单张成片质量扩展到完整迭代成本。创作者可以先观察对象是否稳、修改是否准，开发团队再衡量速度与精细度；这比只比较几张精选样图，更接近真实生产中的选择。

★ 精讲二：Roman Ugarte：一个月打造 Grok Bot，如何让智能体成为可信赖的知识工作同事

来源：Lenny's Podcast · BestBlogs 评分：91

Grok Bot 产品负责人复盘了一个紧凑的起点：少数人离开常规组织，在独立空间和沟通渠道里，从第一行代码到内部可用原型大约用了一个月。团队已经知道如何为开发者构建 Agent，这次却没有把知识工作能力直接附加到既有编码工具，而是先问用户想交付什么工作。这个问题把产品带向了一种更有主张的界面，也让功能取舍围绕委托展开。

主持人的 onboarding 是一个具体例子。他没有先听完整功能介绍，而是直接要求系统推广最新一期播客。Grok Bot 找到了正确节目并给出可用结果，能力因此从抽象说明变成一次完成的工作。随后，一些并不符合典型早期采用者画像的内部团队，也开始把日常 Agent 任务迁进产品。团队据此从内部实验转向更广泛发布所需的运营准备。

这些反馈来自负责人和主持人的访谈经历，不是公开的规模化留存数据，却揭示了比点赞更有用的行为信号：用户是否愿意放弃熟悉的聊天工具或手工流程，把同类任务再次交过来。团队所说的同事也不是人格化包装。它代表一个 Agent 拥有明确职责、相关上下文、特定系统权限，并能对一项结果持续负责。

委托首先需要真实上下文。人把任务交给同事时，不会每次重新打包所有文件、工具和背景；Agent 也要能够进入用户实际使用的系统，找到与任务相关的材料。连接器只是入口，产品还要决定如何用这些信息完成工作，而不是停在检索和总结。用户给出结果导向的要求后，可以暂时离开，并在需要澄清或方向偏离时回来介入。

信任还依赖可理解的边界。每个 Bot 能访问哪些信息、能执行哪些动作、当前正在做什么，都需要被产品清楚呈现。进度可见让用户知道何时该等待、何时该纠正；角色与权限明确，则帮助团队把不同 Agent 按职能组织起来。未来的一组 Bot 可以分别负责研究、协调或执行，但用户仍然保留引导、审阅和设定边界的能力。

团队也在持续删功能。通用聊天框加上大量控制项，很容易展示模型能做什么，却可能降低用户对可委托工作的理解。Grok Bot 更看重少数流程是否稳定，能否让重要任务反复得到有用结果。为此，团队观察真实工作流、支持信号和用户反馈，快速决定该改什么、删什么，再上线观察下一轮行为。

这篇访谈留下的产品尺度很明确：不要只统计一次回答有多完整，还要看用户是否把完整任务交出、是否愿意重复使用，以及失败后能否有效介入。昨天的 Stripe Kai 更偏组织上下文和共享技能，Grok Bot 补上了前台委托体验。两者合起来说明，Agent 赢得位置的方式，是在真实任务中逐步积累可预期的交付记录。

★ 精讲三：创始人如何基于 Claude Managed Agents 构建产品

来源：Claude · BestBlogs 评分：91

Claude 的这场圆桌把 Managed Agents 放进三种已经运行的产品：会议准备、销售情报和产品分析。三个团队面对的任务不同，却都需要 Agent 长时间调用工具、保留状态、处理真实数据，并对最终结果负责。它们的实践可以归纳成三类部件：把用户需要写成结果验收标准，用分层记忆承接跨时间工作，再通过沙箱控制代码、数据和外部动作。

会议产品覆盖会前准备、会中支持和会后跟进。会前简报需要识别正确的人，说明此人为何重要，恢复过往沟通，并明确会议目标。若系统把两个同名联系人混淆，一份排版精美的简报也会把用户带向错误判断。团队因此把身份、来源、内容顺序和可扫读性写进 outcome rubric，让 Agent 围绕这些标准迭代。

核验工作由一个拥有独立上下文的 Agent 承担。它不沿用生成简报时的整条思路，而是利用 LinkedIn、邮件和日历等证据重新判断结果是否正确、来源是否匹配。在主动推送型产品里，团队有时宁愿隐藏不确定信息，也不展示可能误导用户的内容。这种设计把质量评估放到运行时，并让每次结果都能反过来改进生成环节。

销售团队用分层记忆处理账户与组织差异。单账户 Agent 在完整客户生命周期里积累背景和下一步动作；跨账户的 Watchtower 则回答销售今天应优先追哪些客户、负责人下季度应预测哪些交易。它可以先用代码在数百个账户中缩小范围，再把分析分发给独立 Agent，最后汇总。团队用两周搭出这一能力，并让系统在真实问题与澄清中逐步学习企业对归属、预测和流程的定义。

记忆被分到账户、用户和组织三个层次。单个客户的关系历史不必污染整个组织，预测规则和业务术语又能被所有账户共享。对管理者来说，这种结构可以把多个销售成员、数百个账户的线索卷到同一视图；对一线人员来说，Agent 仍保留与具体客户相关的连续上下文。分层的意义在于让正确知识出现在正确任务里，而不是把所有历史一股脑加入提示词。

产品分析团队更看重沙箱。Agent 会读取客户代码，并把代码快照与线上行为相比较，有时还会提出或提交修改。系统因此要限制可见数据、可用工具和可执行动作。它可以在代码合并前做轻量体验检查，合并后判断埋点是否需要更新，夜间再寻找转化变化与代码改动的关联。沙箱在这里直接影响企业是否愿意让 Agent 接触代码、密钥和仓库。

圆桌最后讨论自建与托管。若 Agent harness 本身决定产品能力，例如一种高度定制的语音交互系统，自建可能形成差异；若产品价值来自会议结果、销售决策或分析洞察，团队可以先用托管基础设施换取更快迭代。其中仅一名参与者的自建方案问题累积到需要大幅重建，因此转向托管方案，随后在几天内搭好基础设施，并用几周完成迁移。这段经历说明，托管能力可以在早期把时间还给产品验证。

产品成熟后，成本归因、批处理、模型选择、延迟和控制粒度会重新进入决策。困难搜索可能需要前沿模型，大量账户的并行处理可能适合更便宜的模型，提前运行的批任务也可能有更低成本路径。圆桌给出的不是永久押注某一种基础设施，而是一种阶段性策略：早期先缩短学习用户价值的时间，同时积累真实评估和成本数据；当成本或控制开始决定功能能否成立，再增加自建比例。

速览

OpenAI 公布 Navier–Stokes 千年难题研究进展

来源：OpenAI News · BestBlogs 评分：91

OpenAI 发布其内部系统生成的 Navier–Stokes 存在性与光滑性问题解答，并公开解析证明和 Lean 形式化。证明给出的结论是，一个起初静止、受到平滑外力的流体，可以在有限时间形成速度无上界的奇点，同时总能量保持有限。

构造的直觉是一股不断向内螺旋并被轴向拉长的涡旋：中心区域持续收缩、速度上升，方程里的加速度、压力、动量传递和黏性项却以精确方式抵消，使外力仍然平滑。OpenAI 称，产生结果的组别使用约 1 万个并发 Agent，约 88 小时得到解答，随后由 GPT 6 Astra 用 17 小时完成 Lean 形式化与验证。

OpenAI 明确表示不申领奖项，因此这项工作的下一步落在公开材料的专业审阅。它提供的关键增量，是 AI 数学研究开始同时交付人类可读的解析证明与机器可检查的形式化对象，让讨论能够围绕具体推导和验证链展开。

利用 Claude 平台降低成本并提升性能 | Claude by Anthropic

来源：Claude Blog · BestBlogs 评分：91

Claude Blog 将兼顾成本与性能的优化归纳为三类：提高提示词缓存命中率，清理升级模型后仍残留的提示反模式，并按任务难度校准 effort。相应工具包括检查旧提示负担的 prompt-audit、分析整体支出的 cost-optimize，以及搜索模型与 effort 组合的 hillclimb。

缓存读取只在同一模型、前缀逐字节一致且没有超过有效期时成立，动态时间戳、工具定义顺序和会话分叉都可能破坏命中。文中的六个客户支持提示实验人为加入旧配置、冲突规则和强制草稿等反模式，经过一次 prompt-audit 后，平均成本下降 14.6%，准确率提升 5.3%。这些比例属于特定实验，方法重点在找出无效工具调用和重复推理。

降本因此应当从真实评估开始。团队先确认质量基线，再比较缓存、提示结构、effort、模型、批处理和输出长度；如果只把模型切便宜，却没有观察失败样本，账单改善可能掩盖任务质量变化。把成本报告与评估放在一起，才能知道节省来自更少浪费，还是来自少做了必要工作。

AlphaGenome Atlas：90 亿个人类 DNA 变异的分子预测

来源：Google DeepMind News · BestBlogs 评分：90

Google DeepMind 推出 AlphaGenome Atlas，预计算人类基因组约 90 亿种可能单核苷酸变异的分子效应。这个规模对应所有可能的单字母替换组合，不是 90 亿次实验。平台面向学术研究免费开放，让研究者可以按基因、位置或变异查询预测结果。

Atlas 同时提供 AVI 影响分数与特征归因。AVI 结合 AlphaGenome 对基因调控的预测和 AlphaMissense 对蛋白改变的预测，把潜在影响汇总成一个可排序数值，再解释染色质可及性、剪接、基因表达或蛋白变化等特征如何推动分数。它覆盖约占基因组 2% 的编码区和其余 98% 的非编码区。

这些结果是计算预测，官方明确说明未经临床用途验证或批准。它的直接价值在研究决策：先从巨大搜索空间中找出更值得实验验证的变化，再利用特征归因提出可能的分子机制。预测地图由此成为实验优先级工具，而不是诊断结论。

天猫技术大型 AI 项目的研发协同实践

来源：大淘宝技术 · BestBlogs 评分：90

天猫新品 MDI 项目把 AI 研发协同拆成单兵攻坚、加人提速、高速迭代和稳定运作四个阶段。项目横跨 4 类角色端、约 40 个功能模块，一次预发曾同时涉及 8 个仓库和十几个分支，团队需要解决上下文冷启、多人冲突、集成质量和非研发参与四类问题。

单兵期用精简的 AGENTS.md 导航 6 类版本化知识，让 Agent 快速找到业务地图、架构与踩坑记录；加人期借鉴站点地图划分认领范围，并用规格与补丁降低冲突。高速迭代期由技术哨兵机还原预发合并态，寻找跨分支业务逻辑问题；稳定期再用 NekoCollar 的沙箱、真实页面代理和 Git 软硬锁扩大协作范围。

这是一份绑定多仓库、规格驱动与高频迭代场景的团队复盘，可复用的重点是建设顺序：先让知识对人和 Agent 都可见，再把工作边界切清楚，然后验证代码合并后的真实系统，最后让更多角色参与。组织效率由此建立在可复制的上下文和门禁上。

面壁智能开源 MiniCPM5-2B：AA 榜单全球 4B 以下第一，初具端侧通用 Agent 能力

来源：魔搭ModelScope社区 · BestBlogs 评分：90

面壁智能与 OpenBMB 开源 MiniCPM5-2B，以 20 亿参数支持工具调用、深度搜索和代码生成，面向手机、PC、车机和机器人等端侧设备。原文引用 Artificial Analysis Intelligence Index 的 23 分综合成绩，称其在 40 亿参数以下开源基座模型中排名第一，Agentic Index 为 20 分。

这次开放不止包含模型权重，还覆盖 UltraData 数据集、Meshy 强化学习框架和 JustRL II 训练策略。UltraData 用分级治理提高代码、指令与强化学习数据的可验证性；JustRL II 通过筛选奖励数据和引入 Critic 做更细的信用分配；Meshy 把训练、推理与奖励计算建模成对等服务，并支持不同异步程度的训练流程。

榜单名次和基准数字按原文口径理解，端侧通用 Agent 仍需要在具体设备、量化方式和真实任务中复现。完整开放的数据、训练和部署链提供了更有用的检验入口：开发者可以判断这份能力密度能否在自己的资源预算内完成工具调用、搜索与代码任务。

字节跳动质量保障团队｜让 QA 真正用起来：测试用例生成 Agent 落地，我们做对了什么

来源：字节跳动技术团队 · BestBlogs 评分：90

字节跳动质量保障团队将 NL2Test Agent 用于一项边界明确的工作：QA 用自然语言描述测试场景，系统把测试意图转成可运行的回归用例。团队披露，85.4% 的生成用例进入 CI/CD，新增用例平均约 25% 来自 Agent，用户月活率为 30.7%，平均每双周节省约 30 人天。

系统没有让 LLM 包办全部步骤。请求映射和预期结果推断等语义任务交给模型，字段查找、schema 校验、值匹配、请求过滤与断言校验交给确定性程序。生成链被拆成请求识别、依赖分析、参数处理、断言和代码等小任务，每一步输出结构化结果并在进入下一步前检查；流量也先去噪，只保留稳定、业务相关的断言。

这些采用率和节省数据来自已部署业务线的内部统计，适用范围是输入输出清晰、结果可以反复执行和验证的测试转译任务。真正可复用的设计，是让 QA 保留业务判断，让 Agent 承担昂贵的 API 识别与用例编写，再用程序性门禁把整条链稳定跑完。

Milvus HNSW 量化索引选型指南：从 SQ、PQ、PRQ 到 Refine 实测

来源：Zilliz · BestBlogs 评分：90

Zilliz 使用 Cohere 1M 数据集、Milvus 2.6.17 和 PyMilvus 2.6.15，对全精度 HNSW、HNSWSQ、HNSWPQ 与 HNSW_PRQ 做横向测试。文章建议先用 FP32 HNSW 建立无量化参考线，再从未启用 refinement 的 SQ8 开始评估压缩收益。

本次测试中，SQ8 的 Recall@100 为 0.9761，峰值 QPS 为 793.1，加载后容器内存增量约为全精度 HNSW 的 31.3%。ef 扩大图搜索宽度，主要处理候选找不全；refine_k 扩大高精度重排的候选集，主要修正量化距离带来的排序误差。使用 FP32 refinement 可把召回恢复到约 0.988，但内存可能接近或超过全精度基线。

所有结论都绑定当前数据集、版本和参数，容器内存增量也不是单进程的严格 RSS。选型的通用方法因此不是直接追逐最小内存或最高召回，而是先判断瓶颈来自图搜索还是量化误差，再围绕业务需要的召回率、吞吐、延迟和资源预算联合测试。

今日小结

回顾今天的内容，Images 2.5 把图像生成推进到更连续的创作流程，Grok Bot 把 Agent 产品的尺度放在完整任务能否反复交付，Claude Managed Agents 的案例则补上结果验收、分层记忆、沙箱与成本取舍。七条速览从数学、生命科学和工程现场说明，同一种能力只有经过可检查的证据与明确约束，才容易进入稳定工作。

如果时间有限，做 AI 产品可以先读 Grok Bot 与 Managed Agents，观察委托体验和基础设施如何配合；关心模型与研究工具，可以从 Images 2.5、Navier–Stokes 和 AlphaGenome 开始；工程团队则可继续看天猫、字节与 Milvus，分别对应协作、自动化和资源选型。

也欢迎分享你的实践：用户把任务交给 Agent 前，最需要看见的是权限、进度还是结果验收？当托管基础设施帮助团队更快上线后，你会用哪些评估与成本信号判断何时增加自建比例？

👉 近期早报

• BestBlogs 早报 · 2026-09-08

• BestBlogs 早报 · 2026-09-07

• BestBlogs 早报 · 2026-09-06

• BestBlogs.dev 第 111 期：经验复利

• BestBlogs.dev 第 110 期：新的稀缺

• BestBlogs.dev 第 109 期：程序员的职业未来

BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
