BestBlogs 早报:开放权重模型与 Agent 记忆治理

ginobefun · @hongming731 · X·2026-09-12 07:21·55分钟前
AI 导读

BestBlogs 09-12 早报汇集 10 条 AI 内容:The Pragmatic Engineer 汇总 Uber、Pinterest、AT&T 实践,Uber 通过开放权重模型、模型路由和持续基准测试将单次 AI 请求成本降 34%、单次会话成本降 52%。

ginobefun@hongming731
38AI 编辑部评分,满分 100

BestBlogs 早报:开放权重模型与 Agent 记忆治理

2026-09-12 07:21· 55分钟前
AI 导读

BestBlogs 09-12 早报汇集 10 条 AI 内容:The Pragmatic Engineer 汇总 Uber、Pinterest、AT&T 实践,Uber 通过开放权重模型、模型路由和持续基准测试将单次 AI 请求成本降 34%、单次会话成本降 52%。

BestBlogs 早报 · 09-12

开放权重模型 / HL-Mem / B 端需求协作 / 模型路由 / 记忆治理

[1] ★ 精讲|The Pulse:科技公司转向开放 AI 模型 The Pragmatic Engineer 汇集 Uber、Pinterest 与 AT&T 的一线实践:通过开放权重模型、模型路由和持续基准测试,Uber 将单次 AI 请求成本降 34%、单次会话成本降 52%。文章的价值在于把模型选型从偏好之争落到真实任务、质量与成本的持续测量,也提醒团队为复杂任务保留前沿模型。 来源:The Pragmatic Engineer https://www.bestblogs.dev/article/8f1bc2c337

[2] ★ 精讲|让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍 来自淘天直播 AIGC 团队的 HL-Mem 实践,将长期记忆设计为可治理的认知系统:不可变 Event 保存证据,Claim 可被新信息修正,并以有效时间和记录时间解释历史。它还把去重、来源准入、衰减和显式遗忘放进默认链路,为需要中文检索和本地部署的 Agent 提供了一套具体取舍。 来源:大淘宝技术 https://www.bestblogs.dev/article/b742f07f15

[3] ★ 精讲|AI 使用心得:B 端产品工作中的方法、边界与实践 京东技术的 B 端实战将 34 个人日的需求工作压缩至 15 个人日,并把经验归纳为背景输入、AI 反问、Skill 初稿和人工复核的循环。文中用支付、收银和接口对接案例说明:AI 擅长整理、暴露遗漏与生成可讨论版本;流程边界、异常规则和最终责任仍须由人确认。 来源:京东技术 https://www.bestblogs.dev/article/25453dd390

[4] AI 研究者讨论递归自我改进究竟有多近 [视频] Dwarkesh Patel、Beren Millidge、John Schulman 与 Charlie O’Neill 讨论扩展、强化学习和研究自动化能否带来递归自我改进,并拆解可能阻断它的泛化、评估和现实学习瓶颈。 来源:Dwarkesh Patel https://www.bestblogs.dev/video/2794a8f13

[5] Google 发布多智能体最佳实践 Google Research、DeepMind 与 MIT 联合研究用 260 个受控配置证明,多智能体效果取决于任务结构是否适合分工,而非模型强弱,并给出三条可查询判据与智能体数量最优值约束。 来源:Datawhale https://www.bestblogs.dev/article/18c7051871

[6] 快速扩展在线存储以服务超过 10 亿 ChatGPT 用户 OpenAI 工程团队解释了他们如何将基于 Python 的在线存储平台 Habitat 从一个简单的客户端库,扩展为一个处理每秒超过 70M 次请求、存储超过 500PB 数据,并为超过 10 亿周活跃 ChatGPT 用户提供服务的分布式系统。 来源:OpenAI News https://www.bestblogs.dev/article/d10d742de8

[7] 衡量 AI 在情报定位与常规武器领域的能力 Anthropic 前沿红队构建的评估显示,前沿模型在照片地理定位、账号关联等情报定位任务上已匹配或超越人类专家,并能编写无人机制导软件;开放权重模型虽落后,但能力仍令人担忧。 来源:Anthropic Research https://www.bestblogs.dev/article/93aba83998

[8] 推出面向金融服务的 ChatGPT OpenAI 推出面向金融服务的 ChatGPT,集成内置金融数据、公司专属模板与 GPT-6 Astra 推理能力,为金融机构自动化研究、财务建模和客户交付物。 来源:OpenAI News https://www.bestblogs.dev/article/0b4d3e94ae

[9] 如何构建自评估 AI 系统:用于 LLM 应用的自动化测试和评估管道 本文介绍了如何构建一个三层评估管道——确定性检查、LLM-as-judge 评分和定期人工审查——来可靠地测试和监控 LLM 应用,包括回归测试和统计显著性分析。 来源:freeCodeCamp https://www.bestblogs.dev/article/56aa044175

[10] 2 分钟到 20 秒!AI Agent 让工单处理可提效 9 倍 基于 AI Agent 的智能诊断系统通过配置驱动的并发取数、规则+LLM 双通道标签、分层决策 Trace 与 SSE 实时推送,将工单处理时间从 2-3 分钟压缩到 20-40 秒,实现 3-9× 提效。 来源:腾讯云开发者 https://www.bestblogs.dev/article/6dfb071cd5

--- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-12

ginobefunhttps://x.com/i/article/2098551131312099328

来源:ginobefun· x.com