BestBlogs 早报 · 09-17
全双工语音 / GKE Agent 基座 / Claude CRM 协同 / StepAudio 3 / Pinterest Manas
[1] ★ 精讲|你的语音智能体还只是对讲机 — Neil Zeghidour,Gradium [视频] Gradium 负责人从语音交互的演进解释全双工为何关键:现有语音模型多在听与说之间轮换,难以处理附和与重叠表达。团队主张让轻量语音界面负责自然对话,将推理和工具调用交给后台文本模型,借此平衡实时感、智能能力与部署成本。 来源:AI Engineer https://www.bestblogs.dev/video/2b92228de
[2] ★ 精讲|Agent Substrate 现已在 GKE 上可用 Google 推出可运行于 GKE 的开源 Agent Substrate,把智能体执行环境与机器管理拆开:运行时以微型虚拟机或 gVisor 隔离代码,并通过网络网关约束访问。它会在空闲时保存沙箱状态、释放算力,再按需恢复;文章的重点是为大量长生命周期智能体兼顾安全、低延迟和资源利用。 来源:Google Cloud Blog https://www.bestblogs.dev/article/463647d8e7
[3] ★ 精讲|Salesforce 接入 Claude:销售与客服工作流 Anthropic 与 Salesforce 发布测试版插件,让销售人员在既有权限内把账户、商机和销售管道带入 Claude。它可汇集 CRM、邮件和 Slack 的会前信息,生成跟进内容并提出记录更新;写入 Salesforce 前仍由销售人员确认,适合观察权限边界与人工审批如何落地。 来源:Claude Blog https://www.bestblogs.dev/article/eb8eacc54d
[4] 阶跃发布语音大模型 StepAudio 3,拿下多个全球第一! 阶跃星辰发布 StepAudio 3 系列模型,包括实时交互、语音识别、文本转语音、音频生成和音乐创作,其中多款模型在 Artificial Analysis 榜单中位列全球第一,展现出在内容理解、实时交互和音频创作方面的领先能力。 来源:阶跃星辰 https://www.bestblogs.dev/article/b8fd34b315
[5] 从内存饥渴的 HNSW 到量化 SPANN:Pinterest Manas 平台的技术演进 Pinterest 的 Manas 搜索平台通过对 HNSW 和 IVF 索引应用标量量化与乘积量化、转向基于 SSD 的 SPANN 服务,并试点多向量后期交互检索,大幅削减了内存成本。 来源:InfoQ https://www.bestblogs.dev/article/855a2c123e
[6] 无问芯穹联合清华、上交正式开源具身端侧推理引擎 APXInf,Pi 0.5 性能 SOTA 无问芯穹开源具身端侧推理引擎 APXInf,凭借 Rust 运行时与 FP8 量化实现 Jetson Thor 26 ms 延迟、38.46 Hz 频率,兼顾性能、稳定与快速模型接入。 来源:量子位 https://www.bestblogs.dev/article/3cb4b7c1f2
[7] 用 1393 个 Agent 重构 Hermes 代码库:削减 34.4% 的实践复盘 Nous Research 让开源 Agent Hermes 重构自身代码库,派出 1393 个子 Agent,将超百万行非测试 Python 代码削减 34.4%,并公开了编排、验证与故障恢复的完整机制。 来源:meng shao(@shao__meng) https://www.bestblogs.dev/status/2100034501909065938
[8] 1300 万天压到 0.25 秒!分子之心用 AI 把化学反应拍成电影,成果登 Science 子刊 分子之心自研反应性机器学习力场 QuantaMind 以接近 DFT 的精度和经典分子动力学的速度,在万原子级体系上完整模拟酶催化循环,将十万原子反应体系单步耗时从千万天量级压缩到 0.25 秒,成果登上 Science Advances。 来源:新智元 https://www.bestblogs.dev/article/50532680a2
[9] Claude for Small Business:新工作流、集成与培训 Claude for Small Business 扩展了其服务,包括 43 个工作流和 27 个与热门商务工具的新集成,使小型企业主能够自动化后台任务并推动增长。此次更新还引入了一系列免费的现场研讨会和合作伙伴网络研讨会,帮助用户上手使用新功能。 来源:Claude Blog https://www.bestblogs.dev/article/a3cc242fd0
[10] 语音智能体不只会说话:Charlie Guo 谈三种可混用模式与原生实时音频 | OpenAI [视频] OpenAI 开发者体验负责人 Charlie Guo 指出语音智能体不必口头回复,梳理可混用的语音到语音、语音到动作与事件到语音三种模式,并说明原生实时音频与 GPT Realtime 2 如何解锁更丰富、更可及的产品。 来源:AI Engineer https://www.bestblogs.dev/video/1ed642adc
--- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-17