豆包手机助手消费者版 9 月 14 日正式发布,主打稳定性与交互体验,支持 AI 键(带指纹鉴权)、语音唤醒、屏幕问答、本地数据搜索和接入飞书妙记的录音体验。Beta 形式开放操作手机功能,并推出屏幕自动化操作声明协议 SAEP,第三方应用可声明允许或拒绝 AI 自动化操作,同步启动 30 天规则公示。首个消费者版将搭载于努比亚 NaviX Ultra,9 月 16 日发售。
另有 2 家信源报道IT之家(RSS)公众号:豆包(字节)豆包手机助手消费者版 9 月 14 日正式发布,主打稳定性与交互体验,支持 AI 键(带指纹鉴权)、语音唤醒、屏幕问答、本地数据搜索和接入飞书妙记的录音体验。Beta 形式开放操作手机功能,并推出屏幕自动化操作声明协议 SAEP,第三方应用可声明允许或拒绝 AI 自动化操作,同步启动 30 天规则公示。首个消费者版将搭载于努比亚 NaviX Ultra,9 月 16 日发售。
另有 2 家信源报道IT之家(RSS)公众号:豆包(字节)ElevenLabs 为 ElevenMusic 发布 Music v2.5,称生成歌曲更饱满自然;在 47,885 组盲测对比中听众多数时候更偏好 v2.5,尤其是 R&B、Soul、Hip-Hop、Rock 和管弦乐。
GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的来回对话体验带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合工作。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音服务,一个 API key 可调用多家供应商的 TTS 模型。
小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。
GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的来回对话体验带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合使用。
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》OpenAI 宣布 GPT-Live-1 上线 API,支持全双工对话、处理打断与背景噪声,可用于电话语音智能体,并将语音理解与输出整合在同一模型中以降低延迟。
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的你来我往带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合工作。
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that liste...
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that liste...
GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的你来我往带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合使用。
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,支持全双工同时听和说,价格为每分钟 $0.05。相比 GPT-Realtime-2.1,其全双工交互测试得分 80.1% 对 45.4%,轮次延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%,银行语音支持基准通过率从 12.4% 升至 32%。
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。
另有 3 家信源报道X:Testing Catalog (@testingcatalog)X:洪明 (@hongming731)X:Tibo (@thsottiaux)Apple 在 Apple Watch Series 12 和 Ultra 4 上推出 Audio Intelligence 功能 Siri Recaps,可总结一天中的对话,用户可按计划或在 Smart Stack 顶部开关。
另有 2 家信源报道The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)作者实测网易有道新上线的语音输入法叭哥说,与 Typeless、豆包输入法、闪电说横向对比。叭哥说采用双模型分工,E2E 平均 1683ms、P95 2134ms,并支持小声拾音、个人词典即刻生效和多语言翻译等功能。
OpenAI 语音产品负责人 Atty Eleti 宣布 ChatGPT 语音模式可自由选择模型和推理深度,Pro 套餐可调用 GPT-5.6 Sol 或 GPT-6 Astra,语音模式在需要搜索或复杂推理时自动调用指定模型。
Suno 发布 v6 AI 音乐模型,是首个获得唱片业支持的版本,训练数据包含来自 Warner Music Group、BMG 和 Believe 的授权内容及用户数据。
🌌 ChatGPT Voice can now use GPT-5.6 Sol and GPT-6 Astra We’re updating how intelligence works in voice. Now, you can se...
苹果发布 AirPods 5,开放耳设计中 ANC 噪声消除量比 AirPods 4 with ANC 提升最多 50%,配备新的 multiport 声学架构和下一代 Adaptive EQ。
欧洲 AI 实验室 Desert Ant Labs 正式成立并上线首批 18 个端侧专用模型(12 个稳定版、6 个 beta),覆盖音频、视觉和文本任务,通过 Swift、Kotlin 和 JavaScript 的统一 SDK 提供,在 GitHub 和 Hugging Face 开放。
巴黎语音 AI 公司 Gradium(从 Kyutai 研究实验室分拆)推出 Voice Design,输入 1 到 500 字符的描述即可在 3 到 5 秒内生成 1 到 5 个候选语音,无需参考音频,支持英法西葡德 5 种语言,已在 Gradium API 和 Studio 全部套餐免费开放。
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将音频切分为 80 毫秒块,通过强化学习为每个词动态调整等待时间,并内置说话人区分(可同时区分 20 人以上)和句界检测。
谷歌于 9 月 5 日宣布在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,可生成含数段副歌、桥段等数分钟完整歌曲,用户可通过 gemini.google.com/music 网站和应用使用。
Voice is now available in your existing Codex threads. Talk through a PR with the agent that wrote it, debate the archit...
Ugreen 在 IFA 展会发布 HomeAgent 智能家居平台,将 NAS、监控 NVR 和端侧 AI 整合到一个中枢中,由语音助手 Uliya 管理,宣称数据全部本地处理、无月费。
人人影视更名为“人人影视分享精彩”,App 已在安卓端上线、iOS 端筹备完成,运营方为分享精彩网络科技(嘉兴)有限公司,负责人李渊敏称本月起点对点推广、力争激活 3000 万存量用户。平台依托 7 万余集影视素材样本打造 AI 影视本地化技术,实现角色音色克隆,计划覆盖 50 余个国家和地区,优先面向东南亚输出国产影视内容,片源与华数传媒合作正版购买,目前处于前期公测、月底正式发布。
微软 9 月 3 日发布语音转文字模型 MAI-Transcribe-2,称其是自家最快、最准确、最便宜的转录模型,支持 60 种语言。
#7 globally. #1 open multilingual ASR model. Hojo-ASR-Multi-V1 is officially live on the Open ASR Leaderboard. With an a...
Google 开始向全球移动端推出 Gmail Live、Docs Live 和 Keep Live 三项 AI 语音功能,支持免手操作查询信息、总结和转录。Gmail Live 可从收件箱口头回答问题并附邮件来源链接,Docs Live 能把口述需求整理成结构化文档并可在授权后调用 Gmail、Drive、Chat 和网页信息,Keep Live 支持自然语言记录笔记。
Microsoft AI 官方博客宣布发布 MAI-Transcribe-2 语音识别模型,称其为速度最快、准确度最高且价格最低的语音识别模型。原文未提供正文细节。
另有 2 家信源报道X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)X:Testing Catalog (@testingcatalog)