Topic · 主题全部主题 →

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

1,316条收录
135条精选

精选归档 · 第 6 页

101120 条 · 共 135

5月2日5月2日周六

星期六 · 1 条
00:00
Sierra:Blog(RSS)精选
AI 评分 64/100
τ-voice 发布:面向真实客服场景的实时语音智能体评测基准

τ-voice 是一个针对实时语音智能体的新基准,包含零售、航空和电信领域的 278 项接地气客服任务。该基准将确定性端到端任务评分与可控的真实音频(多样角色、环境噪音、自由轮次切换)相结合。


推荐理由:我觉得这是目前最接近真实客服场景的语音agent基准,278个任务覆盖零售、航空、电信,可控噪声和口音,做语音agent的团队可以直接拿来评测。

5月1日5月1日周五

星期五 · 1 条
11:20
xAI:News(网页)精选
AI 评分 60/100
自定义语音与语音库

xAI于2026年4月30日推出自定义语音和语音库功能。用户可通过约1分钟录音快速克隆声音,并在Grok文本转语音及语音代理API中即时使用,整个过程仅需2分钟。语音库提供集中管理平台,内置语音已超80种,支持28种语言。为确保安全,系统采用两阶段验证,包括实时转录匹配和说话人嵌入确认,以防止未经授权的克隆。这些功能适用于品牌代理、内容创作、无障碍辅助、多语言团队及游戏娱乐等多种场景,且使用自定义语音无需额外费用。


推荐理由:xAI 这波‘声音克隆+管理’的更新很实用,安全验证做得细,创作品类和品牌方应该会喜欢,对开发者来说是个加分项,但不是那种能改变格局的大招。

4月28日4月28日周二

星期二 · 1 条
22:39
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
Microsoft VibeVoice:开源前沿语音人工智能

微软开源了前沿语音人工智能项目VibeVoice,该项目已在GitHub上发布。VibeVoice能够生成高度自然、富有表现力的语音,支持多种语言和情感语调,显著提升了合成语音的真实感与感染力。其开源策略旨在推动语音AI领域的协作与创新,降低开发门槛。该项目在技术社区获得关注,在Hacker News上获得了103个投票点数。


推荐理由:微软把前沿语音模型直接开源放 GitHub,对做语音产品的团队来说是真金白银的基建降本,不用再从零训一个了。

4月24日4月24日周五

星期五 · 2 条
06:31
xAI:News(网页)精选
AI 评分 75/100
Grok Voice Think Fast 1.0:xAI发布旗舰语音模型,专为复杂工作流设计

xAI发布旗舰语音模型Grok Voice Think Fast 1.0,专为客服、销售等领域的复杂多步骤工作流打造。该模型在τ-voice Bench全双工语音排行榜位列第一,能在电话音频、噪音、口音及频繁打断等真实苛刻条件下稳定运行,并原生支持25种以上语言。其核心优势包括精准的数据录入与复述、实时后台推理不增加延迟,并能通过思考避免错误回答。目前该模型已应用于Starlink的销售与客服,实现了20%的电话销售转化率和70%的客服自主解决率,能跨数百个工作流调用28种工具处理硬件故障排查、换货等高风险任务。


推荐理由:xAI 的语音代理不再只是实验,Starlink 实测 20% 销售转化率说明它已经能扛真实业务,语音模型进入可用阶段,做客服和销售自动化的团队该试一下。
01:53
公众号:小米 MiMo精选
AI 评分 83/100
小米发布 MiMo-V2.5-TTS 系列与 ASR,覆盖语音合成与识别

小米正式发布 MiMo-V2.5-TTS Series 与 MiMo-V2.5-ASR,覆盖语音识别与合成两大能力。TTS 系列含三款模型,支持风格指令遵循与音频标签控制,其中 VoiceDesign 可零参考音频生成新音色,VoiceClone 仅需数秒参考音频即可复刻音色;ASR 在中英双语、中文方言、强噪音等场景达业界领先水平。


推荐理由:把角色演出指令从参数模板简化为导演笔记式的自然语言,对有声剧和游戏NPC等依赖声音塑造的场景,定制成本与表现自由度可能同时改善。

4月23日4月23日周四

星期四 · 2 条
09:08
IT之家(RSS)精选
AI 评分 74/100
谷歌确认基于 Gemini AI 的苹果新版 Siri 今年亮相

谷歌云首席执行官在谷歌Cloud Next 26大会上确认,基于Gemini AI技术构建的新一代苹果Siri将于2026年发布。双方合作源于2026年1月签署的多年期协议,谷歌作为首选云服务商提供核心技术支持。该交易年价值约10亿美元,协议严格限制谷歌接触用户数据以保障隐私。技术层面,苹果正通过知识蒸馏将大型Gemini模型精简为可在iPhone等设备端运行的版本,旨在降低云端依赖并提升响应速度。


推荐理由:苹果终于把 Siri 大脑换成了 Gemini,每年 10 亿美金的合作不是小打小闹,这代 Siri 可能真的会变聪明。但落地得等一年,做端侧部署的可以盯一下苹果的蒸馏方案。
00:05
公众号:小米 MiMo精选
AI 评分 79/100
Xiaomi MiMo-V2.5 系列大模型开启公测

Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。


推荐理由:在自主完成编译器构建和视频编辑器开发的长程任务演示中,展示了结构化的逐层搭建和自我修正能力,其效率对比数据有助于判断复杂Agent任务的成本边界。

4月18日4月18日周六

星期六 · 1 条
08:34
xAI:News(网页)精选
AI 评分 72/100
Grok语音转文本与文本转语音API发布

xAI发布Grok语音转文本(STT)与文本转语音(TTS)两款独立API,采用与Grok Voice、Tesla及Starlink相同技术栈。STT支持批量(0.10美元/小时)与实时流式(0.20美元/小时)转录,电话实体识别词错率仅5.0%,整体6.9%,优于竞品,支持25种以上语言及说话人分离。TTS定价4.20美元/百万字符,可通过[laugh]等标签精细控制情感语调。

另有 1 家信源报道X:cb_doge (@cb_doge)
推荐理由:xAI 把 Grok 的语音能力拆成独立 API 放出,STT 在实体识别上碾压几个老牌竞品,定价也不算贵,做语音 agent 的可以直接加进方案里对比。

4月17日4月17日周五

星期五 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 81/100
Qwen3.5-Omni技术报告

阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。


推荐理由:Qwen3.5-Omni把语音、视频、文本全模态做到一个模型里,且在215项音频任务上超越Gemini 3.1 Pro,这是国内团队在全模态模型上的里程碑,做交互产品的值得关注。

4月16日4月16日周四

星期四 · 1 条
00:07
Google Blog:AI(RSS)精选
AI 评分 70/100
Gemini 3.1 Flash TTS:下一代表现力AI语音技术

Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

另有 5 家信源报道Google DeepMind:Blog(RSS)X:Google DeepMind (@GoogleDeepMind)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)X:Artificial Analysis (@ArtificialAnlys)
推荐理由:Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

4月13日4月13日周一

星期一 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
Audio Flamingo Next:面向语音、声音与音乐的下一代开源音频-语言模型

Audio Flamingo 系列发布下一代模型 AF-Next,支持长达 30 分钟的复杂音频输入,并引入 Temporal Audio Chain-of-Thought 技术,将中间推理步骤显式对应到时间戳。该模型基于超过 100 万小时的新增数据进行课程式训练,在 20 个音频理解与推理基准测试中显著超越同规模开源模型,部分指标超过更大规模的闭源模型。团队同步开源了 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner 三个变体。


推荐理由:NVIDIA 开源的这个音频大模型在 20 多个基准上大幅超越前代,长音频理解尤其凶猛,做语音、音乐和声音应用的值得把论文翻一遍。

3月30日3月30日周一

星期一 · 1 条
11:25
美团 LongCat:HuggingFace 新模型精选
LongCat-AudioDiT-1B:高保真波形潜空间扩散式文本转语音模型

美团 LongCat 团队开源的扩散式 TTS 模型摒弃传统的 mel-spectrogram 中间表示,直接在波形潜空间操作,仅通过 Wav-VAE 与扩散骨干网络即可合成语音。该模型修复了训练-推理不匹配问题,并以自适应投影引导替代无分类器引导。最大版本 3.5B 在 Seed 基准实现 SOTA 零样本语音克隆,说话人相似度(SIM)在 Seed-ZH 达 0.818、Seed-Hard 达 0.797,超越此前最优的 Seed-TTS。研究还发现 Wav-VAE 的重建保真度与最终合成质量并非正相关。

另有 1 家信源报道美团 LongCat:HuggingFace 新模型
推荐理由:美团开源 1B 语音克隆模型,Seed 基准超 Seed-TTS,零样本推理可用

3月26日3月26日周四

星期四 · 4 条
23:21