Zyphra 发布 Zonos-v0.1 beta 开源 TTS 模型
Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。
推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。
推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中文方言和英文,在公开普通话 ASR 基准上取得 SOTA,并具备歌词识别能力。
推荐理由:原文给出两个模型变体的架构差异和公开基准 CER/WER 对比数字,读者可据此评估选型。
通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。
推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。
SenseVoice 是一个语音理解基础模型,支持 ASR、语种识别、语音情感识别和音频事件检测。发布的 SenseVoiceSmall 检查点支持普通话、粤语、英语、日语和韩语,并输出情感与事件标签;采用非自回归端到端架构,同参数量级下推理速度比 Whisper-Small 快 5 倍以上、比 Whisper-Large 快 15 倍以上。
推荐理由:官方仓库文档同时给出基准对比、部署路径和微调方案,读者可以据此评估 SenseVoice 在中英文语音识别场景的可用性。
Suno 发布 Audio Inputs 功能,所有 Pro 和 Premier 用户可上传或录制 6-60 秒的音频片段,通过“Extend”模式选择起始时间戳、设定风格,并可添加歌词来创作歌曲。社区创作者已用其提供自定义音频引子来设定氛围、节奏和乐器灵感。该功能会阻止受版权保护作品的上传,且所有包含人声的输入将保持私密并不可搜索。
推荐理由:Suno 把上传录音做歌的门槛降到极低,对音乐创作者和普通用户都友好,只是这已经是前年的更新,之后的同类功能可能更完善。
OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。
推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略