跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

1,422条收录186条精选最近更新 相关主题多模态AI 视频产品更新

精选归档 · 第 10 页

第 181–186 条 · 共 186 条
2月10日周一
  1. Zyphra Research(网页)71

    Zyphra 发布 Zonos-v0.1 beta 开源 TTS 模型

    Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。

    推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。

1月24日周五
7月3日周三
  1. 通义 QwenAudio:原创语音项目62

    FunAudioLLM 发布 Fun-CosyVoice 3.0 开源语音合成模型

    通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。

    推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。

  2. 通义 QwenAudio:原创语音项目61

    SenseVoice 开源语音理解模型仓库:支持 ASR、情感识别与音频事件检测

    SenseVoice 是一个语音理解基础模型,支持 ASR、语种识别、语音情感识别和音频事件检测。发布的 SenseVoiceSmall 检查点支持普通话、粤语、英语、日语和韩语,并输出情感与事件标签;采用非自回归端到端架构,同参数量级下推理速度比 Whisper-Small 快 5 倍以上、比 Whisper-Large 快 15 倍以上。

    推荐理由:官方仓库文档同时给出基准对比、部署路径和微调方案,读者可以据此评估 SenseVoice 在中英文语音识别场景的可用性。

6月12日周三
  1. Suno:Blog(网页)55

    Audio Inputs——通过 Mikey Shulman(联合创始人兼 CEO)发布·2024 年 6 月 12 日,用任何声音创作一首歌 产品更新

    Suno 发布 Audio Inputs 功能,所有 Pro 和 Premier 用户可上传或录制 6-60 秒的音频片段,通过“Extend”模式选择起始时间戳、设定风格,并可添加歌词来创作歌曲。社区创作者已用其提供自定义音频引子来设定氛围、节奏和乐器灵感。该功能会阻止受版权保护作品的上传,且所有包含人声的输入将保持私密并不可搜索。

    推荐理由:Suno 把上传录音做歌的门槛降到极低,对音乐创作者和普通用户都友好,只是这已经是前年的更新,之后的同类功能可能更完善。

5月14日周二
  1. Sam Altman:Blog(RSS)

    GPT-4o

    OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。

    推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略