该来源未收录可展示正文,站内仅提供摘要。
阅读原文(在新标签页打开)FireRedTeam 开源 FireRedAudio 9B 通用音频语言模型
AI 导读
FireRedTeam 发布 FireRedAudio 的代码与模型,一个基于 9B 参数 LLM 的通用音频语言模型,采用理解与生成解耦的连续表征设计。单模型支持 ASR、音频理解、零样本 TTS、指令 TTS、语义与声学语音编辑,以及最长一小时录音的时序定位理解,在 MMAU、Seed-TTS-Eval 等基准上取得竞争性或领先结果。
FireRedTeam:原创语音与多模态项目
精选
63
AI 编辑部评分,满分 100FireRedTeam 开源 FireRedAudio 9B 通用音频语言模型
FireRedTeam 发布 FireRedAudio 的代码与模型,一个基于 9B 参数 LLM 的通用音频语言模型,采用理解与生成解耦的连续表征设计。单模型支持 ASR、音频理解、零样本 TTS、指令 TTS、语义与声学语音编辑,以及最长一小时录音的时序定位理解,在 MMAU、Seed-TTS-Eval 等基准上取得竞争性或领先结果。
推荐理由
官方发布了代码和权重,读者可以据此了解用一个 9B 骨干同时覆盖语音理解与生成的解耦表征设计。
来源:FireRedTeam:原创语音与多模态项目· github.com