Qwen 发布 Qwen-Audio-3.1 全家桶,ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next

Qwen · @Alibaba_Qwen · X·2026-09-23 17:11·31分钟前
AI 导读

Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应。

Qwen@Alibaba_Qwen
精选
67AI 编辑部评分,满分 100

Qwen 发布 Qwen-Audio-3.1 全家桶,ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next

2026-09-23 17:11· 31分钟前
AI 导读

Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应。

推荐理由

官方一次性给出五个音频模型的能力细节和三档降价幅度,读者可对照自身场景评估替换成本。

正文 · AI 翻译

⚡ 认识一下 Qwen-Audio-3.1!ASR、TTS 和 Realtime 全面升级,同时加入两款新模型:用于音频创作的 TTS-Next 和用于音频理解的 ASR-Next。

五款模型,一套完整的音频技术栈:理解、生成、交互与创作。

此外,全系产品大幅降价:TTS 约降 70%,Realtime 约降 85%,ASR 最高降 95%。

亮点:🥳 - ASR:更强的多语言与方言识别能力,并支持原生润色,可自动去除填充词与重复内容,输出更干净、更有逻辑的转写文本。 - ASR-Next:支持带说话人标签、时间戳与对齐转写文本的多说话人 ASR,并能理解情绪、环境音与机器声,实现声音描述、事件定位、音频问答与推理。 - TTS:多语言与方言合成,支持自然的跨语言音色迁移;通过简单指令即可控制情绪、语速与风格。 - TTS-Next:统一的 LM + 扩散模型框架,一次生成即可产出人声、音效与背景音频,适用于有声书、播客、游戏与广告。 - Realtime:可同时说与听,支持随时打断,就像真实通话一样;它甚至能在感知到情绪低落时放慢语速并给予富有同理心的回应。

释放 Qwen-Audio-3.1 的全部潜力!👇 - 博客:https://fun-resource-shanghai.oss-cn-shanghai.aliyuncs.com/cuijiayan.cjy/tmp/exp/qwen_audio_3_tts_blog_review_260918/index.shtml?Expires=2105366399&OSSAccessKeyId=LTAI5tQrCBwj82sVMCWoSmzE&Signature=9ZaZIEahoN41Zb9MFJjf34G%2BSCM%3D - Qwen-Audio-3.1-ASR: https://www.qwencloud.com/models/qwen-audio-3.1-asr-flash-filetrans - Qwen-Audio-3.1-Realtime: https://www.qwencloud.com/models/qwen-audio-3.1-realtime-plus - 更多 API:即将推出 @qwen_cloud