# Qwen 发布 Qwen-Audio-3.1 全家桶，ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next

- 来源：Qwen (@Alibaba_Qwen)
- 发布时间：2026-09-23 17:11
- AIHOT 分数：67
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmudwte2x0aqtroghe1b5cxfd
- 原文链接：https://x.com/Alibaba_Qwen/status/2102687258990026993

## 精选理由

官方一次性给出五个音频模型的能力细节和三档降价幅度，读者可对照自身场景评估替换成本。

## AI 摘要

Qwen 发布 Qwen-Audio-3.1，ASR、TTS 与 Realtime 全面升级，并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next，共五个模型覆盖理解、生成、交互与创作。全线降价，TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off；Realtime 可边说边听、随时打断，检测到低落情绪时会放慢语速并共情回应。

## 正文

⚡ 认识一下 Qwen-Audio-3.1！ASR、TTS 和 Realtime 全面升级，同时加入两款新模型：用于音频创作的 TTS-Next 和用于音频理解的 ASR-Next。

五款模型，一套完整的音频技术栈：理解、生成、交互与创作。

此外，全系产品大幅降价：TTS 约降 70%，Realtime 约降 85%，ASR 最高降 95%。

亮点：🥳 - ASR：更强的多语言与方言识别能力，并支持原生润色，可自动去除填充词与重复内容，输出更干净、更有逻辑的转写文本。 - ASR-Next：支持带说话人标签、时间戳与对齐转写文本的多说话人 ASR，并能理解情绪、环境音与机器声，实现声音描述、事件定位、音频问答与推理。 - TTS：多语言与方言合成，支持自然的跨语言音色迁移；通过简单指令即可控制情绪、语速与风格。 - TTS-Next：统一的 LM + 扩散模型框架，一次生成即可产出人声、音效与背景音频，适用于有声书、播客、游戏与广告。 - Realtime：可同时说与听，支持随时打断，就像真实通话一样；它甚至能在感知到情绪低落时放慢语速并给予富有同理心的回应。

释放 Qwen-Audio-3.1 的全部潜力！👇 - 博客：https://fun-resource-shanghai.oss-cn-shanghai.aliyuncs.com/cuijiayan.cjy/tmp/exp/qwen_audio_3_tts_blog_review_260918/index.shtml?Expires=2105366399&OSSAccessKeyId=LTAI5tQrCBwj82sVMCWoSmzE&Signature=9ZaZIEahoN41Zb9MFJjf34G%2BSCM%3D - Qwen-Audio-3.1-ASR： https://www.qwencloud.com/models/qwen-audio-3.1-asr-flash-filetrans - Qwen-Audio-3.1-Realtime： https://www.qwencloud.com/models/qwen-audio-3.1-realtime-plus - 更多 API：即将推出 @qwen_cloud
