# 阶跃星辰发布 StepAudio 3 系列语音大模型，含 Realtime、ASR、TTS、Gen、Music 五款

- 来源：IT之家（RSS）
- 发布时间：2026-09-15 15:45
- AIHOT 分数：61
- AIHOT 链接：https://aihot.news/items/cmu2eo3z202zgropyt4mksr3i
- 原文链接：https://www.ithome.com/1/002/602.htm

## AI 摘要

阶跃星辰发布 StepAudio 3 系列语音模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，均已上线阶跃星辰开放平台。

## 正文

IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。

官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。

IT之家附模型官方详细介绍如下：

StepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动

今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。

StepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。

在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。

与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。

模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。

面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。

不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。

这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。

StepAudio 3 ASR：从听清，到听懂

传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。

StepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。

它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。

模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。

这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。

StepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。

StepAudio 3 TTS：不止朗读，更像真人表达

声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。

StepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。

模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。

同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。

StepAudio 3 Gen：人声、音效、环境、音乐，一次生成

传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。

StepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。

它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。

更重要的是，这些声音并不是简单叠加。

StepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。

这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。

对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。

StepAudio 3 Music：不止生成，更参与创作

音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。

StepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。

模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。

与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。

模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。

尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。

一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。

这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。
