inclusionAI发布MingTok-Audio:首个统一连续语音分词器

蚂蚁 inclusionAI:GitHub 新仓库·2025-09-29 11:19·358天前·inclusionAI
AI 导读

inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。

蚂蚁 inclusionAI:GitHub 新仓库
精选
57AI 编辑部评分,满分 100

inclusionAI发布MingTok-Audio:首个统一连续语音分词器

2025-09-29 11:19· 358天前· inclusionAI
AI 导读

inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。

推荐理由

蚂蚁把语音 tokenizer 做到了 PESQ 4.2 的离谱分数,比第二名翻了快一倍,做语音理解和生成的团队值得拿这个当新 baseline 跑一下。

正文 · AI 翻译

📝技术报告 📖项目主页 |🤗 Hugging Face| 🤖 ModelScope

架构

MingTok-Audio

核心特性

  • 🚀 首个统一连续语音 Tokenizer:首个有效融合语义与声学特征的连续音频 Tokenizer,同时适用于理解与生成任务。
  • 🎧 高质量重建:通过使用 VAE 对连续特征建模,实现高质量音频生成,最大限度减少信息损失并保留精细的声学纹理。
  • 🌐 无卷积高效设计:基于纯因果 Transformer 架构构建,完全去除卷积层,带来更卓越的效率与更简洁的设计。

安装

pip install -r requirements.txt

快速开始

import torch
import torchaudio

from audio_tokenizer.modeling_audio_vae import AudioVAE

model = AudioVAE.from_pretrained('inclusionAI/MingTok-Audio')
model = model.cuda()
model.eval()

waveform, sr = torchaudio.load('data/1089-134686-0000.flac', backend='soundfile')
sample = {'waveform': waveform.cuda(), 'waveform_length': torch.tensor([waveform.size(-1)]).cuda()}

with torch.no_grad():
    with torch.autocast(device_type='cuda', dtype=torch.bfloat16):
        latent, frame_num = model.encode_latent(**sample)
        output_waveform = model.decode(latent)

torchaudio.save('./1089-134686-0000_reconstruct.wav', output_waveform.cpu()[0], sample_rate=16000)

性能

语音重建性能

在多个音频基准数据集上的语音重建性能对比。最佳结果以粗体显示。
System FrameRate SEED-ZH SEED-EN
PESQ↑ SIM↑ STOI↑ PESQ↑ SIM↑ STOI↑
MiMo-Audio-Tokenizer 25 2.71 0.89 0.93 2.43 0.85 0.92
GLM4-Voice-Tokenizer 12.5 1.06 0.33 0.61 1.05 0.12 0.60
Baichuan-Audio-Tokenizer 12.5 1.84 0.78 0.86 1.62 0.69 0.85
XY-Tokenizer 12.5 2.27 0.77 0.90 2.14 0.82 0.90
Mimi 75 2.05 0.73 0.89 2.01 0.77 0.89
XCodec2.0 50 2.19 0.80 0.92 2.37 0.82 0.93
BigCodec 80 2.26 0.81 0.92 2.22 0.80 0.91
MingTok-Audio(我们的) 50 4.21 0.96 0.98 4.04 0.96 0.98

下游 ASR 任务的适配性能

了解在各种音频基准数据集上的 ASR 性能对比。最佳结果以粗体显示。
数据集 模型 性能
aishell2-ios LS-clean 湖南话 闽南语 广粤 川渝 上海
理解 ASR Kimi-Audio 2.56 1.28 31.93 80.28 41.49 6.69 60.64
Qwen2.5 Omni 2.75 1.80 29.31 53.43 10.39 7.61 32.05
Qwen2 Audio 2.92 1.60 25.88 123.78 7.59 7.77 31.73
Ming-UniAudio-16B-A3B(我们的) 2.84 1.62 9.80 16.50 5.51 5.46 14.65

在下游 TTS 任务上的适配性能

在各音频基准数据集上的性能对比。最佳结果以粗体表示。
数据集 模型 性能
Seed-zh WER(%) Seed-zh SIM Seed-en WER(%) Seed-en SIM
生成 Seed-TTS 1.12 0.80 2.25 0.76
MiMo-Audio 1.96 - 5.37 -
Qwen3-Omni-30B-A3B-Instruct 1.07 - 1.39 -
Ming-Omni-Lite 1.69 0.68 4.31 0.51
Ming-UniAudio-16B-A3B( ours) 0.95 0.70 1.85 0.58

致谢

  1. 我们在 tokenizer 训练中借用了大量来自 X-Codec-2.0 的代码。
  2. 我们感谢 OpenAI 团队开发了 Whisper 模型并公开其权重。

许可与法律免责声明

本代码仓库采用 MIT License 许可,法律免责声明位于项目根目录下的 LEGAL.md 文件 中。

引用

如果您觉得我们的工作有帮助,欢迎引用。

来源:蚂蚁 inclusionAI:GitHub 新仓库· github.com