# 微软测试首款自研全双工 AI 语音模型 MAI Realtime：支持 16 种语言、2 种语音

- 来源：IT之家（RSS）
- 发布时间：2026-08-04 08:13
- AIHOT 分数：50
- AIHOT 链接：https://aihot.news/items/cmsdykhsu05t7ro2e52jntkmn
- 原文链接：https://www.ithome.com/0/985/297.htm

## AI 摘要

微软正测试其首款原生实时语音模型 MAI Realtime，采用双向全双工交互，可同步聆听和回应，无需严格轮次交替。该模型支持中文等 16 种语言，测试提供 Victoria 和 Grant 两种语音风格，用户可指定语言或启用自动检测。目前已在 MAI Playground 平台邀请部分合作伙伴测试，上线 Microsoft Foundry 及 Copilot 语音功能的时间尚不清楚。

## 正文

IT之家 8 月 4 日消息，科技媒体 TestingCatalog 于 8 月 2 日发布博文，报道称微软正测试其首款原生实时语音模型 MAI Realtime，支持 16 种语言、2 种语音，可在对话中听说并行，支持自动识别和中途切换语言。

测试方面，消息称微软已邀请部分合作伙伴，在 MAI Playground 平台测试该模型，目前尚不清楚何时上线 Microsoft Foundry，以及扩展到 Copilot 语音功能上。

运行方面，MAI Realtime 采用双向、全双工交互方式，无需严格按“用户说完、模型再答”的轮次交替，可支持同步聆听和回应。

在支持语言方面，MAI Realtime 模型支持中文等在内 16 种语言，IT之家援引博文介绍，附上相关支持的语言如下：

英语

德语

西班牙语

法语

意大利语

葡萄牙语

日语

韩语

中文

荷兰语

印地语

印度尼西亚语

阿拉伯语

俄语

土耳其语

越南语

泰语

在语音风格方面，消息称该模型测试提供 Victoria 和 Grant 两种语音，比 Copilot 目前的语音模式更加自然。用户可以主动地指定语言，也可以启用自动检测。

该模型不支持唱歌或生成非语音音效，定位仍是对话系统。调试面板可显示实时延迟、模型思考内容和处理步骤，样本分享功能或将在测试权限扩大后向平台用户开放。

IT之家注：全双工语音（Full-duplex voice）指系统可在同一时间接收用户语音并输出回复，不必等待一方完全说完。它依靠端点检测识别说话开始、停顿和结束，也需要在用户插话时调整输出。

微软此前发布的 MAI 语音模型均为单向模型，包括用于语音合成的 MAI-Voice-2 及其 Flash 版本，以及用于语音识别的 MAI-Transcribe-1.5。
