Qwen3.8-Omni-Flash在12小时内自主完成Qwen2.5-Omni-3B四川方言识别优化,字错率由25.79%降至15.30%
事件全貌
AI 综述阿里千问发布新一代原生全模态模型 Qwen3.8-Omni-Flash,可同时处理文本、图像、音频和视频输入,支持 1M token 上下文,并已在千问 AI 平台提供。官方称其在保持同尺寸文本模型能力的同时全模态能力较上一代明显提升:在 29 项评测上平均得分较 Qwen3.5-Omni-Plus 提升超过 25%(IT之家报道为累计 30 项评测、平均提升超过 26%);音视频 Agent 方面 WildClawBench-MM 提升 36.5 分、AgenticVBench 提升 22.3 分、UniClawBench 取得 69.6 分;AliMeeting 的 DER/cpWER 从 88.11/89.61 降至 3.35/17.18。官方还称其音视频能力接近 Gemini 3.8 Flash、音频能力整体超过 Gemini 3.8 Flash,API 每小时音频输入价格降幅超过 98%、每小时音视频输入价格降幅超过 93%,视频输入成本较上代降低约 89%。
同次发布还包括配套框架与插件。官方扩展了 Qwen-MM-Plugins,面向长程音视频的按需感知、工具调用与工作流执行,支持 Codex、Claude Code、Qwen Code、Gemini CLI、Qoder、CodeBuddy、OpenClaw 等智能体框架,并开源 Video2Note(将数小时视频生成图文 PDF 笔记)与 Omni Skill Creator(从操作演示中提炼 SOP 并转化为可复用 Agent Skill)。Qwen-Live Harness 被描述为围绕 Qwen3.8-Omni-Flash-Realtime API 的开源运行时,支持任务委派、主动交互、长期记忆与上下文管理,可通过单条命令安装;不过阿里云官方账号同次公告中将其标注为 coming soon。
官方还推出实时版 Qwen3.8-Omni-Flash-Realtime,可在接收实时音视频流的同时感知与响应,并结合实时上下文调用工具,支持通过 WebSocket 和 WebRTC 接入;官方称其为首个支持“听声辨位”的全模态模型,融合空间声音与视觉信息判断声源方向和距离,并可通过 Skill 注入身份设定、表达风格、业务知识与交互规则。第三方账号 karminski 称该实时版 20 秒音频延迟约 981ms。
官方公布了一项模型优化实验:Qwen3.8-Omni-Flash 在 12 小时内自主优化 Qwen2.5-Omni-3B 的四川方言语音识别,自主选定 WenetSpeech-Chuan 评测集、固定评测标准并建立基线,经 4 轮实验构建 3413 条训练数据,字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。
AI 汇总报道生成 · 27分钟前更新。单篇报道保留其发布时的原貌。
官方公布实验:Qwen3.8-Omni-Flash 在 12 小时内自主优化 Qwen2.5-Omni-3B 四川方言识别,经 4 轮实验构建 3413 条训练数据,字符错误率从 25.79% 降至 15.30%。
报道时间线
沿着报道,了解事件的不同侧面。
- Qwen3.8-Omni-Flash 发布:原生全模态模型主打音视频智能体能力
Qwen 团队发布原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入和 1M token 上下文窗口,在 29 项评测中平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%。