# 阿里发布全模态模型 Qwen3.8-Omni-Flash，支持 1M 上下文，百万 Token 图文音视频输入 0.8 元

- 来源：IT之家（RSS）
- 发布时间：2026-09-18 11:34
- AIHOT 分数：76
- AIHOT 标记：同事件
- AIHOT 链接：https://aihot.news/items/cmu6gfp3e0nt3rofjh88vwyf5
- 原文链接：https://www.ithome.com/1/004/049.htm

## AI 摘要

阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash，可同时处理文本、图像、音频和视频输入，支持 1M 上下文。在 30 项评测上相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%，官方称音视频能力接近 Gemini 3.8 Flash、音频能力整体超过 Gemini 3.8 Flash。

## 正文

IT之家 9 月 18 日消息，阿里千问今日正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash，并已在千问 AI 平台提供。该模型可同时处理文本、图像、音频和视频输入，支持 1M 上下文。

全模态模型指可同时处理文本、图像、音频、视频等多种输入形式。官方称，该模型在保持同尺寸文本模型能力的同时，全模态能力较上一代明显提升。

在累计 30 项评测上，Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%。在音视频 Agent、Coding 和长程任务方面，WildClawBench-MM 提升 36.5 分，AgenticVBench 提升 22.3 分，UniClawBench 取得 69.6 分。

基础能力方面，LongAudioSpan 提升 8.3 分，OmniVideoBench 提升 9.6 分，OmniCap-IF 的 CSR / ISR 分别提升 8.5/14.1 分。AliMeeting 的 DER / cpWER 从 88.11/89.61 降至 3.35/17.18。

官方称，其音视频能力接近 Gemini 3.8 Flash，音频能力整体超过 Gemini 3.8 Flash。API 每小时音频输入价格降幅超过 98%，每小时音视频输入价格降幅超过 93%。

为支持长音视频，官方扩展了 Qwen-MM-Plugins，并开源 Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行，后者面向实时、持续的全模态交互。

长音视频理解方面，模型支持按需描述、Agentic 主动取证、会议任务推进和视频深度研究报告。可控音视频 Caption 可指定描述对象、时间范围、信息粒度和输出格式。

在 Agentic 长音视频理解中，OmniVideoBench 准确率从 63.4 提升至 67.8，Token 消耗从 145,736 降至 79,117，降幅约 45.7%。

会议场景中，模型支持最长一小时音视频输入，可完成说话人切分、内容转录与身份对应，生成会议纪要和待办事项，并分析项目风险。结合工具调用，还可发送邮件、整理任务或编码。

音视频生产方面，Music2MV 可理解歌曲结构、节奏与情绪，输出带时间戳的句级歌词。短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检。

长电影解说中，用户提供影片和一句话需求，Agent 可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。

模型优化实验中，Qwen3.8-Omni-Flash 在 12 小时内尝试提升 Qwen2.5-Omni-3B 的四川话识别能力。它自主选定评测集，经 4 轮实验构建 3413 条训练数据，字符错误率从 25.79% 降至 15.30%，相对下降约 40.7%。

信息压缩方面，Qwen-MM-Plugins 开源 Video2Note，可将数小时视频内容生成图文对应的 PDF 笔记。Omni Skill Creator 可从操作演示中提炼标准作业流程，并转化为可复用的 Agent Skill。

实时版 Qwen3.8-Omni-Flash-Realtime 可在音视频流输入同时完成感知与响应，并结合实时上下文调用工具。IT之家注意到，它还支持实时口语陪练，联合建模发音与语义，理解受口音影响的非标准表达。

官方称，该实时版是首个支持“听声辨位”的全模态大模型，融合空间声音与视觉信息，判断声源方向和距离。它还可通过 Skill 注入身份设定、表达风格、业务知识与交互规则。

在 Agentic Omni Understanding 评测中，官方在 OmniVideoBench、Video-MME-v2 和 LVOmniBench 上，对比了 Qwen3.8-Omni-Flash 与 Gemini 3.8 Flash 的 Static 模式和接入 Qwen Code 的 Agent 模式表现。

官方同时公布了 Qwen3.8-Omni-Flash-Realtime API 在不同输入场景下的实际吞吐与延迟性能信息以及完整性能测试结果。
