# Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash，主打音视频智能体任务交付

- 来源：Qwen：Blog Retrieval（API）
- 作者：QwenTeam
- 发布时间：2026-09-18 01:18
- AIHOT 分数：77
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmu5smj860insroqokcuh0u9v
- 原文链接：https://qwen.ai/blog?id=qwen3.8-omni-flash

## 精选理由

官方发布同时开放 API 和开源插件与运行时，读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。

## AI 摘要

Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash，支持文本、图像、音频和视频输入及 1M token 上下文窗口，29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%，音频输入每小时价格下降超过 98%，音视频输入每小时价格下降超过 93%。

## 正文

QWEN-LIVE HARNESS

QWEN-MM-PLUGINS

QWEN3.8-OMNI-FLASH API

QWEN3.8-OMNI-FLASH-REALTIME API

引言#

今天，我们正式推出Qwen3.8-Omni-Flash，这是我们下一代原生全模态模型。其核心目标是强化智能体在真实生产力场景中的能力，推动全模态模型从“理解全模态内容”迈向“规划任务、调用工具并完成创作工作”。在编码、文本类知识工作和 GUI 操作等通用智能体能力的基础上，Qwen3.8-Omni-Flash 进一步拓展了以音频和视频为核心的智能体应用，在视频剪辑、音乐视频创作、影片制作与解说、音视频摘要以及实时对话等工作流中均取得了出色表现。

图 1. Qwen3.8-Omni-Flash 及其在生产中的应用。

Qwen3.8-Omni-Flash — now available on the Qianwen AI Platform:

支持文本、图像、音频和视频输入，具备1M token 上下文窗口。

Qwen3.8-Omni-Flash 支持 1M token 的上下文窗口，同时保持与同等规模纯文本模型相当的文本性能，并在全模态能力上实现显著提升。在 29 项评测1中，其平均得分较 Qwen3.5-Omni-Plus 提升超过 25%；每小时音频输入的 API 价格下降超过 98%，每小时音视频输入的价格下降超过 93%2。在音视频智能体、编程和长时程任务方面，该模型在 WildClawBench-MM 上提升 36.5 分，在 AgenticVBench 上提升 22.3 分，同时在 UniClawBench 上取得 69.6 的强劲成绩。其核心能力在长音频与音视频理解、音视频推理、音视频描述以及多说话人识别方面也有显著提升。例如，它在 LongAudioSpan 上提升 8.3 分，在 OmniVideoBench 上提升 9.6 分；其 OmniCap-IF 的 CSR 和 ISR 分别提升 8.5 分和 14.1 分；其 AliMeeting 的 DER 和 cpWER 从 88.11 / 89.61 降至 3.35 / 17.18。通过扩展数据、上下文和智能体环境，Qwen3.8-Omni-Flash 实现了接近 Gemini 3.8 Flash 的音视频性能，以及超越 Gemini 3.8 Flash 的整体音频性能。这些进展也意味着，音频和视频正从感知输入演变为智能体理解环境、进行推理和执行任务的核心媒介。

1. 范围涵盖音频推理基准：AliMeeting-test、AISHELL-4、MagicData-RAMC、MLC-SLM (en)、WenetSpeech (Net | Meeting)、FLEURS-60 ASR、FLEURS-60 S2TT、SpotSoundBench、MMAU、MMAR、MMSU、MuchoMusic-RUL、HumMusQA、MusTBench、Audio-MultiChallenge、WildSpeech 和 VoiceBench；音视频推理基准：DailyOmni、WorldSense、AVUT、JointAVBench、OmniCloze、OmniCap-IF、QIVD、OmniVideoBench 和 StreamingBench；以及音视频智能体基准：WildClawBench-MM、UniClawBench 和 OmniGAIA。 2. 定价方法：每小时音频或音视频输入价格按两分钟源素材输入成本的 30 倍估算；音视频输入使用 720p、1 fps。Gemini 3.8 Flash 使用 media_resolution=high，Seed 2.0 Lite 使用 max_frame_tokens=384，其他所有 API 参数均使用默认值。文本输入和输出价格以每 1M tokens 的人民币计价；Gemini 和 Muse 的价格按 1 USD = 6.7191 CNY 的汇率从美元换算。

音频和视频是将智能体带入真实世界生产力场景的重要媒介，但它们也带来了一系列新的系统级挑战。长音频和长视频在多轮推理中的存储、传输和处理成本高昂；现有的智能体 harness 框架缺乏对这些模态的原生支持；而将全模态理解与端到端任务执行相连接的工作流仍处于早期阶段。要应对这些挑战，需要模型、harness 工具和运行时环境协同演进。

为应对这些挑战，我们使用 Qwen3.8-Omni-Flash 来探索如何将源内容理解、任务规划、工具执行与结果交付串联成一条完整的流水线。它支持端到端、长时程的工作流，例如视频剪辑、翻译、影视解说和内容创作，推动 Omni 从音视频理解迈向自主行动与任务完成。

为此，我们进一步扩展了 Qwen-MM-Plugins，为其加入面向长音频和长视频的按需感知、工具调用与工作流执行能力。我们还开源了 Qwen-Live Harness，作为面向持续、实时全模态交互的原生运行时。二者共同应对长时程工作流与实时交互，同时与模型一道持续拓展全模态智能体的能力。

插件 Qwen-MM-Plugins 通往音视频生产力的入口——连接多模态理解、内容创作与智能体 harness。立即开始 → HARNESS Qwen-Live Harness 通往实时交互的入口——连接音视频对话、任务委派、记忆与上下文管理。立即开始 →

长音频与长视频理解#

Qwen3.8-Omni-Flash 为长音频与长视频理解带来了重大升级——从可控描述与智能体式证据收集，到理解会议并推进后续任务，最终到生成以视频为核心的深度研究报告。它不仅仅是处理更长的内容，而是更精准地找到相关证据、更深入地进行推理、更高效地采取行动。

可控音视频描述#

对于一段视频应该如何描述，并不存在唯一的答案。内容创作优先考虑叙事，素材检索聚焦于特定片段，而资产管理则依赖于结构。不同的应用需要不同的视频描述。在 Qwen3.8-Omni-Flash 中，我们将视频描述从回答"模型看到了什么"升级为理解"用户想知道什么"。用户可以自由指定主体、时间范围、详细程度和输出格式。对于同一段视频，模型可以提供概览、定位关键片段，或者深入分析人物动作、镜头、灯光和声音，并按需生成结构化结果。你定义看什么、看多细，以及如何呈现。

视频 · 前往原文观看

智能体式长时音视频理解#

对于长达数小时的视频，传统方法要求模型从头到尾处理整个录像，即便答案只出现在其中几分钟的画面里。原生 Qwen3.8-Omni-Flash 智能体从问题出发，自主决定观看和收听的内容，并通过多轮由粗到细的证据收集来定位关键信息。无需处理每一帧，它就能将有限的计算和 token 预算集中在相关片段上，从而实现更高效的长视频理解。在 OmniVideoBench 上，智能体理解将准确率从 63.4 提升至 67.8，同时将 token 消耗从 145,736 降低至 79,117，降幅约为 45.7%。下表对比了静态理解与智能体理解在 OmniVideoBench 上的准确率和 token 消耗：

注：智能体模式可跨轮次保留上下文。

静态理解智能体理解

准确率（↑）63.467.8

每次查询的 token 数（↓）145,73679,117

视频 · 前往原文观看

长会议：从会议纪要到行动#

多参与者会议是最复杂的音视频理解场景之一：发言者轮流发言并相互重叠，而身份、指代和讨论主题不断变化。Qwen3.8-Omni-Flash 跨音频和视频联合识别发言者，并原生支持长达一小时的音视频输入。它能够端到端地执行发言者分割、内容转写和身份对齐。给定一段完整的会议视频和一项请求，该模型可以梳理参与者关系、生成会议纪要、识别行动事项并分析项目风险，利用视觉信息来消解音频中的指代和实体歧义。结合智能体与工具使用，它还能根据会议需求发送邮件、整理任务，甚至开始编写代码——从理解会议迈向对会议采取行动。

视频 · 前往原文观看

利用音频和视频开展深度研究#

当用户带着某个具体问题观看视频时，答案往往超出视频本身。Qwen3.8-Omni-Flash 将用户的需求与视频内容相结合，识别出值得深入探究的问题，整理关键素材，并在全网搜索多模态来源——包括图像、视频和文档。随后，它会生成一份以视频为中心、图文并茂的研究报告，帮助用户理解内容并解决实际问题。

例如，当用户遇到 Photoshop 头发抠图边缘出现色边的问题时，该模型可以拆解教程步骤，研究 Multiply 和 Screen 混合模式背后的原理，比较其他边缘修复技术，并说明哪种方法最适合用户的具体情况。

音视频制作与编辑#

Qwen3.8-Omni-Flash 正将音视频智能体带入一个新阶段：从理解声音和图像，到自主规划、调用工具并交付成片，将全模态智能带入专业音视频内容制作工作流。

Music2MV#

在音乐视频（MV）创作方面，Qwen3.8-Omni-Flash 能够细致理解用户所提供歌曲的结构、节奏、情绪、人声以及器乐变化，为角色、场景和镜头的设计提供依据。它还能输出带时间戳的逐行歌词，以对齐演唱、字幕和画面。结合 Qwen-MM-Plugins 等创意工具，该模型支持从音乐理解、创意策划到最终质量审核的完整工作流，展现出强大的音视频理解、推理与创作能力。

工作流

下一步

视频 · 前往原文观看

最终结果 1

下一步

视频 · 前往原文观看

最终结果 2

下一步

视频 · 前往原文观看

最终结果 3

下一步

视频 · 前往原文观看

短剧翻译#

传统视频翻译往往需要在转录、翻译、配音和剪辑平台之间反复切换。这使 API 调用和工作流协调变得复杂，也难以在角色音色、对话时长和视觉节奏之间保持一致性。借助基于 Qwen3.8-Omni-Flash 构建的智能体，用户只需用一句话描述需求，即可完成说话人感知的对话识别、对话式翻译、角色音色克隆与配音、音频混音以及最终质量审核。这些原本碎片化的本地化步骤由此成为一个完整的工作流，能够为国际受众自动交付短剧。

工作流

下一步

视频 · 前往原文观看

最终结果 1

下一步

源文

视频 · 前往原文观看

翻译结果

视频 · 前往原文观看

最终结果 2

下一步

源文

视频 · 前往原文观看

翻译结果

视频 · 前往原文观看

最终结果 3

下一步

源文

视频 · 前往原文观看

翻译结果

视频 · 前往原文观看

长片影评解说#

为两三个小时的全长电影制作解说视频，往往需要反复观看影片并梳理剧情，随后还要进行镜头挑选、脚本撰写、配音、配乐和剪辑。这是一个复杂且耗时的过程。借助基于 Qwen3.8-Omni-Flash 构建的智能体，用户只需提供一部电影并用一句话描述创作需求，即可完成长视频理解、关键剧情提取、解说策划、配音与配乐制作、剪辑、渲染以及最终质量审核。

该智能体还能智能地将原片对白与解说交错穿插，自动调整语速和音量，使旁白、原声、背景音乐与画面自然融合，打造出更真实、更具沉浸感、更有电影质感的解说视频。

工作流程

下一步

视频 · 前往原文观看

最终结果 1

下一步

视频 · 前往原文观看

最终结果 2

下一步

视频 · 前往原文观看

从使用模型到优化模型#

真实世界的多模态应用往往复杂且对成本敏感，要求模型在质量、延迟、算力与部署成本之间取得平衡。

因此，针对特定场景定制更小的模型，是规模化部署应用的一条重要路径。然而传统工作流涉及数据构建、问题诊断、多轮训练与评估，耗时且高度依赖人工专业知识。这一次，我们将 Qwen3.8-Omni-Flash 延伸到模型开发本身，探索一种新方法：由大模型驱动研发，而小模型服务于业务需求。

我们给 Qwen3.8-Omni-Flash 布置了一项任务：在 12 小时内提升 Qwen2.5-Omni-3B 的四川方言语音识别能力，并交付一个可用的模型。它独立选定了 WenetSpeech-Chuan 评测集，确定了评测标准，并建立了基线。随后它直接聆听音频样本，利用识别结果诊断问题，并构建有针对性的训练数据。在连续四轮实验中，该智能体创建了 3,413 条训练样本，根据评估反馈调整策略，保留有效的改进，并回滚不成功的尝试。Qwen2.5-Omni-3B 在同一评测集上的字符错误率最终从 25.79% 降至 15.30%，相对降低约 40.7%。

这一实验展示了模型演进的另一种可能：通用多模态模型理解数据、规划实验并推动迭代，而更小的模型则获得面向特定应用的专业能力。智能体可以超越"用模型帮助解决实际业务问题"这一层面。

视频 · 前往原文观看

音视频信息压缩#

音频和视频承载着丰富的信息，但其线性、非结构化的形式使得检索和复用变得困难。Qwen3.8-Omni-Flash 能够理解声音、视觉和时间线中的内容，通过智能体工作流提取信息、重组其结构并验证结果。它将长视频中的核心知识和实践经验转化为更密集、更易于消费和复用的信息资产。

Video2Note#

为了将视频知识转化为结构化资源，我们在 Qwen-MM-Plugins 中开源了 Video2Note。借助 Qwen3.8-Omni-Flash 对语音、视觉和流程的联合理解能力，它能够自动组织知识、拆解关键步骤、选取代表性帧，并生成图文对应的 PDF 笔记。自动化审核与迭代修正进一步将数小时的视频浓缩为清晰易读、便于回顾的文档。

工作流

下一步

视频 · 前往原文观看

最终结果 1

下一步

示例视频

视频 · 前往原文观看

最终 PDF

最终结果 2

下一步

示例视频

视频 · 前往原文观看

最终 PDF

最终结果 3

下一步

示例视频

视频 · 前往原文观看

最终 PDF

最终结果 4

下一步

示例视频

视频 · 前往原文观看

最终 PDF

Omni Skill Creator#

视频不仅记录了"如何做某件事"，还记录了专家积累的实践经验。基于这一考虑，我们在 Qwen-MM-Plugins 中引入了 Omni Skill Creator 这一全新的开源能力。它可以从演示中提取标准操作流程（SOP），以执行可复用的自动化工作，或从专家指导中学习工具使用方法、决策标准和关键洞见。一次演示即可转化为经过验证和评估的智能体技能，从而基于全模态内容构建可复用、可分享的技能。

视频 · 前往原文观看

实时音视频交互#

Qwen3.8-Omni-Flash 专为对完整音视频内容的深度理解与创作而设计。针对连续、低延迟的交互场景，我们进一步推出 Qwen3.8-Omni-Flash-Realtime。它在接收实时音视频流的同时进行感知与响应，并利用实时上下文调用工具、执行任务，将全模态能力从“理解一段内容”推进到“参与一场交互”。

实时口语练习#

口语没有标准输入。口音、元音与辅音的替换以及声调偏差，都可能导致逐字转写的结果偏离原本要表达的含义。Qwen3.8-Omni-Flash-Realtime 对发音与语义进行联合建模，能够理解受口音影响的非标准表达，将其与正确的词对齐，并实时生成标准发音示范。在多次练习轮次中，模型会结合新的音频更新其判断，在纠正影响理解的错误的同时，保留自然的节奏、语调与情感。

视频 · 前往原文观看

全模态空间音频感知#

在真实空间中，声音提供了视觉之外的另一条坐标轴。Qwen3.8-Omni-Flash-Realtime 将空间声音与视觉信息相结合，在感知障碍物、可通行区域以及场景变化的同时，持续判断声源的方向与距离，使其成为首个能够通过声音定位目标的全模态模型。

对于“过来这里”或“去看看是什么发出了那个声音”这类指令，模型能够从环境噪声中分离出人声和目标声音，将其含义锚定在周围空间中，并调用工具完成定位、搜索、路径规划和导航——从听到目标到抵达目标。

视频 · 前往原文观看

用于音视频交互的外部知识#

实时交互不仅需要低延迟，还需要能够为每个应用动态加载知识和行为。Qwen3.8-Omni-Flash-Realtime 支持通过技能注入身份设定、表达风格、业务知识和交互规则，而工具调用则将这些能力延伸到任务执行中。

在客户服务等场景中，模型可以实时加载品牌话术和服务流程，理解用户的语音、视觉信息和上下文，生成符合业务要求的回复，并执行操作。因此，同一个实时模型可以承担不同的知识、角色和行为方式。

视频 · 前往原文观看

基准测试结果#

Omni#

Qwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 FlashSeed 2.0 LiteMuse Spark 1.2

智能体全模态智能

WildClawBench-MM

多模态工具使用

71.034.558.941.9--

UniClawBench

多模态工具使用

69.667.169.061.2--

AgenticVBench

多模态工具使用

36.814.545.010.0--

OmniGAIA

网页搜索

74.057.278.664.4--

通用音视频能力

DailyOmni

音视频理解

85.185.184.081.479.6

WorldSense

音视频理解

68.563.969.667.365.0

AVUT

音视频理解

86.685.988.081.582.4

JoinAVBench

音视频理解

75.974.170.470.671.8

OmniVideoBench

音视频推理

63.453.865.258.562.2

Video-MME-v2

音视频推理

65.047.971.064.9--

LVOmniBench

长视频推理

63.353.270.7----

OmniCloze

音视频描述

63.264.260.956.365.3

OmniCap-IF

音视频描述

CSR

80.6

ISR

28.2

CSR

72.1

ISR

14.1

CSR

81.9

ISR

28.3

CSR

74.6

ISR

18.1

CSR

77.9

ISR

26.8

QIVD

音视频交互

69.665.669.162.062.0

StreamingBench

音视频交互

80.857.179.977.277.8

通用音频能力

AliMeeting 测试

多说话人 ASR（DER | cpWER，↓）

3.4 | 17.288.1 | 89.672.6 | 53.175.1 | 76.193.7 | 92.7

AISHELL-4

多说话人 ASR（DER | cpWER，↓）

2.8 | 11.2100.0 | 100.066.4 | 56.964.8 | 64.291.3 | 86.0

MagicData-RAMC

多说话人 ASR（DER | cpWER，↓）

5.7 | 14.198.4 | 97.167.9 | 33.843.4 | 35.182.1 | 75.3

MLC-SLM（en）

多说话人 ASR（DER | cpWER，↓）

4.0 | 14.268.6 | 63.960.8 | 26.640.4 | 45.574.3 | 52.9

WenetSpeech（Net）

ASR（WER，↓）

4.83.714.24.368.2

WenetSpeech（会议）

ASR（WER，↓）

4.64.816.74.742.6

FLEURS-ASR

多语言 ASR（WER，↓）

9.37.27.932.123.6

FLEURS-S2TT

多语言语音到文本翻译（BLEU）

31.832.233.024.828.8

SpotSoundBench

音频定位

67.264.239.759.616.9

MMAU

音频理解

81.881.976.977.263.5

MMAR

音频理解

79.879.878.577.767.3

MMSU

音频理解

82.183.083.380.259.9

LongAudioSpan

长音频推理

准确率

82.7

评分标准

71.8

链式

48.2

准确率

74.4

评分标准

49.8

链式

45.1

准确率

79.3

评分标准

65.5

链式

64.6

----

MuchoMusic-RUL

音乐理解

72.671.653.761.740.1

HumMusQA

音乐理解

75.875.571.266.063.3

MusTBench

音乐理解

50.649.140.344.029.4

Audio MultiChallenge

音频交互

71.557.671.963.457.9

WildSpeech

音频交互

74.375.776.474.573.4

VoiceBench

音频交互

91.692.992.384.179.8

1. 面向智能体全模态智能的评测框架：WildClawBench-MM 和 AgenticVBench 使用 Claude Code，UniClawBench 使用 OpenClaw，而 OmniGAIA 不使用任何评测框架。对于 WildClawBench-MM，我们仅评估 WildClawBench 中涉及图像、视频或音频的多模态任务。 2. FLEURS：ASR 和 S2TT 评测结果均覆盖以下 60 种语言：中文（普通话）、英语、粤语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、乌尔都语、挪威语、瑞典语、丹麦语、希伯来语、芬兰语、波兰语、冰岛语、捷克语、菲律宾语、波斯语、希腊语、南非荷兰语、阿斯图里亚斯语、白俄罗斯语、保加利亚语、孟加拉语、波斯尼亚语、加泰罗尼亚语、宿务语、爱沙尼亚语、加利西亚语、古吉拉特语、克罗地亚语、匈牙利语、爪哇语、哈萨克语、卡纳达语、吉尔吉斯语、拉脱维亚语、马其顿语、马拉雅拉姆语、马拉地语、旁遮普语、罗马尼亚语、斯洛伐克语、斯洛文尼亚语、斯瓦希里语、塔吉克语、阿塞拜疆语和乌克兰语。 3. 空白单元格（--）：分数尚不可用或不适用。

智能体全模态理解#

长音频和视频录制中的关键信息往往分散在不同片段中，而复杂问题需要跨声音和图像进行多步推理。智能体全模态理解使模型能够从问题出发，规划方法、调用工具，并逐步定位和验证证据。通过将计算集中在相关内容上，它提升了长时音视频理解的准确性和效率。为评估这一能力，我们在 OmniVideoBench、Video-MME-v2 和 LVOmniBench 上，在两种设置下对比了 Qwen3.8-Omni-Flash 和 Gemini 3.8 Flash：静态模式，即模型直接解读输入；以及使用 Qwen Code 的智能体模式。这一对比展示了引入智能体工作流如何影响各模型的表现。

Qwen3.8-Omni-Flash （静态）Qwen3.8-Omni-Flash （Qwen Code）Gemini 3.8 Flash （静态）Gemini 3.8 Flash （Qwen Code）

OmniVideoBench

音视频推理

63.467.865.270.1

Video-MME-v2

音视频推理

65.071.371.072.7

LVOmniBench

长视频推理

63.373.670.770.7

Text#

Qwen3.8-Omni-FlashQwen3.8- FlashQwen3.8- 27BQwen3.7- PlusDeepSeek-V4-Flash-0731Claude-Opus-4.6 (Max)

编程与智能体

DeepSWE 1.1

长时程软件工程

57.858.742.216.554.4--

SWE-bench Pro

长时程软件工程

63.362.561.755.856.053.4

SWE-bench Multilingual

多语言软件工程

80.581.073.875.8--77.5

NL2Repo-Bench

仓库级代码生成

48.948.142.341.154.247.6

CoWorkBench

长周期办公工作

75.373.970.765.145.168.2

通用文本能力

IFBench

指令遵循

81.581.379.579.179.262.5

GPQA Diamond

科学推理

91.091.789.290.390.891.3

HLE

多学科推理

36.535.930.834.733.840.0

LiveCodeBench v6

竞赛编程

92.691.990.389.690.688.8

1. DeepSWE 1.1：使用 Claude Code 和 mini-SWE-agent 测试框架进行评估，temp=1.0，top_p=0.95，256K 上下文窗口。我们报告两个测试框架中的最高分；值得注意的是，Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。 2. SWE-bench Pro：除 Claude-Opus-4.6 (Max) 我们报告其官方公布的分数外，所有模型均使用 Claude Code 测试框架进行评估，temp=1.0，top_p=0.95，256K 上下文窗口。有问题的任务已被修正，所有基线模型均在改进后的基准上重新评估。 3. SWE-bench Multilingual：使用 mini-SWE-agent 测试框架进行评估，temp=1.0，top_p=0.95，256K 上下文窗口。 4. NL2Repo-Bench：使用 Claude Code 测试框架进行评估。为防止奖励黑客行为，我们禁用了试图访问特定仓库的 Bash 命令，例如 pip download、pip install 和 git clone。 5. CoWorkBench：一个内部协作基准，用于评估跨计算机科学、金融、法律、医疗及其他生产力领域的长期办公和生产力智能体任务。 6. HLE：由 GPT-4o 评判。 7. 空白单元格（--）：分数尚不可用或不适用。

视觉#

Qwen3.8-Omni-FlashQwen3.8- FlashQwen3.8- 27BQwen3.7- PlusClaude-Opus-4.6 (Max)

智能体视觉智能

ClawEval-MM

多模态工具使用

Pass@3

60.4

平均

61.9

Pass@3

64.4

平均

60.4

Pass@3

57.4

平均

56.9

Pass@3

57.4

平均

60.1

Pass@3

52.5

平均

54.7

AndroidWorld

移动端使用

87.184.581.981.062.0

Vision2Web

可视化网页开发

62.964.062.942.1--

通用视觉能力

ERQA

具身智能

71.072.365.569.840.8

LVBench

长视频理解

76.976.672.476.263.0

RealWorldQA

真实世界感知

87.788.585.986.973.9

MathVision

视觉数学问题求解

无 CI

91.8

有 CI

96.2

无 CI

90.6

有 CI

95.7

无 CI

90.0

有 CI

94.6

无 CI

90.3

有 CI

88.4

无 CI

65.5

有 CI

--

CharXiv（RQ）

科学图表分析

无 CI

83.5

有 CI

91.4

无 CI

84.6

有 CI

90.6

无 CI

83.7

有 CI

90.2

无 CI

85.8

有 CI

85.9

无 CI

66.0

启用 CI

--

1. ClawEval-MM：分数以“pass@3 / 平均分”形式报告。Pass@3 衡量在三次试验中至少一次通过的百分比，平均分是三次试验得分的均值。 2. RecreationBench：内部构建的长时程应用复现基准，用于评估跨五个平台的混合智能体能力——桌面端（Ubuntu、macOS、Windows）、移动端（Android）和 Web 端。 3. OSWorld 2.0：分数以“二值 / 部分分”形式报告。二值分数是获得完整任务奖励的任务百分比，部分分则汇总所有任务中获得的各部分奖励。 4. Vision2Web：分数报告为前端、网页和网站三个类别的平均值，使用 Claude Code harness，由 gpt-5.4-2026-03-05 评判。 5. MathVision、CharXiv（RQ）：分数以“无 CI / 有 CI”形式报告。MathVision 中少量错误的真值标注经人工核验后已修正。我们的模型分数使用固定提示词评估，例如“Please reason step by step, and put your final answer within \boxed{}.”。对于其他模型，我们报告使用与不使用 \boxed{} 格式的多次运行中较高的分数。 6. 空白单元格（--）表示分数尚不可用或不适用。

吞吐量与延迟#

以下结果展示了 Qwen3.8-Omni-Flash-Realtime API 在不同输入条件下的实测吞吐量与延迟，反映了用户在生产环境中所体验到的性能表现。

输入场景文本输出 TPS（Tokens/s）首 Token 时间（ms）首个音频包时间（ms）音频生成 RTF

Realtime API 性能

音频 6s84.87591.26978.360.1538

音频 12s83.18604.80982.740.1537

音频 20s81.06617.981026.390.1538

音视频 6s84.89837.961214.730.1524

音视频 12s84.33911.851268.070.1527

音视频 20s83.00981.011350.490.1528

支持语言#

能力语言中文方言

语音识别74 种语言：南非荷兰语、阿拉伯语、阿斯图里亚斯语、阿塞拜疆语、巴斯克语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、粤语、加泰罗尼亚语、宿务语、中文、克罗地亚语、捷克语、丹麦语、荷兰语、英语、世界语、爱沙尼亚语、菲律宾语、芬兰语、法语、加利西亚语、格鲁吉亚语、德语、希腊语、希伯来语、印地语、匈牙利语、冰岛语、印度尼西亚语、国际语、意大利语、日语、爪哇语、卡纳达语、哈萨克语、韩语、吉尔吉斯语、林加拉语、拉脱维亚语、立陶宛语、马其顿语、马来语、马拉雅拉姆语、马耳他语、毛利语、马拉地语、蒙古语、书面挪威语、新挪威语、奥里亚语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、塞尔维亚语、斯洛伐克语、斯洛文尼亚语、西班牙语、斯瓦希里语、瑞典语、塔吉克语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、维吾尔语和越南语39 种方言：东北官话、贵州话、广东粤语、河南话、香港粤语、上海话、陕西话、天津话、台湾国语、云南话、安徽话、福建话、甘肃话、广东官话、湖北话、湖南话、江西话、山东话、山西话、四川话、广西话、海南话、重庆话、长沙话、杭州话、合肥话、银川话、郑州话、沈阳话、温州话、武汉话、昆明话、太原话、南昌话、济南话、兰州话、南京话、客家话和闽南语

语音生成29 种语言：中文、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语、泰语、印尼语、阿拉伯语、越南语、土耳其语、芬兰语、波兰语、印地语、荷兰语、捷克语、乌尔都语、他加禄语、瑞典语、丹麦语、希伯来语、冰岛语、马来语、挪威语和波斯语7 种方言：四川话、北京话、天津话、南京话、陕西话、粤语和闽南语

Qwen3.8-Omni-Flash 快速上手#

API 用法#

Qwen3.8-Omni-Flash 正式支持 reasoning_effort，用于调整推理深度并控制成本：

xhigh（默认）：适用于需要深入分析的复杂任务。

medium：兼顾准确性与速度。

low：针对速度和成本优化的高效推理。

此外，preserve_thinking 在所有场景下默认启用，以提供最佳的开箱即用体验。

Qwen3.8-Omni-Flash 支持行业标准协议，包括兼容 OpenAI 的 Chat Completions 和 Responses API。示例如下：

""" Environment variables: DASHSCOPE_API_KEY: Your API Key from https://platform.qianwenai.com/home DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API. - Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1 - Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1 """ from openai import OpenAI import os api_key = os.environ.get("DASHSCOPE_API_KEY") if not api_key: raise ValueError( "DASHSCOPE_API_KEY is required. " "Set it via: export DASHSCOPE_API_KEY='your-api-key'" ) client = OpenAI( api_key=api_key, base_url=os.environ.get( "DASHSCOPE_BASE_URL", "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", ), ) messages=[ { "role": "user", "content": [ { "type": "image_url", "image_url": { "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20241022/emyrja/dog_and_girl.jpeg" }, }, { "type": "input_audio", "input_audio": { "data": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250211/tixcef/cherry.wav", "format": "wav" }, }, {"type": "text", "text": "Please describe the image and tell me what is being said in the audio."}, ], }, ] completion = client.chat.completions.create( model="qwen3.8-omni-flash", messages=messages, extra_body={ "enable_thinking": True, # "preserve_thinking": True, }, reasoning_effort="xhigh", # supported levels are xhigh, medium, and low stream=True, ) reasoning_content = "" answer_content = "" is_answering = False print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n") for chunk in completion: if not chunk.choices: print("\nUsage:") print(chunk.usage) continue delta = chunk.choices[0].delta if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None: if not is_answering: print(delta.reasoning_content, end="", flush=True) reasoning_content += delta.reasoning_content if hasattr(delta, "content") and delta.content: if not is_answering: print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n") is_answering = True print(delta.content, end="", flush=True) answer_content += delta.content

可控音视频描述的最佳实践#

内容组织与详细程度：将视频描述、OCR 提取、音频描述和语音转录整理为多个部分，涵盖画面、语音、音乐、音效和环境音。保留原始文本、说话人身份及对应的时间范围，以便于检索和核验。在提示词中指定目标长度以控制详细程度，例如 Describe the video in approximately 2000–3000 words.，并根据视频的时长和信息密度进行调整。

提示词示例

Provide a detailed description of the video. Make sure your description covers every one of the following dimensions: Visual - Subjects and characters: appearance, clothing, gender/age cues, identity, distinctive features - Actions and events in chronological order, and how the scene evolves over time - Setting and background: location, environment, time of day - Spatial layout and relations between subjects/objects; counts and quantities - On-screen text: captions, titles, subtitles, logos, UI — exact content and appearance - Visual style: colors, lighting, camera shots, angles, and camera movement - Speech: the exact spoken content, transcribed verbatim - Speakers: who is speaking (mapped to the on-screen person or voice-over), with accent, tone, gender/age cues - Speaking state: prosody, emotion, volume, and speaking style - Music: presence, genre/mood, and lyrics if any - Sound effects and ambient/background sounds - Non-speech vocalizations: laughter, crying, applause, etc. Audio-visual correspondence - Which speech or sound aligns with which on-screen person or visual event - The timing of each event, expressed with timestamps It should explicitly include three sections: 1. A structured chronological storyline of **every noticeable audio and visual details** 2. A structured list of all visible text. For each text element, include start timestamp, end timestamp, the exact text content, the appearance characteristics. If no text appears, explicitly state so. 3. A structured speech-to-text transcription, include speaker (corresponding to the character or voice-over in Section 1, including their accent and tone), exact spoken content, start timestamp, end timestamp, and speaking state (prosody, emotion, and style). If no speech appears, explicitly state so. Aside from these three required sections, you are free to organize any additional content in any way you find helpful. This additional content can include global information about the entire video or localized information about specific moments. You may choose the topic of this extra content freely. Rules: - Add as much descriptive detail as possible. - Do not use Markdown bold formatting. - Carefully look at frames and listen to the audio, making sure no detail is overlooked. Output Format: ``` ## Storyline <xx:xx.xxx> - <xx:xx.xxx> <an unstructured long paragraph in natural language describing what happened during this period, blending both audio and video details.> <xx:xx.xxx> - <xx:xx.xxx> <an unstructured long paragraph in natural language describing what happened during this period, blending both audio and video details.> <xx:xx.xxx> - <xx:xx.xxx> <an unstructured long paragraph in natural language describing what happened during this period, blending both audio and video details.> ... ## Visible Text <xx:xx.xxx> - <xx:xx.xxx> “<element>”: <appearance> “<element>”: <appearance> <xx:xx.xxx> - <xx:xx.xxx> “<element>”: <appearance> “<element>”: <appearance> “<element>”: <appearance> <xx:xx.xxx> - <xx:xx.xxx> “<element>”: <appearance> ... ## Speakers and Transcript Speaker profiles: <speaker> - <profile> <speaker> - <profile> <speaker> - <profile> ... <xx:xx.xxx> - <xx:xx.xxx> Speaker: <speaker> State: <description> Content: “<content>” <xx:xx.xxx> - <xx:xx.xxx> Speaker: <speaker> State: <description> Content: “<content>” <xx:xx.xxx> - <xx:xx.xxx> Speaker: <speaker> State: <description> Content: “<content>” ... ## <another section> <paragraphs> ## <another section> <paragraphs> ... ```

结构化输出与 schema 约束：在提示词中包含任务指令和完整的 JSON Schema，明确字段含义、类型、必填字段和约束条件，以支持程序化解析和下游使用。

提示词示例

Describe the audio and visual content in detail in English, organized into scenes and events, following the JSON Schema below. All timestamps must be relative to the beginning of the video. End times must not precede start times or exceed the video duration. Each event must fall within the time range of its parent scene. Include only information directly supported by the audio or video. Do not guess or invent details. Do not infer causality merely because a sound and an action occur at the same time. Return only valid JSON, without Markdown fences or commentary. JSON Schema: { "$defs": { "Event": { "additionalProperties": false, "properties": { "time_range": { "$ref": "#/$defs/TimeRange", "description": "Time range of the event" }, "participants": { "description": "People, animals, or objects involved, named by observable features; use consistent names for the same participant", "items": { "type": "string" }, "title": "Participants", "type": "array" }, "action": { "description": "Specific actions, interactions, and observable outcomes", "title": "Action", "type": "string" }, "sounds": { "description": "Sounds heard during the event; use an empty list if none are discernible", "items": { "type": "string" }, "title": "Sounds", "type": "array" } }, "required": [ "time_range", "participants", "action", "sounds" ], "title": "Event", "type": "object" }, "Scene": { "additionalProperties": false, "properties": { "time_range": { "$ref": "#/$defs/TimeRange", "description": "Time range of the scene" }, "setting": { "description": "Environment, spatial layout, and main visual features", "title": "Setting", "type": "string" }, "events": { "description": "Events in chronological order; use an empty list if there are none", "items": { "$ref": "#/$defs/Event" }, "title": "Events", "type": "array" } }, "required": [ "time_range", "setting", "events" ], "title": "Scene", "type": "object" }, "TimeRange": { "additionalProperties": false, "properties": { "start_seconds": { "description": "Start time in seconds relative to the beginning of the video", "minimum": 0, "title": "Start Seconds", "type": "number" }, "end_seconds": { "description": "End time in seconds; must not precede the start time", "minimum": 0, "title": "End Seconds", "type": "number" } }, "required": [ "start_seconds", "end_seconds" ], "title": "TimeRange", "type": "object" } }, "additionalProperties": false, "properties": { "summary": { "description": "An overview of the main content of the video", "title": "Summary", "type": "string" }, "scenes": { "description": "Scenes in chronological order; group continuous footage with a consistent setting into one scene", "items": { "$ref": "#/$defs/Scene" }, "title": "Scenes", "type": "array" } }, "required": [ "summary", "scenes" ], "title": "CaptionResult", "type": "object" }

在 Agent Harness 中安装 Qwen-MM-Plugins#

Qwen-MM-Plugins 是一套面向智能体运行框架的多模态插件套件。它让智能体能够理解图像、音频、视频和文档，还能为长视频维护记忆并创作内容。它支持包括 Codex、Claude Code、Qwen Code、Gemini CLI、Qoder、CodeBuddy 和 OpenClaw 在内的智能体运行框架。我们也欢迎社区开发者贡献代码。

你可以直接在你常用的办公智能体中输入以下请求：

Help me install the core, api, and omni-related plugins from https://github.com/QwenLM/Qwen-MM-Plugins.

或者，通过命令行安装：

# Run the official guided installer: curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash

在菜单中，选择：

安装

你使用的智能体运行框架

你需要的 Omni 插件

插件能力

core读取图像、视频帧、PDF、Office 文档、代码、数据和 3D 文件

api图像理解、OCR、目标定位、音视频转写、说话人分离、事件分析和图像分割

omni-chatcut制作 MV、长篇影视解说以及视频语音翻译

omni-video2note将视频教程转化为带有关键截图的 PDF 笔记

omni-skill-creator将教学视频、屏幕录制或操作演示转化为可复用的 Agent Skill.md 文件

omni-memory为长视频中的人物、对话、声音和事件构建记忆

安装完成后，重启 agent harness 或创建一个新任务。

@song.mp3 Generate a complete MV based on the song's rhythm and content. @short_drama.mp4 Translate the video into English while preserving the original speakers' voice characteristics where possible. @movie.mp4 Create a film commentary video with Chinese narration and subtitles. @weekly_report_sop.mp4 Turn this screen recording of writing a weekly report into a Skill.md file. @tutorial.mp4 Turn the tutorial into PDF notes with key screenshots, timestamps, and step-by-step instructions. @documentary.mp4 Build audio-visual memory that records people, dialogue, sounds, and important events.

Qwen3.8-Omni-Flash-Realtime 快速上手#

API 用法#

Qwen3.8-Omni-Flash-Realtime 支持通过 WebSocket 和 WebRTC 连接。运行下面的基础示例会打开摄像头和麦克风，进行实时音视频对话。我们建议使用耳机。

# Run pip install websocket-client pyaudio dashscope opencv-python -U to install dependencies """ Environment variables: DASHSCOPE_API_KEY: Your API Key from https://platform.qianwenai.com/home DASHSCOPE_BASE_URL: (optional) Base URL for realtime API. - Beijing: wss://dashscope.aliyuncs.com/api-ws/v1/realtime - Singapore: wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime """ import os import base64 import time import pyaudio import cv2 from dashscope.audio.qwen_omni import MultiModality, AudioFormat,OmniRealtimeCallback,OmniRealtimeConversation import dashscope url = f'wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime' dashscope.api_key = os.getenv('DASHSCOPE_API_KEY') # Determine the voice voice = 'Tina' # Determine the model model = 'qwen3.8-omni-flash-realtime' # Determine the model role instructions = "You are Qwen-Omni, a helpful assistant." video_fps = 1 video_size = (1280, 720) class SimpleCallback(OmniRealtimeCallback): def __init__(self, pya): self.pya = pya self.out = None def on_open(self): # Initialize audio output stream self.out = self.pya.open( format=pyaudio.paInt16, channels=1, rate=24000, output=True ) def on_event(self, response): if response['type'] == 'response.audio.delta': # Play audio self.out.write(base64.b64decode(response['delta'])) elif response['type'] == 'conversation.item.input_audio_transcription.delta': # Streaming preview: text is the confirmed prefix, stash is the confirmed suffix preview = response.get('text', '') + response.get('stash', '') print(f"\r[User] {preview}", end='', flush=True) elif response['type'] == 'conversation.item.input_audio_transcription.completed': # Transcription completed, print the final text and a new line print(f"\r[User] {response['transcript']}") elif response['type'] == 'response.audio_transcript.done': # Print the assistant's response text print(f"[LLM] {response['transcript']}") # 1. Initialize audio device pya = pyaudio.PyAudio() # 2. Create callback function and session callback = SimpleCallback(pya) conv = OmniRealtimeConversation(model=model, callback=callback, url=url) # 3. Establish connection and configure session conv.connect() conv.update_session(output_modalities=[MultiModality.AUDIO, MultiModality.TEXT], voice=voice, instructions=instructions) # 4. Initialize audio input stream mic = pya.open(format=pyaudio.paInt16, channels=1, rate=16000, input=True) camera = cv2.VideoCapture(0) next_frame_at = 0.0 # 5. Main loop to process audio and video input try: if not camera.isOpened(): raise RuntimeError("Cannot open camera 0.") camera.set(cv2.CAP_PROP_FRAME_WIDTH, video_size[0]) camera.set(cv2.CAP_PROP_FRAME_HEIGHT, video_size[1]) camera.set(cv2., 1) print(f"Conversation started with camera ({video_fps} fps, {video_size[0]}x{video_size[1]}), speak into the microphone (Ctrl+C to exit)...") while True: audio_data = mic.read(3200, exception_on_overflow=False) conv.append_audio(base64.b64encode(audio_data).decode()) success, frame = camera.read() if not success: raise RuntimeError("Cannot read a camera frame.") if time.monotonic() >= next_frame_at: frame = cv2.resize(frame, video_size) success, image = cv2.imencode('.jpg', frame, [cv2.IMWRITE_JPEG_QUALITY, 80]) if not success: raise RuntimeError("Cannot encode a camera frame.") conv.append_video(base64.b64encode(image).decode()) next_frame_at = time.monotonic() + 1 / video_fps time.sleep(0.01) except KeyboardInterrupt: pass finally: # Clean up resources camera.release() conv.close() mic.close() if callback.out: callback.out.close() pya.terminate() print("\nConversation ended")

Qwen-Live Harness#

Qwen-Live Harness 是一个围绕 Qwen3.8-Omni-Flash-Realtime API 构建的综合性开源 harness。它可以通过一条命令完成安装，并集成到主流智能体工作流中。它支持任务委派、主动交互、长期记忆和上下文管理，并欢迎社区贡献。

图 2. Qwen-Live Harness 交互框架。

安装并开始使用：

npm install -g qwen-live-harness qwen-live-harness init qwen-live-harness

引用#

@misc{qwen38omniflash, title = {Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.}, url = {https://qwen.ai/blog?id=qwen3.8-omni-flash}, author = {{Qwen Team}}, month = {September}, year = {2026} }
