热点事件 历史事件

Qwen3.8-Omni-Flash 发布:原生全模态模型主打音视频智能体能力

10 篇报道9 个报道来源

事件全貌

AI 综述

阿里千问发布新一代原生全模态模型 Qwen3.8-Omni-Flash,官方称其为 Qwen 首个围绕智能体能力打造的全模态模型,可同时处理文本、图像、音频和视频输入,支持 1M token 上下文,并已在千问 AI 平台、QwenCloud、阿里云 Model Studio 和 Qwen Studio 上线。官方称其在 29 项评测上平均得分较上一代 Qwen3.5-Omni-Plus 提升超过 25%,音视频能力接近 Gemini 3.8 Flash、音频能力整体超过 Gemini 3.8 Flash;API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%,视频输入成本较上代降低约 89%。MarkTechPost 指出,所有跑分与价格数字均来自 Qwen,发布时没有独立结果,且未公布开放权重,仅提供托管 API。

同次发布还包括配套工具与实时型号。Qwen 开源 Qwen-MM-Plugins,为 Codex、Claude Code、Qwen Code、Gemini CLI、Qoder、CodeBuddy、OpenClaw 等智能体框架提供图像、音频、视频和文档理解能力,并新增 Video2Note(将数小时视频生成图文 PDF 笔记)与 Omni Skill Creator(从操作演示中提炼标准作业流程并转化为可复用 Agent Skill);MarkTechPost 称其以 Apache-2.0 协议开源,并指出多数框架尚不能原生向主模型输入音频,音频暂经 API 路由。Qwen-Live Harness 作为围绕 Qwen3.8-Omni-Flash-Realtime API 的开源运行时,支持任务委派、主动交互、长期记忆与上下文管理,可通过单条命令安装。Qwen3.8-Omni-Flash-Realtime 支持在接收实时音视频流的同时感知与响应、结合实时上下文调用工具,并通过 WebSocket 和 WebRTC 接入;官方称其为首个支持「听声辨位」的全模态大模型,可融合空间声音与视觉信息判断声源方向和距离,并可通过 Skill 注入身份设定、表达风格、业务知识与交互规则。

官方还公布了一项模型优化实验:Qwen3.8-Omni-Flash 在 12 小时内自主优化 Qwen2.5-Omni-3B 的四川方言语音识别,自主选定 WenetSpeech-Chuan 评测集并建立基线,经 4 轮实验构建 3413 条训练数据,字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。官方称该实验展示了大模型驱动研发、小模型服务业务需求的新路径。

第三方报道方面,IT之家称阿里千问于 9 月 18 日正式上线该模型,并转述官方称其在累计 30 项评测上平均得分提升超过 26%,AliMeeting 的 DER/cpWER 从 88.11/89.61 降至 3.35/17.18;X 用户 karminski 称多人重叠会议语音识别错误率从上一代的 88% 降至 3%,并称音频输入价格从每百万 token 18 元降至 0.8 元。Testing Catalog 与 The Decoder 均报道该模型具备 1M token 上下文、音视频理解能力接近 Gemini 3.8 Flash,The Decoder 称其 API 定价为每百万输入 token 0.15 美元、输出 0.47 美元,低于 Gemini 3.8 Flash。

AI 汇总报道生成 · 3天前更新。单篇报道保留其发布时的原貌。

最新进展

历史报道归档。当前热点以新版榜单为准。

报道时间线

沿着报道,了解事件的不同侧面。

显示 10全部报道最新在前
  1. The Decoder:AI News
    Qwen3.8-Omni-Flash 发布,价格低于 Gemini Flash 且多模态基准相当

    Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可联合处理音频和视频并自主使用工具,上下文窗口达 100 万 token。

  2. X:Testing Catalog (@testingcatalog)
    9月18日AI日报:Claude Code项目、Qwen3.8-Omni-Flash等发布

    阿里发布Qwen3.8-Omni-Flash,首个全模态智能体模型,1M上下文,原生音视频加工具调用,视频输入成本较3.5-Omni-Plus降约89%。Anthropic的Claude Code项目现可从单次对话启动,Claude并行云端线程并保留共享记忆;Claude Chat与Cowork合并为统一Claude,向Pro和Max滚动推送。

  3. MarkTechPost
    阿里 Qwen 发布 Qwen3.8-Omni-Flash:1M 上下文的全模态智能体模型

    阿里 Qwen 团队发布 Qwen3.8-Omni-Flash,称其为首款围绕智能体能力构建的全模态模型,接受文本、图像、音频和视频输入并返回文本,上下文窗口为 1M tokens。

  4. X:Testing Catalog (@testingcatalog)
    阿里发布全模态模型 Qwen3.8-Omni-Flash,支持音频和视频理解

    阿里发布全模态模型 Qwen3.8-Omni-Flash,支持音频和视频理解。该模型配备 1M-token 上下文窗口,在 WildClawBench-MM 与 UniClawBench 上性能接近 Gemini 3.8 Flash。

  5. Hacker News 热门(buzzing.cc 中文翻译)精选
    Qwen3.8-Omni-Flash 发布:原生全模态模型主打音视频智能体能力

    Qwen 团队发布原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入和 1M token 上下文窗口,在 29 项评测中平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%。

  6. IT之家精选
    阿里发布全模态模型 Qwen3.8-Omni-Flash,支持 1M 上下文,百万 Token 图文音视频输入 0.8 元

    阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,可同时处理文本、图像、音频和视频输入,支持 1M 上下文。在 30 项评测上相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%,官方称音视频能力接近 Gemini 3.8 Flash、音频能力整体超过 Gemini 3.8 Flash。

  7. Hacker News:AI 热帖精选
    阿里发布 Qwen3.8-Omni-Flash 全模态模型并开源 Qwen-Live Harness

    Qwen 团队发布新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,核心目标是将全模态能力从内容理解推进到任务规划、工具调用与创作交付。

  8. X:通义千问 / Qwen (@Alibaba_Qwen)官方一手精选
    通义千问发布 Qwen3.8-Omni-Flash 全模态模型

    通义千问发布 Qwen3.8-Omni-Flash,是 Qwen 首个以智能体能力为核心构建的全模态模型,支持原生音视频理解、推理和工具调用。

  9. X:karminski (@karminski3)
    Qwen 发布 Qwen3.8-Omni-Flash,并推出 Qwen-Live-Harness 与 Qwen-MM-Plugins 两个配套框架

    Qwen 发布 Qwen3.8-Omni-Flash,平均分比 Qwen3.5-omni-flash 提升 25%,多人重叠会议语音识别错误率从 88% 降到 3%,原生支持最长 1 小时连续音视频输入,音频输入价格从每百万 token 18 元降到 0.8 元,另发布超低延迟版 Qwen3.8-Omni-Flash-Realtime(20s 音频约 981ms)。

  10. Qwen:Blog Retrieval(API)官方一手精选
    Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

    Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

3 DAYS

本事件热度走势

当前热度 32峰值 709月18日 17:00近24小时下降 36%

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。