Qwen宣布将开源Qwen-Live Harness,状态为coming soon、尚未开放
事件全貌
AI 综述Qwen 团队发布新一代原生全模态模型 Qwen3.8-Omni-Flash,并在千问 AI 平台开放。据其官方博客,该模型支持文本、图像、音频、视频输入与 1M token 上下文窗口,核心目标是强化真实生产力场景中的智能体能力,使全模态模型从「理解全模态内容」走向「规划任务、调用工具、完成创作」。官方称在 29 项评测中平均分较 Qwen3.5-Omni-Plus 提升超 25%,音频输入每小时 API 价格下降超 98%,音视频输入每小时价格下降超 93%;视频输入成本较上代降低约 89%。官方还称其音视频能力接近 Gemini 3.8 Flash,在 WildClawBench-MM 与 UniClawBench 上智能体表现平均提升 19.5 分,并在 OmniVideoBench 上比静态理解少用 51.8% token。第三方账号 karminski 转述称多人重叠会议语音识别错误率从上一代的 88% 降至 3%,音频输入价格从每百万 token 18 元降至 0.8 元。
同批发布还包括配套框架与插件。官方称 Qwen-MM-Plugins 为面向智能体框架的多模态插件套件,支持 Codex、Claude Code、Qwen Code、Gemini CLI、Qoder、CodeBuddy、OpenClaw 等,提供图像、音频、视频、文档理解及长视频记忆与内容创作能力,并新增开源能力 Video2Note 与 Omni Skill Creator;后者可从演示视频中提取标准作业流程(SOP)生成可复用智能体技能。Qwen-Live Harness 被描述为围绕 Qwen3.8-Omni-Flash-Realtime API 的开源运行时,支持任务委派、主动交互、长期记忆与上下文管理,可一条命令安装。karminski 补充称 Qwen-Live Harness 提供悬浮球对话、环境监控与任务看板跟进播报。
官方还推出面向持续低延迟交互的 Qwen3.8-Omni-Flash-Realtime,可在接收实时音视频流的同时感知、响应并调用工具执行任务。karminski 称该超低延迟版本在 20 秒音频下延迟约 981ms。官方博客另记录一项实验:让 Qwen3.8-Omni-Flash 在 12 小时内自主优化 Qwen2.5-Omni-3B 的四川方言语音识别,代理自行选定 WenetSpeech-Chuan 评测集、固定评测标准并建立基线,经四轮实验创建 3,413 条训练样本,最终将同一评测集上的字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。
关于 Qwen-Live Harness 的开源状态,官方 X 账号在宣布开源 Qwen-MM-Plugins 与 Qwen-Live Harness 的同一条帖文中,将 Qwen-Live Harness 标注为「coming soon」,而官方博客与第三方报道则称其已开源。
AI 汇总报道生成 · 20分钟前更新。单篇报道保留其发布时的原貌。
Qwen 官方 X 帖文在宣布开源 Qwen-MM-Plugins 与 Qwen-Live Harness 时,将 Qwen-Live Harness 标注为「coming soon」,尚未开放。
报道时间线
沿着报道,了解事件的不同侧面。
- 通义千问发布 Qwen3.8-Omni-Flash 全模态模型
通义千问发布 Qwen3.8-Omni-Flash,是 Qwen 首个以智能体能力为核心构建的全模态模型,支持原生音视频理解、推理和工具调用。