Qwen 发布 Qwen3.8-Omni-Flash,并推出 Qwen-Live-Harness 与 Qwen-MM-Plugins 两个配套框架

karminski-牙医 · @karminski3 · X·2026-09-18 08:57·49分钟前
AI 导读

Qwen 发布 Qwen3.8-Omni-Flash,平均分比 Qwen3.5-omni-flash 提升 25%,多人重叠会议语音识别错误率从 88% 降到 3%,原生支持最长 1 小时连续音视频输入,音频输入价格从每百万 token 18 元降到 0.8 元,另发布超低延迟版 Qwen3.8-Omni-Flash-Realtime(20s 音频约 981ms)。

karminski-牙医@karminski3
71AI 编辑部评分,满分 100

Qwen 发布 Qwen3.8-Omni-Flash,并推出 Qwen-Live-Harness 与 Qwen-MM-Plugins 两个配套框架

2026-09-18 08:57· 49分钟前
AI 导读

Qwen 发布 Qwen3.8-Omni-Flash,平均分比 Qwen3.5-omni-flash 提升 25%,多人重叠会议语音识别错误率从 88% 降到 3%,原生支持最长 1 小时连续音视频输入,音频输入价格从每百万 token 18 元降到 0.8 元,另发布超低延迟版 Qwen3.8-Omni-Flash-Realtime(20s 音频约 981ms)。

Qwen-Live-Harness? 来看看是啥

Qwen 刚刚发布了 Qwen3.8-Omni-Flash! 同时还发布了两个配套框架, Qwen-Live-Harness, Qwen-MM-Plugins. 给大家整理一下都是啥.

首先Qwen3.8-Omni-Flash, 比上一代的Qwen3.5-omni-flash 平均分提升了25%. 其中最猛的就是Agent能力, 有的分数甚至翻倍了.

然后多人重叠会议语音识别的错误率直接从上一代的88%降低到了3%. 真正的可用了. 除此之外, 原生支持最长 1 小时的完整连续音视频输入, 并且API费用降低了98%.

98%是什么概念? 之前音频输入每百万token是18块, 现在是0.8元!

除此之外, 这次还发布了 Qwen3.8-Omni-Flash-Realtime, 这个是超低延迟版本, 能做到听完问题, 稍加思考后开口的效果(20s音频约981ms).

而 Qwen-Live-Harness 和 Qwen-MM-Plugins 又是啥呢?

首先 Qwen-Live-Harness 搞了个悬浮球, 点击后就可以与模型对话了, 它还能做到环境监控, 比如可以跟它说: 我离开一会, 任务跑完了叫我. 它会把任务塞到任务看板里面, 持续跟进任务状态, 最后播报.

而Qwen-MM-Plugins则是个"赋能"插件库, 可以给 Claude Code、Gemini CLI、Codex、OpenClaw 安装, 装之后就可以多模态的调用 Qwen3.8-Omni-Flash 了. 补齐本地Agent视觉, 长视频记忆能力, 包括操作Blender或者CAD软件进行视觉建模也可以.

除此之外, 里面还弄了个特别有意思的叫 omni-skill-creator, 只需要录一段操作软件的视频, 然后丢给它, 他就能帮你形成操作这个软件的skill! 很像那种机械臂的示教学习, 只需要拉着机械臂的手走一遍, 机械臂就学会接下来怎么操作了. 一定要注意, 模型是全模态的, 所以录视频的时候还可以把自己的语音一起录进去, 告诉模型为什么这么做, 加深模型的理解, 创建出来的skill更准确.

#Qwen38omniflash #QwenLiveHarness #QwenMMPlugins