Venus Team、蚂蚁集团和清华大学发布 Realtime-Venus 全双工交互系统源代码,包含 Omni 与 Audio 模型、Harness 框架及浏览器 Demo,附论文 arXiv:2609.13814
事件全貌
AI 综述Venus Team、蚂蚁集团与清华大学发布 Realtime-Venus 全双工交互系统源代码,包含 Omni 与 Audio 模型、Harness 框架及浏览器 Demo,并附论文 arXiv:2609.13814。系统定位为可实时看、听、回应,并在对话进行时并行执行后台任务:用户可让助手处理一项任务,同时继续交谈,结果返回同一对话并以语音播报。
组件方面,Realtime-Venus-Omni(9B)为流式音视频对话模型,支持主动交互与原生语音生成;Realtime-Venus-Audio(9B)为单独训练的语音交互、音频理解与原生语音生成模型;Realtime-Venus-Harness 为共享运行时,负责捕获委派请求、执行后台工作并把结果返回原对话。论文描述模型家族、双循环运行时、训练数据与评估;本次源码发布包含 Omni 模型集成、可复用的 Harness 包,以及使用 Codex 任务后端的浏览器 Demo,Demo 的纯麦克风模式也使用 Omni。
HuggingFace 仓库托管 Realtime-Venus 系统的两个检查点:Realtime-Venus-Omni 为 9B 音视频交互模型,持续观看和聆听、决定是否及何时回应,并在同一因果时间线上生成文本与语音,基于 MiniCPM-o 4.5 适配,支持主动交互、语义打断处理与免训练长视频记忆;Realtime-Venus-Audio 为同一流式骨干上的音频专注检查点,用于音频理解及以文本或语音输出的音频驱动对话。两个目录均含模型权重与自定义 Hugging Face Transformers 代码,异步 Realtime-Venus-Harness 及其外部工具集成位于 GitHub 仓库。
许可方面,仓库源代码采用 Apache License 2.0,另有单独许可声明的组件除外;第三方字体与论文图表保留各自许可。
AI 汇总报道生成 · 21分钟前更新。单篇报道保留其发布时的原貌。
HuggingFace 仓库新增 Realtime-Venus-Audio 9B 音频专注检查点,用于音频理解及以文本或语音输出的音频驱动对话。
报道时间线
沿着报道,了解事件的不同侧面。
- 蚂蚁 inclusionAI 开源全双工音视频交互模型 Realtime-Venus
蚂蚁集团 inclusionAI 在 Hugging Face 发布 Realtime-Venus,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点,基于 MiniCPM-o 4.5 / Omni-Flow 架构,语言骨干为 Qwen3-8B。
- 蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统
蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。