# 蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统

- 来源：蚂蚁 inclusionAI：GitHub 新仓库
- 作者：inclusionAI
- 发布时间：2026-09-16 15:57
- AIHOT 分数：62
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmu70p8rz0lwirowknowy7cwc
- 原文链接：https://github.com/inclusionAI/Realtime-Venus

## 精选理由

蚂蚁和清华开源了全双工对话加异步委托任务的系统，含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时，可直接下载推理或跑浏览器 demo。

## AI 摘要

蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus，一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件：Realtime-Venus-Omni（9B，流式音视频对话与主动交互）、Realtime-Venus-Audio（9B，语音交互与音频理解）以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。

## 正文

一个具备异步委派能力的全双工交互系统

Venus 团队 · 蚂蚁集团 · 清华大学

概览 · 快速开始 · 结果 · 代码结构 · 引用

概览

实时看、听、回应——同时让后台任务与对话并行运行。Realtime-Venus 将全双工对话模型与异步执行框架相结合。你可以让助手处理某项任务，并在其运行期间继续对话。结果会返回到同一段对话中，以语音形式播报。

该项目汇集了三个组件：

组件 作用

Realtime-Venus-Omni · 9B 一个面向流式音频与视频、主动交互以及原生语音生成的对话模型。

Realtime-Venus-Audio · 9B 一个单独训练的模型，用于语音交互、音频理解和原生语音生成。

Realtime-Venus-Harness 一个共享运行时，负责捕获委派的请求、执行后台工作，并将结果返回给发起该请求的对话。

Realtime-Venus 能实现什么

持续的视听交互。 Omni 观察流式摄像头和麦克风输入，并能在不断变化的场景需要时主动发起响应。

全双工对话。 模型在说话的同时处理传入的语音，学习区分确认应答和背景语音与需要修改回复的打断。

异步委派。 模型可以将自然语言任务交给 Harness 进行推理或工具执行，同时实时交互继续进行。

结果回到同一对话中。 Harness 准备回复；对话模型负责其时机和原生语音输出。工作追踪将任务完成与语音交付分离。

该论文介绍了该模型系列、双循环运行时、训练数据和评估。本次源码发布包含 Omni 模型集成、可复用的 Harness 包，以及一个使用 Codex 任务后端的浏览器演示。该演示的纯麦克风模式同样使用 Omni。

快速开始

1. 安装依赖

在仓库根目录下运行这些命令。如需独立推理，请使用带 CUDA 和 FFmpeg 的 Python 3.10，并安装你所使用模型的依赖：

# Realtime-Venus-Omni python -m pip install -r /path/to/Realtime-Venus-Omni/requirements.txt

# Realtime-Venus-Audio python -m pip install -r requirements.txt

如需运行浏览器演示，请在 Linux 上运行安装脚本。它会创建一个隔离的 Python 3.11/3.12 环境，并安装模型、Web 服务和 Harness 依赖：

bash install.sh

然后选择独立推理或下方的在线体验。

2. 离线推理 · 前端使用

从上方链接下载模型 checkpoint，并将示例路径替换为你本地的目录。

Realtime-Venus-Omni

export REALTIME_VENUS_MODEL_PATH=/path/to/Realtime-Venus-Omni

python frontend/Realtime-Venus-Omni/offline_chat.py # With long-video Memory python frontend/Realtime-Venus-Omni/offline_memory_chat.py

这些示例从 checkpoint 的 assets/ 目录读取视频，并输出文本和语音。如需改为对录制输入进行全双工推理：

python frontend/Realtime-Venus-Omni/duplex_chat.py python frontend/Realtime-Venus-Omni/duplex_speech_in_chat.py python frontend/Realtime-Venus-Omni/duplex_memory_chat.py

双工示例会保存带字幕的视频。输入与输出路径参见Omni 指南。

Realtime-Venus-Audio

python frontend/Realtime-Venus-Audio/audio_offline_chat.py \ --model-path /path/to/Realtime-Venus-Audio \ --audio frontend/Realtime-Venus-Audio/case/case_offline.wav

离线推理返回文本。要对录制的音频运行全双工推理并保存为 24 kHz WAV：

python frontend/Realtime-Venus-Audio/audio_duplex_chat.py \ --model-path /path/to/Realtime-Venus-Audio \ --audio frontend/Realtime-Venus-Audio/case/case_duplex.wav \ --output output/duplex_response.wav

两个脚本都接受--system-prompt和--prompt；解码选项参见音频指南。

3. 在线双工体验

在线双工演示需要至少一块 NVIDIA A100 GPU。将完整的 Omni checkpoint 放入model_weight/，然后启动演示：

bash start.sh

对于位于其他位置的现有 checkpoint：

bash start.sh --model-path /path/to/Realtime-Venus-Omni

如有提示，请完成 Codex 登录。启动器会在8031上启动模型 API，并在8032上启动浏览器服务。

如果在远程服务器上运行，请在本地计算机上保持此隧道开启，并将user@server替换为你的 SSH 登录信息：

ssh -N -L 8032:127.0.0.1:8032 user@server

打开 http://localhost:8032，选择 语音、摄像头 + 麦克风 或 上传视频，然后开始对话。Checkpoint 布局、配置和服务管理详见 演示指南。

结果

图 1. 来自 论文 的视频与音频理解结果。

图 2. 来自 论文 的全双工交互结果。

代码结构图

Realtime-Venus/ ├── harness/ # Context, routing, agents, work state, and delivery │ ├── README.md │ └── requirements.txt # Harness media dependencies ├── frontend/ │ ├── Realtime-Venus-Omni/ # Audiovisual inference examples │ └── Realtime-Venus-Audio/ # Audio inference examples and input samples ├── demos/ │ ├── model/ # Checkpoint adapter and model HTTP API │ ├── server/ # Web sessions, media, settings, and artifacts │ ├── static/ # Browser UI, capture, playback, and logos │ ├── launcher/ # Configuration and process supervision │ ├── settings.py # Saved task and model preferences │ ├── install.py # Isolated environment installation │ └── requirements.txt # Model and application dependencies ├── assets/ # Paper figures, report, and Demo screenshot ├── pyproject.toml # Standalone Harness package ├── requirements.txt # Shared dependency entry for inference examples ├── config.example.json # Server configuration template └── install.sh / start.sh # Install, start, inspect, and stop the Demo

引用

@article{zhao2026realtime, title={{Realtime-Venus}: A full-duplex interaction system with asynchronous delegation}, author={{Venus Team,Ant Group;Tsinghua University}}, journal={arXiv preprint arXiv:2609.13814}, year={2026} }

许可证

本仓库中的源代码依据 Apache License 2.0 授权，带有单独许可声明的组件除外。第三方字体和论文插图保留各自的许可证；请参阅 demos/static/fonts/ 和 assets/README.md 中的许可证文件。
