蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统

蚂蚁 inclusionAI:GitHub 新仓库·2026-09-16 15:57·2天前·inclusionAI
AI 导读

蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。

蚂蚁 inclusionAI:GitHub 新仓库
精选
62AI 编辑部评分,满分 100

蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统

2026-09-16 15:57· 2天前· inclusionAI
AI 导读

蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。

推荐理由

蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。

正文 · AI 翻译

一个具备异步委派能力的全双工交互系统

Venus 团队 · 蚂蚁集团 · 清华大学

Technical report Project website Hugging Face models ModelScope

概览 · 快速开始 · 结果 · 代码结构 · 引用

概览

实时看、听、回应——同时让后台任务与对话并行运行。Realtime-Venus 将全双工对话模型与异步执行框架相结合。你可以让助手处理某项任务,并在其运行期间继续对话。结果会返回到同一段对话中,以语音形式播报。

该项目汇集了三个组件:

组件 作用
Realtime-Venus-Omni · 9B 一个面向流式音频与视频、主动交互以及原生语音生成的对话模型。
Realtime-Venus-Audio · 9B 一个单独训练的模型,用于语音交互、音频理解和原生语音生成。
Realtime-Venus-Harness 一个共享运行时,负责捕获委派的请求、执行后台工作,并将结果返回给发起该请求的对话。

Realtime-Venus 能实现什么

  • 持续的视听交互。 Omni 观察流式摄像头和麦克风输入,并能在不断变化的场景需要时主动发起响应。
  • 全双工对话。 模型在说话的同时处理传入的语音,学习区分确认应答和背景语音与需要修改回复的打断。
  • 异步委派。 模型可以将自然语言任务交给 Harness 进行推理或工具执行,同时实时交互继续进行。
  • 结果回到同一对话中。 Harness 准备回复;对话模型负责其时机和原生语音输出。工作追踪将任务完成与语音交付分离。

论文介绍了该模型系列、双循环运行时、训练数据和评估。本次源码发布包含 Omni 模型集成、可复用的 Harness 包,以及一个使用 Codex 任务后端的浏览器演示。该演示的纯麦克风模式同样使用 Omni。

快速开始

1. 安装依赖

在仓库根目录下运行这些命令。如需独立推理,请使用带 CUDA 和 FFmpeg 的 Python 3.10,并安装你所使用模型的依赖:

# Realtime-Venus-Omni
python -m pip install -r /path/to/Realtime-Venus-Omni/requirements.txt

# Realtime-Venus-Audio
python -m pip install -r requirements.txt

如需运行浏览器演示,请在 Linux 上运行安装脚本。它会创建一个隔离的 Python 3.11/3.12 环境,并安装模型、Web 服务和 Harness 依赖:

bash install.sh

然后选择独立推理或下方的在线体验。

2. 离线推理 · 前端使用

从上方链接下载模型 checkpoint,并将示例路径替换为你本地的目录。

Realtime-Venus-Omni

export REALTIME_VENUS_MODEL_PATH=/path/to/Realtime-Venus-Omni

python frontend/Realtime-Venus-Omni/offline_chat.py
# With long-video Memory
python frontend/Realtime-Venus-Omni/offline_memory_chat.py

这些示例从 checkpoint 的 assets/ 目录读取视频,并输出文本和语音。如需改为对录制输入进行全双工推理:

python frontend/Realtime-Venus-Omni/duplex_chat.py
python frontend/Realtime-Venus-Omni/duplex_speech_in_chat.py
python frontend/Realtime-Venus-Omni/duplex_memory_chat.py

双工示例会保存带字幕的视频。输入与输出路径参见Omni 指南

Realtime-Venus-Audio

python frontend/Realtime-Venus-Audio/audio_offline_chat.py \
  --model-path /path/to/Realtime-Venus-Audio \
  --audio frontend/Realtime-Venus-Audio/case/case_offline.wav

离线推理返回文本。要对录制的音频运行全双工推理并保存为 24 kHz WAV:

python frontend/Realtime-Venus-Audio/audio_duplex_chat.py \
  --model-path /path/to/Realtime-Venus-Audio \
  --audio frontend/Realtime-Venus-Audio/case/case_duplex.wav \
  --output output/duplex_response.wav

两个脚本都接受--system-prompt--prompt;解码选项参见音频指南

3. 在线双工体验

在线双工演示需要至少一块 NVIDIA A100 GPU。将完整的 Omni checkpoint 放入model_weight/,然后启动演示:

bash start.sh

对于位于其他位置的现有 checkpoint:

bash start.sh --model-path /path/to/Realtime-Venus-Omni

如有提示,请完成 Codex 登录。启动器会在8031上启动模型 API,并在8032上启动浏览器服务。

如果在远程服务器上运行,请在本地计算机上保持此隧道开启,并将user@server替换为你的 SSH 登录信息:

ssh -N -L 8032:127.0.0.1:8032 user@server

打开 http://localhost:8032,选择 语音摄像头 + 麦克风上传视频,然后开始对话。Checkpoint 布局、配置和服务管理详见 演示指南

结果

Paper Figure 1: radar charts comparing video understanding for Omni and audio understanding for Audio
图 1. 来自 论文 的视频与音频理解结果。

Paper Figure 2: full-duplex benchmark comparisons for interruption handling and continuation under different types of overlapping speech
图 2. 来自 论文 的全双工交互结果。

代码结构图

Realtime-Venus/
├── harness/                # Context, routing, agents, work state, and delivery
│   ├── README.md
│   └── requirements.txt    # Harness media dependencies
├── frontend/
│   ├── Realtime-Venus-Omni/ # Audiovisual inference examples
│   └── Realtime-Venus-Audio/ # Audio inference examples and input samples
├── demos/
│   ├── model/              # Checkpoint adapter and model HTTP API
│   ├── server/             # Web sessions, media, settings, and artifacts
│   ├── static/             # Browser UI, capture, playback, and logos
│   ├── launcher/           # Configuration and process supervision
│   ├── settings.py         # Saved task and model preferences
│   ├── install.py          # Isolated environment installation
│   └── requirements.txt    # Model and application dependencies
├── assets/                 # Paper figures, report, and Demo screenshot
├── pyproject.toml          # Standalone Harness package
├── requirements.txt        # Shared dependency entry for inference examples
├── config.example.json     # Server configuration template
└── install.sh / start.sh    # Install, start, inspect, and stop the Demo

引用

@article{zhao2026realtime,
  title={{Realtime-Venus}: A full-duplex interaction system with asynchronous delegation},
  author={{Venus Team,Ant Group;Tsinghua University}},
  journal={arXiv preprint arXiv:2609.13814},
  year={2026}
}

许可证

本仓库中的源代码依据 Apache License 2.0 授权,带有单独许可声明的组件除外。第三方字体和论文插图保留各自的许可证;请参阅 demos/static/fonts/assets/README.md 中的许可证文件。

来源:蚂蚁 inclusionAI:GitHub 新仓库· github.com