# DR-Venus：基于开放数据的边缘级深度研究智能体

- 来源：蚂蚁 inclusionAI：GitHub 新仓库
- 作者：inclusionAI
- 发布时间：2026-04-20 17:31
- AIHOT 分数：69
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmorb7ik2006islhfoemox8w3
- 原文链接：https://github.com/inclusionAI/DR-Venus

## 精选理由

4B 参数、仅用 1 万条公开数据就能在多个 deep research benchmark 上碾压 8B 对手，蚂蚁 inclusionAI 这次证明了小模型做 Agent 的关键不在参数量而在数据管线，做端侧 Agent 的团队值得拆一下它的 SFT+RL 流程。

## AI 摘要

DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体，基于Qwen3-4B-Thinking-2507架构，支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练，在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型，而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。

## 正文

DR-Venus 是一个4B 参数的深度研究智能体，完全基于开放数据训练而成。它在多个深度研究基准上确立了小模型的新前沿，证明在边缘规模下，通过精心的数据筛选和有效的训练策略，可以涌现出强大的智能体能力。

图 1：DR-Venus 训练流程概览。

骨干模型 Qwen3-4B-Thinking-2507

训练数据 仅开放数据（REDSearcher Data）

工具协议 search + visit

交互步数上限 最多 200 个工具调用步骤

上下文长度 200K+（训练）/ 256K（推理）

🔥 新闻

2026-04-24 发布了 GGUF 版本的模型 checkpoint：DR-Venus-4B-SFT-GGUF 和 DR-Venus-4B-RL-GGUF。

2026-04-23 我们的技术报告现已在 arXiv 和 HF Daily Paper 上发布（当日论文第 3 名）。

2026-04-22 发布了模型 checkpoint：DR-Venus-4B-SFT 和 DR-Venus-4B-RL。

2026-04-22 开源了完整的训练和推理代码库。

📖 概述

DR-Venus 的核心目标是在有限的开放数据监督下，通过提升数据质量和有效数据利用率，构建一个强大的边缘规模深度研究智能体。该项目包含三个阶段：

阶段 描述 代码

1. SFT 将原始的 REDSearcher 轨迹转换为统一的智能体格式，清理嘈杂的工具交互，筛选出正确的内容，并在监督微调之前通过轮次感知的重采样对长时程轨迹进行加权提升。 SFT/

2. RL 从 SFT 检查点出发，应用长时程强化学习，采用 IGPO 风格的信息增益奖励和轮次级别的格式感知惩罚。 RL/

3. 推理 使用与训练时相同的 search + visit 工具协议部署训练好的模型。 Inference/

📊 主要结果

DR-Venus-4B 在多个深度研究基准上确立了强大的小模型前沿水平。

与小规模开源模型的对比

模型 BrowseComp BrowseComp-ZH GAIA（文本） xBench-DS-2505 xBench-DS-2510 DeepSearchQA

DeepDive-9B-SFT 5.6 15.7 -- 35.0 -- --

DeepDive-9B-RL 6.3 15.1 -- 38.0 -- --

WebSailor-7B 6.7 14.2 37.9 34.3 -- --

OffSeeker-8B-SFT 10.6 24.2 47.6 48.0 -- --

OffSeeker-8B-DPO 12.8 26.6 51.5 49.0 -- --

WebExplorer-8B-RL 15.7 32.0 50.0 53.7 23.0 17.8

AgentCPM-Explore-4B 24.1 29.1 63.9 70.0 34.0 32.8

DR-Venus-4B-SFT 26.8 35.7 65.4 69.0 35.3 37.7

DR-Venus-4B-RL 29.1 37.7 64.4 74.7 40.7 39.6

核心要点：

DR-Venus-4B-SFT 在大多数被跟踪的基准上已经超越了此前的小型开源智能体。

DR-Venus-4B-RL 在 SFT 的基础上进一步提升，在 BrowseComp 上提升 +2.3，在 BrowseComp-ZH 上提升 +2.0。

RL 主要提升了长时程执行的可靠性、格式稳定性以及工具使用的校准能力。

图 2：在 BrowseComp 和 BrowseComp-ZH 上的 Pass@K 对比。

📦 数据流水线

SFT 流水线基于开放的 REDSearcher 轨迹构建，重点在于让有限的监督信号对小模型更有用。

Raw REDSearcher Trajectories (10,001) │ ├── Structural Cleaning ── environment alignment, tool normalization, │ disallowed-tool pruning, duplicate removal ├── Correctness Filtering ── keep trajectories with correct final answers │ → 9,365 trajectories └── Turn-Aware Resampling ── upweight longer trajectories to emphasize deep research behavior → 18,745 final SFT instances

在 RL 方面，我们使用从 REDSearcher RL 数据源 中整理出的开放 QA 监督数据。

✨ 演示

DR-Venus 演示视频

针对问题的 DeepResearch：“《真探》第一季里有一句类似‘useless spin’的台词出现在第几集？”。

🚀 快速开始

每个子目录都有自己的依赖项和入口脚本。完整细节请参阅各子项目的 README。

1. 推理

使用 search 和 visit 工具运行训练好的模型：

cd Inference pip install -r requirements.txt

# Configure API credentials used by the tool server first bash run_demo.sh

# Or launch the web demo bash run_web_demo.sh --model_path <MODEL_PATH> --num_gpus <NUM_GPUS>

完整设置指南请参阅 Inference/README.md。

2. SFT

准备清洗后的轨迹并训练 SFT checkpoint：

cd SFT pip install -e . pip install -r requirements.txt

# Optional: convert raw RED trajectories into SFT-ready parquet python data_clean/prepare_trajectories.py \ --input <RAW_PARQUET_OR_DIR> \ --output-dir <OUTPUT_DIR>

# Run supervised fine-tuning bash train_sft.sh

数据格式、环境变量和 checkpoint 合并请参阅 SFT/README.md。

3. 强化学习

从 SFT 检查点继续，进行长时程强化学习：

cd RL pip install -r requirements.txt

# Edit .env and train_igpo.sh first bash train_igpo.sh

有关奖励配置、rollout 设置和故障排查，请参见 RL/README.md。

🔌 外部服务

Inference/ 和 RL/ 都依赖外部工具和模型端点。SFT 不需要这些。

服务 用途

Serper 网页搜索

Jina Reader 网页抓取

OpenAI 兼容 API 页面摘要

OpenAI 兼容评判模型 强化学习奖励评估

📁 仓库结构

DR-Venus/ ├── README.md ├── assets/ │ ├── dr-venus-overview.png │ └── dr-venus-passk.png ├── SFT/ │ ├── data_clean/ # RED trajectory conversion & cleaning │ ├── scripts/ # Checkpoint merge utilities │ ├── sft_shells/ │ ├── train_sft.sh │ └── README.md ├── RL/ │ ├── configs/ │ ├── data/ │ ├── tool_server/ │ ├── train_igpo.sh │ └── README.md ├── Inference/ │ ├── tool_server/ │ ├── run_demo.sh │ ├── run_web_demo.sh │ └── README.md └── model_cards/

🤝 致谢

DR-Venus 建立在多个强大的开源基础之上：

verl —— 训练基础设施

IGPO —— 强化学习算法基础

Tongyi DeepResearch —— 深度研究智能体设计参考

REDSearcher —— 开放数据轨迹及相关工具

📝 引用

@article{venus2026drvenus, title={DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data}, author={Venus Team and Dai, Sunhao and Deng, Yong and Lin, Jinzhen and Song, Yusheng and Wang, Guoqing and Wu, Xiaofeng and Zhou, Yuqi and Yang, Shuo and Ying, Zhenzhe and Zhang, Zhanwei and Meng, Changhua and Wang, Weiqiang}, journal={arXiv preprint arXiv:2604.19859}, year={2026} }
