H Company 发布 Holo4 智能体模型系列,含 27B 与 35B-A3B 两个版本
Holo4: powering generalist computer-use agents
H Company 发布通用计算机使用智能体模型系列 Holo4,含 27B dense 和 35B-A3B MoE 两个尺寸,并基于 Nemotron 3 Nano Omni 推出 Holotron4 Nano。
原文给出跨 GUI、代码、MCP 和 API 的统一智能体模型设计、基准分数和成本对比,并开源权重与轨迹数据,读者可评估其实际可用性。
Holo4 是我们全新的智能体模型系列。它有两种规模:27B 稠密版和 35B-A3B 混合专家版。两者均可在 H Models API 上使用。我们还发布了 Holotron 3 的更新版本:Holotron4 Nano。
Holo4 基于我们之前的模型构建,可通过任何可用的界面与软件交互:GUI、代码、MCP 和 API。它在学术基准测试中得分很高,但我们是专为真实业务工作流而构建的。它通过监督学习和强化学习,在大量环境和任务上进行了训练,包括由我们的 Agentic Task Factory 生成的任务。
立即开始:
- 🤖 模型: Holo4-27B | Holo4-35B-A3B | Holotron4 Nano
- 🗂️ 完整合集(FP16、FP8、GGUF): Holo4
- 🎞️ 轨迹: 查看器 | 数据集
- ⚡ H Models API: 快速开始
- 📝 完整博客文章: hcompany.ai/newsroom/holo4
为每种界面打造的模型
Holo4 可以在屏幕上点击和输入,编写并运行自己的代码,并调用 MCP 或 API 工具。它会选择最适合任务的方式。大多数智能体模型只针对一种界面进行训练:专注于 GUI 的模型没有屏幕就寸步难行,而偏好工具调用的模型则卡在没有 API 的应用程序面前。真实工作并非如此孤立,单个业务任务可能需要结合这些不同的方法。
Holo4 可在桌面、网页、Android、代码沙箱以及业务 API 上运行。每种情况下都是同一个模型,调用方式也相同。你无需为每个平台选择不同的模型。
Holo4 模型相比其 Qwen 基础版本有显著提升。在长工作流上,Holo4 仅落后于最强的闭源模型:在 OSWorld 2.0 上,Holo4 27B 得分为 61.7%,而 Opus 5.5 为 81.8%,Holo4 35B-A3B 则达到 30.9%。然而,它是在参数数量少几个数量级、成本低得多的情况下做到的。我们开源了公开基准测试得分背后的所有轨迹:可在 trajectories.hcompany.ai 回放每一步,或从 Hugging Face 下载。
以极低成本比肩前沿
在桌面控制(OSWorld 2.0)和 API 使用(AutomationBench)最难的学术基准测试中,Holo4 以远低于前沿模型的每任务成本与之竞争。
成本-性能图表说明
OSWorld 2.0。成本根据每次智能体运行的输入和输出 token 估算。Holo4 按 H Models API 费率计价(单次运行)。Qwen3.8 27B:模型卡分数,成本来自我们在阿里云按目录价运行所消耗的 token。Qwen3.6 35B-A3B:在我们的测试框架中单次运行,按阿里云目录价计算,缓存命中按输入价格的 20% 计。OpenAI 发布数据提供了 GPT 和 Opus 的投入扫描;其他闭源和开放权重数据点使用官方 OSWorld 2.0 排行榜。各版本、测试框架和任务子集有所不同。该连线连接闭源模型中非支配的分数与成本对;Holo4 被排除在外。
AutomationBench。Holo4、Qwen3.8 27B 和 Qwen3.6 35B-A3B:AutomationBench v1.0.6,分数和成本在我们的内部测试框架中测量。其他模型:公开集分数来自 AutomationBench README,每任务成本来自官方排行榜,该排行榜在私有集上运行。我们将在 Holo4 于私有集上评估后报告其结果。
能干活儿的 AI
Holo4 模型在我们的 Agentic Task Factory 中的环境和任务上训练,在专业软件上表现出色。以下示例展示了 Holo4 27B 与其基础模型 Qwen3.8 27B 的对比。两个模型使用相同的提示词和测试框架。
3D 建模 · 埃菲尔铁塔
在 FreeCAD 中构建埃菲尔铁塔的 3D 模型,比例为 1 毫米比 1 米,以原点为中心并与 X 轴和 Y 轴对齐。按此设计进行制作。
塔在任意高度上平面均为方形,绝不为圆形。其半宽,即从中心轴到角点的距离,在地面处为 62.5 毫米,在高度 57 处为 32.5 毫米,在高度 115 处为 17.5 毫米,在高度 276 处为 9.35 毫米。在这些高度之间,半宽遵循一条平滑曲线,靠近地面处下降陡峭,较高处下降平缓,绝不为直线。
四条相同的塔腿,每个象限一条,每条均为方形柱,其外角遵循该轮廓。每条塔腿在地面处宽 14 毫米,在高度 276 处渐缩至 4 毫米。塔腿从地面到第一层平台之间彼此分离,并随高度上升而收拢。它们之间的空间不填充任何东西:塔是通透的,从各个方向都能直接看穿。
三层平台,每层均为以轴为中心的实心方形板:高度 57 处宽 72 毫米、厚 4 毫米;高度 115 处宽 40 毫米、厚 3 毫米;高度 276 处宽 22 毫米、厚 3 毫米。
一根从高度 276 到 324 的桅杆,方形,底部宽 8 毫米,向顶端渐缩至 2 毫米。
每个部件都必须是体积非零的封闭实体,且任何部件都不得填充塔腿之间的空间。
Holo4 27B(84 次调用,1.3M token)
Qwen3.8 27B(60 次调用,1.0M token)
3D 建模 · H 标志
在 FreeCAD 中构建 H 公司标志的 3D 模型:一个实心填充圆盘旁边是一个块状无衬线大写字母 H,两者拉伸至相同厚度,两个形状高度相近且彼此分开不重叠,圆盘的中心与 H 的中部齐平。将两个形状都涂成黑色。
Holo4 27B(94 次调用,1.5M token)
Qwen3.8 27B(118 次调用,1.9M token)
游戏设计 · 吃豆人
在 Godot 中构建一个吃豆人风格的游戏,并让它保持运行。
一个矩形迷宫,墙壁分布在网格上,每条开放的通道里都填满了豆子。一个玩家标记沿着通道持续移动,吃掉经过的每颗豆子并为此得一分。三只幽灵穿过同样的通道追逐玩家。如果幽灵抓到玩家,玩家失去一条命,一切重置到起始位置。分数和生命值显示在屏幕上。
没人会玩这个。玩家用简单的启发式规则自我驱动:在每个路口,它朝最近的豆子前进,除非有幽灵靠近,此时它会远离幽灵移动。游戏必须无人值守地无限运行,完全不需要键盘输入。
当它正常工作时,启动游戏并让它一直玩下去。
Holo4 27B(68 次调用,2.4M tokens,268 行)
Qwen3.8 27B(197 次调用,11.4M tokens,327 行)
我们如何构建 Holo4
智能体任务工厂
我们内部的智能体流水线集合仅凭文档就能构建交互式环境和可验证任务,例如真实网站或开源软件的截图。到目前为止,它已在 Web 应用、MCP 服务器和桌面环境中生成了约 10,000 个任务,包括通过 GUI 和 MCP 暴露相同状态的混合环境。
训练
Harness
在训练的同时,我们重建了 harness,即在数百步中执行模型动作并管理其上下文的循环,利用了 OSWorld 2.0 上智能体表现的反馈。智能体标记了每个任务失败的原因,工程师审查了他们的修复。最大的变化是给智能体一个可靠的记忆,能够跟踪数百步,以及在桌面机器本身上提供一个 shell。
Opus 5(70.2%)和 GPT-5.6 Sol(66.2%)在 OpenAI 发布图表的 v2026.08.08 离线集上使用最大努力部分奖励,与成本-性能图一致。其他参考分数来自模型卡和官方排行榜。任务发布、子集和 harness 各不相同。
Holotron4 Nano
我们的后训练栈旨在适应新的基础模型,并产生能在各种界面和环境中泛化的智能体。作为 NVIDIA Nemotron Coalition 的成员,我们将最新的栈应用于 Nemotron 3 Nano Omni 模型,作为 Holotron 3 的后续。
同样的配方将 Nemotron 3 Nano Omni 变成 Holotron4 Nano,一个通用智能体模型,在 GUI 工作流以及暴露 MCP、API 或编码沙盒的环境中显著优于基础模型。
增益是相对于 Nemotron 3 Nano Omni 的绝对百分点提升。
这些增益表明我们的配方迁移良好,可以将通用模型变成智能体专家。其中没有任何内容是特定于规模的。
自己运行
两种规模现已在 H Models API 上提供。权重在 Hugging Face 上以 BF16、FP8、NVFP4 和 4-bit GGUF 格式提供,旁边是我们的小型模型 Holotron4 Nano。
我们将在未来几天发布优化的 DSpark drafter 检查点,以进一步加速推理。
来源:Hugging Face:Blog(RSS) · huggingface.co