跳到正文
Hugging Face:Blog·· 2025-06-11精选AI 评分65

Hugging Face 与 NVIDIA 合作推出 Training Cluster as a Service

Introducing Training Cluster as a Service - a new collaboration with NVIDIA

AI 导读

Hugging Face 在 GTC Paris 上与 NVIDIA 合作发布 Training Cluster as a Service,让全球研究机构可以按训练时长申请 GPU 集群。

推荐理由

原文给出入口、合作组件和三类研究机构的使用案例,读者可以判断它如何降低获取 GPU 集群的门槛。

正文 · AI 翻译

今天在 GTC 巴黎,我们很高兴地宣布与 NVIDIA 合作推出 Training Cluster as a Service,让世界各地的研究机构更容易使用大型 GPU 集群,从而为各个领域训练未来的基础模型。

让 GPU 集群触手可及

许多千兆瓦级 GPU 超级集群项目正在建设中,用于训练下一代 AI 模型。这似乎让“GPU 贫乏”与“GPU 富裕”之间的算力差距迅速扩大。但 GPU 就在那里,超大规模云厂商、区域云提供商和 AI 原生云提供商都在迅速扩大其容量。

那么,我们如何将 AI 算力与需要它的研究人员连接起来?我们如何让世界各地的大学、国家研究实验室和公司能够构建自己的模型?

这正是 Hugging Face 和 NVIDIA 通过 Training Cluster as a Service 所解决的问题——提供 GPU 集群可访问性,并具有仅按训练运行时长付费的灵活性。

要开始使用,Hugging Face 上的 250,000 个组织中的任何一个都可以在需要时请求所需的 GPU 集群规模。

工作原理

要开始使用,您可以代表您的组织在 hf.co/training-cluster 请求 GPU 集群

Training Cluster as a Service 将 NVIDIA 和 Hugging Face 的关键组件集成到一个完整的解决方案中:

  • NVIDIA 云合作伙伴在区域数据中心为最新的 NVIDIA 加速计算(如 NVIDIA Hopper 和 NVIDIA GB200)提供容量,所有这些都集中在 NVIDIA DGX Cloud 中
  • NVIDIA DGX Cloud Lepton——今天在 GTC 巴黎宣布——为研究人员提供对已配置基础设施的便捷访问,并支持训练运行调度和监控
  • Hugging Face 开发者资源和开源库让训练运行轻松启动。

一旦您的 GPU 集群请求被接受,Hugging Face 和 NVIDIA 将根据您的规模、区域和时长要求,合作进行采购、定价、配置和设置您的 GPU 集群。

集群实践

与 TIGEM 共同推进罕见遗传病研究

Telethon 基因组与医学研究所——简称 TIGEM——是一个致力于理解罕见遗传病分子机制并开发新疗法的研究中心。训练新的 AI 模型是预测致病变异效应和药物重定位的新途径。

AI 为研究罕见遗传病的病因和开发治疗方法提供了新途径,但我们的领域需要训练新模型。Training Cluster as a Service 让我们能够在合适的时间轻松获取所需的 GPU 容量

-- Diego di Bernardo,TIGEM 基因组医学项目协调员

与 Numina 共同推进数学 AI

Numina 是一个非营利组织,致力于构建用于数学推理的开源、开放数据集 AI——并赢得了 2024 年 AIMO 进步奖。

我们正在顺利实现构建最佳闭源模型(如 Deepmind 的 AlphaProof)的开源替代方案的目标。计算资源是我们当前的瓶颈——通过 Training Cluster as a Service,我们将能够实现我们的目标!

-- Yann Fleureau,Project Numina 联合创始人

与 Mirror Physics 共同推进材料科学

Mirror Physics 是一家为化学和材料科学打造前沿 AI 系统的初创公司。

与 MACE 团队一起,我们正致力于推动 AI 在化学领域的极限。通过 Training Cluster as a Service,我们正在以前所未有的规模生成高保真化学模型。这将是该领域向前迈出的重要一步。

—— Sam Walton Norwood,Mirror 首席执行官兼创始人

为 AI 研究的多样性提供动力

Training Cluster as a Service 是 Hugging Face 与 NVIDIA 的一项新合作,旨在让全球 AI 研究者社区更容易获得 AI 算力。

获取大规模、高性能算力对于构建各个领域和语言的新一代 AI 模型至关重要。Training Cluster as a Service 将为研究人员和公司消除障碍,释放训练最先进模型的能力,并拓展 AI 可能性的边界。

—— Clément Delangue,Hugging Face 联合创始人兼首席执行官

将 DGX Cloud Lepton 与 Hugging Face 的 Training Cluster as a Service 集成,为开发者和研究人员提供了一种无缝的方式,可在广泛的云提供商网络中访问高性能 NVIDIA GPU。这一合作使 AI 研究人员和组织能够更轻松地扩展其 AI 训练工作负载,同时使用 Hugging Face 上熟悉的工具。

—— Alexis Bjorlin,NVIDIA DGX Cloud 副总裁

以 NVIDIA 赋能 AI 构建者

我们很高兴与 NVIDIA 合作,为 Hugging Face 组织提供 Training Cluster as a Service——你今天就可以在 hf.co/training-cluster 开始使用

今天在 GTC Paris 上,NVIDIA 宣布了许多面向 Hugging Face 用户的新贡献,从智能体到机器人!

来源:Hugging Face:Blog · huggingface.co