跳到正文

公司与模型

Hugging Face 最新动态

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

224 条精选近 30 天 8 条共收录 659 条

更新

精选归档 · 第 11 页

12月9日周五第 201–220 条
  1. Hugging Face:Blog69

    Hugging Face 图解 RLHF:用人类反馈强化学习微调语言模型的完整流程

    Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 强化学习微调三个核心步骤,并解释 KL 惩罚如何防止策略偏离初始模型产生胡言乱语。文章还盘点 TRL、TRLX、RL4LMs 等开源工具,指出人类偏好数据成本高、标注不一致以及 PPO 之外优化器等仍待探索的方向。

    推荐理由:原文系统拆解 RLHF 三阶段流程与 KL 惩罚等细节,并盘点开源工具与局限,适合作为理解该技术的入门框架。

12月1日周四
  1. Hugging Face:Blog76

    如何在 Apple Silicon 上用 Core ML 运行 Stable Diffusion

    Hugging Face 与 Apple 合作,将 Stable Diffusion v1.4、v1.5、v2 base、v2.1 base 转换为 Core ML 版本并发布在 Hugging Face Hub,可在 Apple Silicon 的 CPU、GPU 和 Neural Engine 上运行。

    推荐理由:Hugging Face 官方整理了 Core ML 版 Stable Diffusion 的下载、Python 与 Swift 推理方法,读者可按机型选变体并迁移到自定义模型。

  2. Hugging Face:Blog60

    Hugging Face 教程:用 Time Series Transformer 做概率时间序列预测

    Hugging Face 发布教程,讲解如何用其 Transformers 库的 Time Series Transformer 从零训练单变量概率时间序列预测模型,涵盖 GluonTS 数据转换、DataLoader 构建、40 个 epoch 的训练及 generate() 自回归推理。

    推荐理由:教程展示了完整的代码训练流程,并在 Monash 基准上给出可对照的 MASE 结果,便于读者迁移到自己的时间序列数据。

11月21日周一
11月7日周一
11月3日周四
10月21日周五
  1. Hugging Face:Blog60

    Hugging Face 教程:从 PyTorch DDP 到 Accelerate 再到 Trainer 掌握分布式训练

    Hugging Face 发布教程,以 MNIST 训练示例讲解三种抽象层级的分布式数据并行训练:PyTorch 原生 torch.distributed 与 DDP、Accelerate 的轻量封装、Transformers 的 Trainer API。

    推荐理由:教程用同一个 MNIST 示例逐级展示三种分布式训练写法,读者可以按抽象层级选择适合自己项目的方案。

10月19日周三
10月13日周四
9月27日周二
  1. Hugging Face:Blog71

    Hugging Face 讲解 Accelerate 如何借助 PyTorch 加载和运行超大模型

    Hugging Face 发布博客讲解 Accelerate 如何加载和运行超出单机内存的超大模型。核心做法是用 PyTorch meta device 创建空模型、用 infer_auto_device_map 自动计算 GPU、CPU 与磁盘的设备分配,并按分片加载权重,通过 hooks 在每次前向传播前后搬运权重。

    推荐理由:原文逐层拆解 Accelerate 借助 PyTorch meta device 与分片加载运行超大模型的机制,并给出可在免费 Colab 复现的做法。

9月26日周一
9月12日周一
  1. Hugging Face:Blog75

    Hugging Face Diffusers 0.3 发布:图生图、Textual Inversion 与低显存优化

    Hugging Face 发布 diffusers 0.3,为扩散模型库新增图生图、Textual Inversion、实验性 inpainting、ONNX 导出和 macOS M1/M2 推理支持等功能。优化后 Stable Diffusion 显存占用降至 3.2GB,代价是约 10% 的速度损失;社区还贡献了视频生成、可解释性工具和日语、动漫方向的微调模型。

    推荐理由:原文梳理了 diffusers 0.3 的图生图、Textual Inversion、低显存优化等新功能,开源图像工作流的使用者可以对照更新自己的用法。

8月22日周一
8月17日周三
  1. Hugging Face:Blog79

    Hugging Face 详解 LLM.int8() 8 位量化在 transformers 中的集成与使用

    Hugging Face 与 bitsandbytes 合作,将 LLM.int8() 8 位矩阵乘法完整集成到 transformers 和 accelerate 库,使 BLOOM-176B 等大模型推理显存占用减半且无性能下降。

    推荐理由:文章由集成团队亲自讲解 LLM.int8() 的原理、异常值处理和 transformers 集成细节,并附基准数据与代码示例。

7月27日周三
  1. Hugging Face:Blog61

    Hugging Face 用 TensorFlow 与 XLA 加速文本生成,部分场景提速超 100 倍

    Hugging Face 宣布 🤗 transformers 的 TensorFlow 文本生成现可通过 XLA 编译加速,某些场景提速超过 100 倍,在多数基准中比 PyTorch 更快,最高快达 9 倍。

    推荐理由:Hugging Face 官方讲解如何用 jit_compile=True 加速 TensorFlow 文本生成,给出编译缓存机制、padding 技巧和实测数据,方法可直接复用。

7月12日周二
  1. Hugging Face:Blog78

    Hugging Face 发布 1760 亿参数开源多语言大模型 BLOOM

    Hugging Face 与 BigScience 发布 1760 亿参数的开源多语言大模型 BLOOM,支持 46 种自然语言和 13 种编程语言。模型由 70 多个国家、250 多个机构的 1000 多名研究者历时一年协作完成,在法国 Jean Zay 超算上训练 117 天,算力来自 CNRS 和 GENCI 价值约 300 万欧元的资助。

    推荐理由:原文来自 BLOOM 团队官方发布,给出了参数规模、语言覆盖、训练成本和开放使用方式,读者可以了解这个开放大模型的实际边界。

7月7日周四
6月7日周二
5月25日周三
  1. Hugging Face:Blog60

    Hugging Face Hub 推出 Pull Requests 和 Discussions 社区协作功能

    Hugging Face 在 Hub 上为模型、数据集和 Spaces 仓库推出 Pull Requests 和 Discussions 功能,位于新的 Community 标签页,任何社区成员均可参与。PR 不使用 fork,而是通过源仓库中称为 refs 的特殊分支实现,Issues 与 PR 不作区分并显示在同一列表,旨在打造比 GitHub 更简化的 ML 协作流程。

    推荐理由:原文说明了 PR 与讨论功能的具体机制和与 GitHub 的差异,读者可以据此了解如何参与 Hub 上的模型与数据集协作。

5月20日周五
  1. Hugging Face:Blog60

    Hugging Face 深度强化学习课程 Unit 2 第二部分:Q-Learning 原理与从零实现

    Hugging Face 深度强化学习课程发布 Unit 2 第二部分,讲解 Q-Learning 算法、Q-Function 与 Q-Table,以及 Epsilon Greedy 策略和 TD 更新,并区分 off-policy 与 on-policy。

    推荐理由:课程官方教程用迷宫示例逐步拆解 Q-Learning 算法和 Q 表更新,读者可跟着 Colab 从零实现第一个 RL 智能体。