跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

482 条精选近 30 天 33 条共收录 3,863 条

更新

精选归档 · 第 25 页

7月12日周二第 481–482 条
  1. Hugging Face:Blog78

    Hugging Face 发布 1760 亿参数开源多语言大模型 BLOOM

    Hugging Face 与 BigScience 发布 1760 亿参数的开源多语言大模型 BLOOM,支持 46 种自然语言和 13 种编程语言。模型由 70 多个国家、250 多个机构的 1000 多名研究者历时一年协作完成,在法国 Jean Zay 超算上训练 117 天,算力来自 CNRS 和 GENCI 价值约 300 万欧元的资助。

    推荐理由:原文来自 BLOOM 团队官方发布,给出了参数规模、语言覆盖、训练成本和开放使用方式,读者可以了解这个开放大模型的实际边界。

1月5日周二
  1. OpenAI:官网动态81

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 推出神经网络 CLIP,能通过自然语言监督高效学习视觉概念。只需提供待识别视觉类别的名称,CLIP 即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:原文说明 CLIP 用自然语言监督学习视觉概念并可零样本套用于分类基准,读者可了解其与 GPT 系列零样本思路的关联。