跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

475 条精选近 30 天 29 条共收录 3,807 条

更新

精选归档 · 第 24 页

4月14日周一第 461–475 条
  1. MiniMax:Blog

    MiniMax MCP Server

    MiniMax 发布 MCP Server,集成文本转语音、语音克隆、文生图、文生视频等多模态能力。支持 Claude Desktop、Cursor、Windsurf 等主流 MCP 客户端,通过统一工作流实现文本到音视频的一站式生成,面向创作者和开发者免费开放。

    推荐理由:MiniMax MCP Server 上线,支持语音克隆、文生图/视频并兼容 Claude Desktop 等主流客户端

3月25日周二
  1. OpenAI:官网动态80

    OpenAI 补充 GPT-4o 系统卡,介绍 4o 图像生成能力

    OpenAI 发布 GPT-4o 系统卡附录,介绍 4o image generation 图像生成能力。官方称其比此前的 DALL·E 3 系列模型能力显著更强,可生成照片级真实感输出,并支持以图像作为输入进行变换。

    推荐理由:官方说明指出 4o 图像生成比 DALL·E 3 系列能力更强,读者可借此了解其照片级输出与图像输入变换的新方向。

3月12日周三
12月13日周五
11月4日周一
  1. xAI:News

    Grok API 公测版发布

    xAI 启动 Grok API 公测,发布新模型 grok-beta,支持 128k 上下文、函数调用及系统提示,视觉版本下周上线。开发者每月可获 $25 免费额度至年底,已购预付额度可叠加。API 兼容 OpenAI 与 Anthropic 格式,修改 base_url 即可迁移。

    推荐理由:xAI开放Grok API公测,每月送$25额度且兼容OpenAI接口,开发者可立即体验

5月14日周二
  1. Sam Altman:Blog

    GPT-4o

    OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。

    推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略

5月13日周一
4月12日周五
  1. xAI:News

    Grok-1.5 Vision 预览版

    xAI 发布 Grok-1.5 Vision 预览版,新增视觉理解能力,可处理图像、图表及文档内容,支持跨模态推理与视觉问答,现面向早期测试者开放试用。

    推荐理由:xAI发布Grok-1.5 Vision预览版,具备多模态视觉理解能力

11月10日周五
  1. LlamaIndex:产品、工程与评测65

    LlamaIndex 推出多模态 RAG 新抽象,支持 GPT-4V 与 CLIP 的图文混合检索

    LlamaIndex 发布多模态 RAG 支持能力,新增 OpenAIMultiModal、ReplicateMultiModal、MultiModalEmbedding(CLIP)和 MultiModalVectorStoreIndex 等抽象,可对文本和图像统一索引与检索。

    推荐理由:原文由 LlamaIndex 给出多模态 RAG 的新抽象与代码示例,读者可以直接了解 GPT-4V、CLIP 与 Qdrant 在同一管线中的组合方式。

9月25日周一
3月14日周二
  1. OpenAI:官网动态91

    OpenAI 发布 GPT-4 多模态模型

    OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是接受图像和文本输入、输出文本的大型多模态模型,在多项专业和学术基准上达到人类水平表现,但在许多现实场景中仍不及人类。

    推荐理由:官方原文明确了 GPT-4 的多模态输入形态和基准表现定位,可作为了解该模型能力边界的直接信源。

12月21日周三
11月21日周一
7月12日周二
  1. Hugging Face:Blog78

    Hugging Face 发布 1760 亿参数开源多语言大模型 BLOOM

    Hugging Face 与 BigScience 发布 1760 亿参数的开源多语言大模型 BLOOM,支持 46 种自然语言和 13 种编程语言。模型由 70 多个国家、250 多个机构的 1000 多名研究者历时一年协作完成,在法国 Jean Zay 超算上训练 117 天,算力来自 CNRS 和 GENCI 价值约 300 万欧元的资助。

    推荐理由:原文来自 BLOOM 团队官方发布,给出了参数规模、语言覆盖、训练成本和开放使用方式,读者可以了解这个开放大模型的实际边界。

1月5日周二
  1. OpenAI:官网动态81

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 推出神经网络 CLIP,能通过自然语言监督高效学习视觉概念。只需提供待识别视觉类别的名称,CLIP 即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:原文说明 CLIP 用自然语言监督学习视觉概念并可零样本套用于分类基准,读者可了解其与 GPT 系列零样本思路的关联。