Gemma 4 12B:开发者指南

Google Developers Blog(RSS)·2026-06-03 00:00·111天前
AI 导读

Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

Google Developers Blog(RSS)
精选
78AI 编辑部评分,满分 100

Gemma 4 12B:开发者指南

2026-06-03 00:00· 111天前
AI 导读

Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

推荐理由

Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

正文 · AI 翻译
placeholder

继我们在发布博客中的公告之后,我们正式发布Gemma 4 12B,这是一个采用统一、无编码器架构的稠密多模态模型。

Gemma 4 12B 为本地 AI 带来了多项里程碑:

  1. 无编码器的多模态架构:完全绕开繁重的多阶段视觉和音频编码器,多模态数据直接输入 LLM 主干,从而降低多模态延迟。
  2. 我们首个支持音频输入的中等规模模型:在 Gemma 家族中,音频输入此前仅限于小型、轻量级的边缘架构(例如 E4B)。Gemma 4 12B 是首个能够原生接收音频的中等规模模型。
  3. 对开发者友好的尺寸:小到足以在配备 16GB VRAM 或统一内存的独立 GPU 笔记本上本地运行。为最大化本地推理速度,我们还额外发布了一个专用的多 token 预测(MTP)模型。
  4. 全新的 MacOS 桌面体验:我们首次发布可下载的 macOS 桌面应用程序,让开发者能够直接在消费级设备上体验完全本地的语音和视觉交互。

架构

传统多模态模型依赖冻结的、彼此独立的视觉编码器(例如 Gemma 4 在边缘尺寸上使用 150M 参数的视觉模型,在中等尺寸模型上使用 550M 参数)和音频编码器(Gemma 4 E2B 和 E4B 为 300M 参数)。在将多模态输入送入 LLM 之前,先用多个独立编码器进行处理,会导致延迟增加和内存占用碎片化。

Gemma 4 12B 通过采用单一的纯解码器 Transformer 解决了这些问题,其包含与 Gemma 4 31B Dense 模型相同的高级解码器结构。

overview
  • 视觉嵌入器(35M 参数):取代了其他中等尺寸 Gemma 4 模型中的 27 层视觉 Transformer。原始 48x48 像素图块通过单次 matmul 投影到 LLM 隐藏维度。因子化坐标查找(X 和 Y 矩阵)将空间位置信息直接附加到输入上。
  • 音频波形投影:消除了独立的音频编码器(跳过了 Gemma 4 E2B 和 E4B 中使用的 12 层 conformer)。原始 16 kHz 音频信号被切分为 40ms 帧(每帧 640 个浮点数),并线性投影到 LLM 输入空间。
  • 统一微调优势:由于视觉、音频和文本输入共享完全相同的权重,你不再需要协同调优彼此独立的冻结编码器。下游适配器(例如 LoRA)或全量微调会在单次前向传播中自然地更新整个多模态 token 循环(通过 Hugging Face 或 Unsloth)。

如需更深入地了解这种无编码器架构的工作原理,请查看 Gemma 4 12B 可视化指南

能力

Gemma 4 12B 实现了出色的性能,具备自动语音识别、智能体推理、说话人分离、视频理解、编码等多项能力。

请参阅以下示例,了解该模型智能体与多模态能力的演示:

示例 1:Gemma 4 12B 创建一个使用 Gemma 4 12B 的本地图像处理应用

得益于其智能体与多模态理解能力,Gemma 4 12B 可以轻松与 OpenCode 等现有智能体框架配合使用。在此示例中,我们使用 llama.cpp 在本地部署了它,并借助 gemma-skills 编写了一个 Gradio 应用,帮助用户处理图像。这个应用正是由构建它的同一个 Gemma 4 12B 模型驱动的!

示例 2:以 1 FPS 处理 5 分钟带音频的视频

我们使用 Gemma 4 12B 分析了 5 月 19 日 Google IO 主题演讲时刻 中的一部分,具体是 00:15:32 到 00:20:45 之间的 5 分钟。为此,我们提取了该片段的所有帧(以 1 FPS),以及视频中的提示词和音频:

提示词:

  1. 313 帧(1FPS,图像缩放至 视觉 token 预算 70)
  2. "what happens when the man takes a selfie?"
  3. 视频的音频 + 下方提示词
在这些演示视频中,当这名男子"自拍"或画面显示他把智能手机举在脸前时,这是一种巧妙的视觉化表达方式,用来直观呈现 AI 模型如何拿现有的媒体素材——比如一张个人照片或一段视频片段——对其进行"重新构想"。在这些具体的片段中,模型以一张自拍为基础,生成各种场景(比如身处空间站的人,或穿行于森林中的人)。

本质上,这名男子并不是真的在自拍;更确切地说,他是在**用表演呈现一个视觉隐喻,象征 AI 能够以某一特定输入(一张"自拍")为基础,生成一整个全新的内容世界。** 这是 Gemini Omni 模型"Swap"和"Build worlds"演示的一部分,展示了它执行复杂多模态推理与创意生成的能力。

端侧与桌面端服务:由 LiteRT-LM 驱动

配合 Gemma 4 12B 的发布,我们正式推出由 LiteRT-LM 驱动的强大端侧开发者集成,将零延迟的本地 AI 执行能力原生带入标准桌面环境:

1. 原生 MacOS 应用:移动端 Google AI Edge Gallery 正式扩展到桌面平台,在 Apple Silicon GPU 上原生离线运行 Gemma 4 12B。它配备了一个安全的沙箱化 Python 执行循环,可在聊天气泡内编写、执行并绘制科学图表。与此同时,Mac 上的 Google AI Edge Eloquent 应用开始支持 Gemma 12B,为 Voice Edit 对话式输入提供支持。

2. 即插即用的本地 API 服务器(litert-lm serve):使用新的 litert-lm serve CLI 命令将 Gemma 4 12B 作为本地、兼容 OpenAI 的 API 服务器运行。无缝接入标准集成(例如 Continue、Aider、OpenClaw、Hermes 或 OpenCode),利用内存中的无状态前缀缓存来匹配上下文历史,并即时绕过预填充延迟。

litert-lm import --from-huggingface-repo=litert-community/gemma-4-12B-it-litert-lm  gemma-4-12B-it.litertlm gemma4-12b

# Start the OpenAI-compatible server
litert-lm serve

在 Google AI Edge Gallery 博客上可找到关于它的深度解析。

即刻开始

准备好用 Gemma 家族首个无编码器架构构建本地多模态智能体了吗?以下是你可以立即上手的方式

来源:Google Developers Blog(RSS)· developers.googleblog.com