Google 发布在 Raspberry Pi 5 上用 LiteRT 与 Gemma 部署边缘 AI 的完整指南
Mastering Edge AI on Raspberry Pi with LiteRT and Gemma
Google 发布教程,讲解如何用 LiteRT 和 Gemma 在 Raspberry Pi 5 上实现完全离线的实时边缘 AI,并演示其驱动 Reachy Mini 机器人。
原文给出 LiteRT-LM 在树莓派 5 上运行 Gemma 的具体性能数字与 CPU/GPU 分工架构,还附完整部署命令,方法可直接迁移到自己的边缘部署。
2026年8月11日
想象一下,构建一个完全自主的机器人,它能够实时看到、听到并对其环境做出反应,完全离线运行在像 Raspberry Pi 这样的单一紧凑设备上。边缘 AI 解锁了这种完全的自主性。它使开发者能够构建高度安全且自包含的系统,如智能机器人和本地 AI 代理,具有零云依赖、超低延迟和完全的数据隐私。
我们借助 Google AI Edge 的 LiteRT 让在 Raspberry Pi 上运行边缘 AI 变得轻而易举,这是一个高性能、经过生产验证的设备端推理运行时。LiteRT 允许你开箱即用地跨平台无缝部署从经典 ML 模型到最先进的 LLM 的一切。通过在 CPU 和 GPU 上提供优化的执行和超高效的内存使用,LiteRT 最大限度地发挥了 Raspberry Pi 的全部计算潜力。
抱歉,你的浏览器不支持此视频的播放
Reachy Mini 通过响应和动作做出反应,由 Raspberry Pi 5 上的 Gemma 和 LiteRT 驱动。
当与 Gemma 搭配时,这种硬件与软件的协同效应最为耀眼,Gemma 是 Google 的轻量级开放模型系列。为了向你展示可能性,我们将演示 Raspberry Pi 5 上的 Gemma 和 LiteRT 如何驱动 Reachy Mini 机器人完全本地地实时感知并响应其环境。继续阅读,开始你自己的部署。
探索 Gemma 的代理能力
Gemma 模型非常适合构建自主代理、智能摄像头和社交机器人,它们可以直接在你的 Raspberry Pi 上推理并执行复杂的多步骤工作流。为了适应不同的硬件限制,Gemma 模型系列提供了几个高效选项:
- Gemma 3 270M:一个超高效且紧凑的基础模型,专为特定任务的后微调而设计,可在资源受限的环境中实现情感分析或实体提取等高速、低延迟功能。
- EmbeddingGemma 300M:一个文本嵌入模型,可在设备端生成高质量嵌入,非常适合检索增强生成(RAG)、语义搜索和分类。
- Gemma 3 1B:一个轻量级多语言纯文本模型,在紧凑尺寸与强大生成能力之间取得平衡,非常适合各种设备端任务,如摘要和内容创作。
- Gemma 4 E2B:专为移动和紧凑边缘环境量身定制,具有内存映射的逐层嵌入,非常适合持续监控、快速文本/图像/音频推理以及节省 RAM 至关重要的边缘语音处理。
- Gemma 4 E4B:性能与尺寸的完美平衡点。该模型在保持紧凑的同时,提供了明显更强的推理能力和前沿级边缘性能。它是复杂多步骤规划的完美选择,而不会压垮 Pi 的资源。
Gemma 在 Raspberry Pi CPU 上的性能
通过 LiteRT-LM——一个构建在 LiteRT 之上的专用编排层,开发者可以开箱即用地无缝部署 Gemma。在底层,通过 LiteRT 实现的复杂 CPU 加速以及 XNNPACK 确保 Gemma 系列模型在 Raspberry Pi 上直接运行时,针对资源效率和低延迟执行进行了高度优化。
在 Raspberry Pi 5 上,LiteRT-LM 为 Gemma 4 E2B 提供了强劲的性能,预填充阶段达到 99 tokens/秒,解码阶段达到 9 tokens/秒,同时峰值内存占用极低,仅为 1432 MB。这将 Gemma 高度响应、通用的智能带到了 Raspberry Pi。
得益于 Gemma 4 E2B 高效的分词器,它能在更少的 token 中容纳更多文本(平均每个 token 约 4.2 个字符),LiteRT-LM 在 Reachy Mini 语音演示中实现了令人印象深刻的端到端生成速度,约为 27.3 字符/秒,大致相当于每分钟 300 词(wpm)。这一吞吐量使 Gemma 4 E2B 非常适合实时语音和翻译任务,其文本输出速度是人类正常语速(约 150 wpm)的两倍。
从 LiteRT Hugging Face 社区探索更多可在 Raspberry Pi 上运行的即用型开放模型。
使用 LiteRT 在 Raspberry Pi GPU 上执行
在 Raspberry Pi 5 上,四核 ARM Cortex-A76 CPU 是原始计算的主力,可提供约 153.6 GFLOPS(FP32)和高达约 2.0 TOPS(INT8)。相比之下,集成的 Broadcom VideoCore VII GPU 主频为 800 MHz,峰值性能约为 76.8 GFLOPS(FP32)和约 0.24 TOPS(INT8)。
虽然 CPU 拥有巨大的容量优势,但 GPU 引入了异构并行执行,这一范式对实时边缘应用至关重要。开发者无需让 CPU 饱和,而是可以将任务分配到两个处理器上,以优化整体系统和热效率。例如,通过将连续的视觉或音频模型卸载到 VideoCore VII GPU,可以为整体系统监控、流水线编排或计算密集型的 LLM 推理保留高优先级的 CPU 周期。
因此,我们通过ML Drift 的 LiteRT WebGPU(Vulkan)后端在 Raspberry Pi 上启用了 GPU 推理。这一集成让你可以直接从 LiteRT Hugging Face 社区运行广泛的计算机视觉、音频和嵌入模型,包括对流行的 MediaPipe 模型、Ultralytics YOLO 模型、Moonshine 等的无缝支持。
抱歉,你的浏览器不支持播放此视频
使用 Ultralytics YOLO26n 模型在 Raspberry Pi 5 上通过 LiteRT 运行实时目标检测。从 YOLO 指南中获取示例代码即可开始。
下表展示了通过 LiteRT 运行经典计算机视觉和音频模型时的 CPU 和 GPU 延迟:
深入探讨:由 LiteRT 驱动的 Reachy Mini 流水线
Reachy Mini 流水线是一个强大的展示,体现了完全在 Raspberry Pi 5 上运行的低延迟、实时边缘 AI 推理。通过利用 LiteRT,系统将密集的视觉和语言工作负载拆分为跨 CPU 和 GPU 的并发双处理架构。
以下是并行架构在底层的工作方式,以确保无缝交互:
- 目标检测(GPU 上的 Ultralytics YOLO):摄像头帧被流式传输到 Pi,Ultralytics YOLO 检测在 GPU 上持续运行,避免资源争用并释放 CPU。
- 语音识别(CPU 上的 Moonshine):当用户说话时,ASR 组件直接在 CPU 上将音频转录为文本。
- 推理与动作(CPU 上的 Gemma 4 E2B):Gemma 4 E2B 模型处理生成的转录文本以及最新的视觉元数据,以生成低延迟的流式响应,例如语音回复和物理机器人手势。
- 文本转语音(CPU 上的 TTS):TTS 组件以流式方式将生成的文本合成为音频。系统将合成的语音流式传输回 Reachy Mini 机器人。
在 LiteRT Samples Github 仓库中查看 Reachy 演示的完整源代码。
在 Raspberry Pi 上使用 LiteRT 进行智能体编码
LiteRT 提供了一套全面的工具,覆盖完整的开发周期:转换、量化、基准测试和推理。为了快速、无摩擦地完成设置,最直接的方法是使用 LiteRT CLI 工具。LiteRT CLI 无需开发者或编码智能体手动管理多个独立库,而是将核心边缘工作流聚合到单一、统一的命令集中。
抱歉,你的浏览器不支持播放此视频
使用 LiteRT CLI 简化你的开发周期:转换、量化、基准测试和推理。
你现在可以通过将 LiteRT CLI 技能和其他高级 LiteRT 技能添加到你的 AI 编码智能体(例如 Google Antigravity)中,来大幅提升你的开发周期。这使智能体能够代表你自主编排和执行复杂的多阶段机器学习工作流。例如,你可以轻松地在 Raspberry Pi 上完全离线构建自己的语音翻译器,如下方所示的 Gemma Translator。
在 Gemma Translator GitHub 仓库中探索完整的实现细节。
面向 IoT 设备的超精简二进制占用
对于资源受限的 IoT 设备,最大限度地减少存储和内存开销至关重要。如果没有特殊优化,通用 AI 运行时通常会捆绑沉重的桌面或服务器依赖项。相比之下,LiteRT 专为设备端部署而设计,保持极其精简和模块化的发行版。
下表比较了在 Raspberry Pi(ARM64 Linux)上运行 LLM 推理所需的下载占用。
运行你的第一个模型
你可以安装 LiteRT CLI,并仅用几个简单命令就在 Raspberry Pi 5 上运行你的第一个模型。
1.安装 LiteRT CLI
要开始使用,请通过 pip 安装 LiteRT CLI(最好在虚拟环境中):
pip install litert-cliShell
已复制
2. 运行模型
直接从 LiteRT Hugging Face Community 下载并运行任何兼容模型。下面的代码片段演示了如何在 Raspberry Pi 5 上执行 Gemma 4 E2B(例如 gemma-4-E2B-it-litert-lm)。
通过提供你的 Hugging Face 身份验证令牌来运行模型:
export HUGGING_FACE_HUB_TOKEN=<your_hugging_face_token_here>
litert lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--attachment=image.jpg \
--prompt="You are Reachy Mini. Identify the main object in front of you, "\
"state its location (Left/Right/Center), and suggest head action in "\
"10 words or less."Shell
已复制
下一步
我们很高兴地宣布,LiteRT 集成和 Gemma 模型即将登陆 Hailo AI 加速器!此次更新将允许你将模型推理无缝卸载到 Raspberry Pi AI HAT+ 和 AI HAT+ 2,通过你如今使用的完全相同、熟悉的 LiteRT 工作流,带来巨大的硬件加速优势。
探索我们的资源,开启你的 LiteRT 之旅:
- 官方文档:在 LiteRT 开发者网站上获取安装指南、API 参考和快速入门教程。
- GitHub 仓库:在 LiteRT 和 LiteRT-LM GitHub 仓库中查找最新源代码、实现细节和更新。
- 示例与模板:查看 LiteRT-Samples GitHub 仓库以获取参考代码。使用 AI Edge Gallery 应用快速启动你自己的应用。
- 即用型模型:直接从 LiteRT Hugging Face Community 下载经过优化的开放权重模型,例如轻量而强大的 Gemma 4 E2B。
我们重视你的意见。请在我们的 GitHub Issue Tracker 上提交 issue,分享你的想法、反馈或功能请求。在 @googlegemma 上分享你精彩的 Raspberry Pi + LiteRT + Gemma 项目。我们迫不及待想看到你的作品!
致谢
Google:Changming Sun、Chintan Parikh、Cormac Brick、Dillon Sharlet、Daisuke Majima、Erin Walsh、Frank Barchard、Glenn Cameron、Ian Ballantyne、Jingjiang Li、Jun Jiang、Kimish Patel、Lu Wang、Matthias Grundmann、Rodney Witcher、Sachin Kotwani、Sasha Denisov、Scott Loftin、Shuangfeng Li、Somdatta Banerjee、Terry (Woncheol) Heo、Volodymyr Kysenko、Weiyi Wang、Yi-Chun Kuo、Yu-hui Chen 以及 gtech 团队
Raspberry Pi & Hailo:Ashley Whittaker、Eldad Rubinstein、José María Casanova (Igalia)、Naushir Patuck 和 Sarah Cunningham
Ultralytics:Francesco Mattioli、Onuralp Sezer、Lakshantha Dissanayake
Moonshine AI:Pete Warden
上一页
下一页
来源:Google Developers Blog(RSS) · developers.googleblog.com