# Antigravity SDK 支持本地模型，可完全离线运行智能体

- 来源：Google Developers Blog（RSS）
- 发布时间：2026-09-24 01:09
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmued0oy602x2rommk0l8lw6q
- 原文链接：https://developers.googleblog.com/introducing-support-for-local-ai-models-in-the-antigravity-sdk

## 精选理由

官方发布了本地模型支持与混合编排示例，给出代码、硬件要求和具体 token 数据，开发者可评估离线智能体工作流的可行性。

## AI 摘要

Google 宣布 Antigravity SDK 支持本地模型工作流，首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B，可完全离线运行智能体，建议机器配备 >24GB VRAM 或统一内存。

## 正文

今天，我们宣布Antigravity SDK支持跨多种本地模型和执行选项的本地工作流，并初步支持Gemma 4 26B A4B使用Google AI Edge的LiteRT.

Antigravity SDK 让开发者能够利用驱动 Google Antigravity 的同一套智能体能力进行构建。借助这项新支持，你可以完全离线地通过本地模型启用智能体辅助。我们已针对 LiteRT 和 Gemma 4 26B 优化了这一工作流，高效利用本地 GPU 和 RAM，从而进一步放大你本地机器所能提供的性能！

为什么要本地运行智能体？

本地模型执行能为智能体体验带来多项优势：

成本效益：无需 API 费用或速率限制即可执行本地智能体工作流。

隐私性：将你的代码和请求完全保留在本地机器上，非常适合需要应对严格数据隐私要求或受合规限制的企业环境的开发者。

离线韧性：即使在没有稳定或持续互联网连接的环境中，也能无缝执行你的智能体工作流。

混合工作流：将 token 高效的本地流程与云端流程相结合，在需要时仍可访问更大、更强大的模型，从而最大化效率。

以下是如何开始：（我们建议使用显存或统一内存大于 24GB 的机器）。

创建虚拟环境：

python3 -m venv .venv source .venv/bin/activate

安装 Antigravity SDK 和 LiteRT-LM，并下载 Gemma 4 26B A4B：

pip install google-antigravity litert-lm

litert-lm import \ --from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \ gemma-4-26B-A4B-it-gpu.litertlm \ gemma4-26b

在你的目录中，创建一个文件，命名为 agy_sample.py。将以下内容粘贴进去。

import asyncio import os from google.antigravity import Agent, LiteRTAgentConfig from google.antigravity.hooks import policy

# UPDATE: Point to the locally downloaded model from the previous step (litert-lm import ...) MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

async def main(): print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

config = LiteRTAgentConfig(model_path=MODEL_PATH).lightweight() async with Agent(config) as agent: response = await agent.chat("What files are in the current directory?") async for token in response: print(token, end="", flush=True)

if __name__ == "__main__": asyncio.run(main())

混合编排：云端架构师遇上端侧工作大军

在许多情况下，我们发现架构师-构建者模式是将云端模型规模与本地模型优势相结合的绝佳方式。在下方使用更新版 Antigravity SDK 构建的混合演示视频中，一位云端架构师（Gemini 3.8 Flash）担任规划者和指挥者，而由 Gemma 4 26B 实例组成的本地集群则完全在端侧承担繁重的工作。

当任务是对三个存在漏洞的模块（auth.py、billing.py 和 database.py）进行审计和修补时，该工作流保持了严格的数据隐私，并让我们能够最大限度地利用 token：

未上传任何代码： Gemini 3.8 Flash 仅根据文件名和任务描述来规划策略并拆解工作——仅消耗 95 个云端 token，且任何源代码都从未离开本机。

自主本地挑战流程： 本地 Gemma 4 26B 模型接管本地 GPU，执行对抗性审计循环：复现安全漏洞、编写候选修复、评审补丁，并针对回归测试套件进行验证。

成本与隐私的巨大收益： 在本次记录的运行中，97.2% 的 token（3,322 个 token）在本地离线运行，未调用任何云端 API，在交付完全验证通过的绿色补丁的同时，将专有代码完全安全地保留在设备本地。

查看此处的示例项目，运行内置的 3 文件挑战流程，或将其指向你自己的 Python 模块和测试套件。

视频 · 前往原文观看

零 token 本地实用工具：CLI 资源监控器

搭载 Gemma 4 26B A4B 的 Antigravity SDK 在构建实用系统工具方面表现出色。在这个示例中，该智能体构建了一个在终端中运行的实时更新资源监视器。只需一条提示词，智能体就会自主编写一个使用 psutil 和 rich 库来跟踪 CPU 和内存使用情况的 Python 脚本，生成所需的 requirements.txt 文件，甚至还会测试生成的代码以确保其正常工作——这一切都完全在你的本地机器上运行，并使用 Gemma 4 26B。

视频 · 前往原文观看

一个使用 Gemma 4 26B 在设备端生成的基于 Python 的 CLI 资源监视器工具

## cli_resource_monitor.py

import asyncio import os from google.antigravity import Agent, LiteRTAgentConfig from google.antigravity.hooks import policy

# UPDATE: Your prompt PROMPT = "Build a command-line interface tool using the psutil and rich libraries that displays a live-updating terminal dashboard. It should show CPU usage, memory consumption, and a sorted table of the top 5 most memory-intensive processes. Save the script as 'monitor.py' and create a 'requirements.txt' file. Test that it works."

# UPDATE: Point to the locally imported LiteRT-LM model path MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

# UPDATE: Give AGY-SDK a workspace to write files WORKING_DIR = os.path.expanduser("~/agy-test")

os.makedirs(WORKING_DIR, exist_ok=True) os.chdir(WORKING_DIR)

async def main(): print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

config = LiteRTAgentConfig( model_path=MODEL_PATH, workspaces=[WORKING_DIR], policies=[policy.allow_all()], ).lightweight()

async with Agent(config) as agent: response = await agent.chat(PROMPT) async for token in response: print(token, end="", flush=True)

if __name__ == "__main__": asyncio.run(main())

Antigravity SDK 还通过 LocalOpenAIAgentConfig 为任何兼容 OpenAI 的服务器（如 Ollama、LM Studio 或 vLLM）提供无缝的即插即用支持。这让你能够灵活地试验不同的本地推理后端，同时保持你的智能体编排、工具和工作流完全不变。

查看 Antigravity Python SDK README 中的说明即可开始使用本地 AI，并通过 LiteRT 了解更多关于如何在边缘高效运行模型的信息。请在 Antigravity Python SDK GitHub Issue Tracker. 上分享你的反馈和功能请求。我们期待看到你构建的作品！

致谢：Abhi Patel、Ander Dobo、Ben Miles、Cormac Brick、Ian Ballantyne、Jingxiao Zheng、Jonathan Reay、Kimish Patel、Lu Wang、Marissa Ikonomidis、Matthias Grundmann、Olivier Lacombe、Omar Sanseviero、Rishika Sinha、Rody Davis、Taylor Mullen、Tyler Mullen、Wai Hon Law、Xiaoming Hu、Xu Chen、Yu-hui Chen
