# OpenRouter 实测 20 个图像生成模型的成本、编辑与质量

- 来源：OpenRouter：Announcements（RSS）
- 作者：OpenRouter
- 发布时间：2026-09-18 08:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmu74ww1u0qfxrowkb6qtruwz
- 原文链接：https://openrouter.ai/blog/insights/image-generation-models-compared

## 精选理由

OpenRouter 用同一提示词实测 20 个图像生成模型的真实计费，读者可以借此绕开各不相同的计价单位直接比较成本。

## AI 摘要

OpenRouter 对其路由的 20 个图像生成模型用相同提示词实测计费，单张图片成本在 $0.006 到 $0.134 之间，相差 22 倍。

## 正文

我们通过 一个 API 路由了 52 个图像生成模型。我们用同一个提示词跑通了其中 20 个，并记录了每次调用计费了多少、返回了什么，以及它接受什么输入。

成本是最棘手的部分，因为这些模型并非按同一单位计价。FLUX.2 按每兆像素计价。Gemini、OpenAI 和 Microsoft MAI 按 token 计价。Grok、Recraft、Riverflow、Qwen 和 Seedream 按每张图像计价，费率会随你所要求的质量和分辨率而变化。每个模型页面以其自身单位来看都是正确的，所以你无法通过并排阅读它们的价格来比较其中两个。

我们把它们放在同一基准上。我们测试的这 20 个模型都收到了相同尺寸的同一提示词，我们从每个响应中读取了 usage.cost 字段，也就是我们实际收取的金额。

本页面上的每一个价格都来自一次真实生成，测量于 2026 年 9 月 11 日。价格和模型经常变化，所以任何超过一个月的数据都应视为参考提示，而非预算条目。你可以用 GET /api/v1/images/models 重新拉取当前接受的参数，用 GET /api/v1/images/models/{model}/endpoints 重新拉取标注了单位的定价。

总结

从 openai/gpt-image-2 开始。它在短提示词上计费 $0.006，在较长提示词上计费 $0.0135，这使它成为我们测量到的最便宜的模型，而且它正确地渲染了我们的两行标签和参考编辑。

如果图像很难做对，可以进一步选择 sourceful/riverflow-v2.5-pro，价格为 $0.064；如果回复既需要文字也需要图片，可以选择 google/gemini-3-pro-image，价格为 $0.134；如果你需要的是可编辑的 SVG 而不是像素图，可以选择 recraft/recraft-v4.1-vector，价格为 $0.08。

在我们测量的 20 个模型中，默认设置下生成一张图片的计费在 $0.006 到 $0.134 之间，相差 22 倍。

每个模型页面都用自己的单位标价，而实际计费成本可能与标价不同。比较两个模型的方法是：各生成一张图片，然后从响应中读取 usage.cost。

在 OpenAI 模型上，quality 设置让同一张图片从 $0.006 变为 $0.211。

n，即一次调用返回的图片数量，在 FLUX.2、Gemini、Grok、Riverflow 和 MAI 上上限为 1。seed 在 Gemini、Grok、OpenAI、Riverflow、Recraft 或 MAI 上不存在。在 FLUX.2 Klein 上存在该设置时，相同的 seed 逐字节复现了同一张图片。

我们要求生成可读文本的六个模型中，有五个正确渲染了文本，包括最便宜的那个。

原始 API 返回 data[0].b64_json。TypeScript SDK 返回 data[0].b64Json。

每个模型向我们收取的费用

我们向这 20 个模型分别发送了提示词“A studio packshot of a glass bottle, hard key light, no text.”，使用 aspect_ratio: "1:1" 且未设置其他参数，然后从响应中读取 usage.cost。计费单位一列是每个端点定价记录中的 unit 字段。

模型计费返回格式计费单位

openai/gpt-image-2$0.00601024x1024PNGtoken

black-forest-labs/flux.2-klein-4b$0.01401024x1024JPEGmegapixel

sourceful/riverflow-v2.5-fast$0.01761024x1024WebP图像

black-forest-labs/flux.2-pro$0.03001024x1024JPEG百万像素

qwen/qwen-image-3$0.03001024x1024PNG图像

krea/krea-2-medium$0.03001024x1024PNG未发布

openai/gpt-image-1-mini$0.03331024x1024PNGtoken

google/gemini-3.1-flash-lite-image$0.03361024x1024JPEGtoken

recraft/recraft-v4.1$0.03501024x1024WebP图像

bytedance-seed/seedream-5-0-lite$0.03502048x2048JPEG图像

microsoft/mai-image-2.5$0.04821024x1024PNGtoken

black-forest-labs/flux.2-flex$0.05001024x1024JPEGmegapixel

x-ai/grok-imagine-image-quality$0.05001024x1024JPEG图像

x-ai/grok-imagine-image-2.0$0.06001024x1024JPEG图像

sourceful/riverflow-v2.5-pro$0.06411024x1024WebP图像

google/gemini-3.1-flash-image$0.06721024x1024PNGtoken

black-forest-labs/flux.2-max$0.07001024x1024JPEG百万像素

recraft/recraft-v4.1-vector$0.0800vectorSVGimage

bytedance-seed/seedream-5-0-pro$0.09002048x2048JPEGimage

google/gemini-3-pro-image$0.13441024x1024PNGtoken

图 1. 相同的价格，经过排序。三种计费单位在整个区间内一路混杂，因此单位并不能告诉你一个模型落在区间中的哪个位置。

在根据这张表制定预算之前，你需要了解三件事。

当我们未设置 resolution 时，两个 Seedream 模型都返回了 2048x2048，而不是 1024x1024。Seedream 5.0 Lite 将 2K 列为它接受的最低分辨率。Seedream 5.0 Pro 接受 1K，但其默认调用返回了 2K，并按 $0.09 的高分辨率费率计费，而不是 $0.045 的基础费率。Seedream 5.0 Lite 以 $0.035 的价格给你四百万像素，因此按每像素计算，它比表格看起来的要便宜。

FLUX.2、Grok 和 Seedream 返回了 JPEG。OpenAI、Qwen、Microsoft 和 Krea 返回了 PNG。Sourceful 和 Recraft 返回了 WebP，而 Recraft 的矢量模型返回了 SVG。我们测试的三个 Gemini 模型不接受 output_format，而且它们返回的格式并不全都相同，所以不要硬编码文件扩展名。在接受该参数的十二个目录模型上设置 output_format。在不接受该参数的模型上，读取每个响应都会返回的 media_type 字段。

两次使用相同请求体调用 sourceful/riverflow-v2.5-fast，分别计费 $0.017623 和 $0.017639。请根据多次调用的平均值来制定预算，而不是根据单次调用。

质量设置会让价格变动 35 倍

在 OpenAI 模型上，quality 对你的账单的影响比任何其他设置都大。我们用相同的提示词、相同的 1024x1024 尺寸运行了 gpt-image-2，分别将 quality 保持未设置、设置为 low 以及设置为 high。

质量图像 token计费

未设置196$0.00599

低196$0.00599

高7,024$0.21083

将 quality 保持未设置，得到的 token 数量和账单与 low 相同。当图像质量很重要时，请显式设置 quality；对于 OpenAI 模型的单张图像价格，除非它明确标注了质量档位，否则应视为不完整。high 调用还耗时 123 秒才返回，而默认调用仅需 12 秒。

宽高比对账单的影响要小得多

在按每兆像素计费的模型上，你请求的画面尺寸会改变账单，但变化幅度小于像素数量所暗示的程度。我们用 black-forest-labs/flux.2-klein-4b 跑了两种形状。21:9 的调用返回 2400x1024，即 2.46 兆像素，而正方形为 1.05 兆像素。正方形计费 $0.014，宽幅裁剪计费 $0.016。

标价与实际计费可能不同

每个模型都会在其页面上以及 API 的端点路由中公布一个费率。这些费率只是一个用于规划的参考数字，实际响应结果才是你最终支付的费用。2026 年 9 月 11 日，sourceful/riverflow-v2.5-pro 在其默认分辨率下列出的价格为每张图片 $0.13，而实际向我们计费 $0.064。black-forest-labs/flux.2-flex 列出的是每百万像素 $0.06，而对一张一百万像素的图片向我们计费 $0.05。black-forest-labs/flux.2-max 列出的是 $0.07，并恰好向我们计费 $0.07。krea/krea-2-medium 在其端点上没有公布任何定价记录，并向我们计费 $0.03。

当两者不一致时，请查看 usage.cost，而不是用列出的费率乘以估算值。

对于已完成的图片请求，我们全额计费；对于失败的请求，我们不收取任何费用。Image API 计费文档 说明了哪些结果会被计费。

参考资料、格式与限制

价格只是一个维度。以下是其他维度，其中有两个维度在成本成为考虑因素之前就已经将某些模型排除在外。这些数值来自 2026 年 9 月 11 日各端点的 supported_parameters。

系列输出模态最大参考图片数output_format每次调用的图片数（n）seed

FLUX.2 Klein图像4png、jpeg1是

FLUX.2 Flex、Pro、Max图像8png、jpeg1是

Gemini 3.x 图像图像、文本14不可设置1否

Grok Imagine Image图像3不可设置1否

OpenAI gpt-image图像16不可设置1 到 10否

OpenAI gpt-5-image图像、文本16不可设置1 到 10否

Seedream 5.0图像14不可设置Lite 上为 1 到 4，Pro 上为 1是

Recraft v4.1图像1矢量模型上的 svg1 到 6否

Qwen Image 3图像4不可设置1 到 6是

Riverflow 2.5图像Fast 上为 4，Pro 上为 10Fast 上为 jpeg，Pro 上为 png、jpeg、webp1否

Microsoft MAI Image 2.5图像1不可设置1否

Krea 2 Medium图像1不可设置n 未公布是

参考图像是你在请求中随附、供模型据此工作的图像，既可以是你希望编辑的图像，也可以是希望模型匹配的风格或产品示例。可发送数量的上限是硬性上限。Grok 接受三张，Gemini 接受十四张，因此一套六张图的品牌素材包在还没比较其他任何东西之前就已经把 Grok 排除在外了。

输出模态这一列是第二个维度。这些模型大多接受文本和图像输入，只返回图像字节。Gemini 图像模型和 OpenAI 的 gpt-5-image 模型还能在同一次回复中返回书面文本，如果你想让模型解释它生成了什么，这一点很重要。我们在下文进一步测试了它们这样做的可靠性。

对任何带有 GET /api/v1/images/models 的模型重新拉取此表，它会公布每个模型接受的参数及其范围。supported_parameters 中未出现的参数，表示该端点不支持。

Seed 在 FLUX.2 Klein 上完全复现了该图像

seed 是你发送的用于让结果可复现的数字。在我们目录中的每个 Gemini、Grok、OpenAI、Riverflow、Recraft 和 MAI 图像模型上都缺失它。它存在于 FLUX.2、Seedream、Qwen 和 Krea 上。

我们运行了black-forest-labs/flux.2-klein-4b两次，使用相同的提示词，以及seed: 424242。两次响应逐字节完全一致，且均计费 $0.014。我们只测试了 Klein，因此其他支持 seed 的模型应视为未经测试，而不要假设它们的行为相同。作为对比，两次sourceful/riverflow-v2.5-fast不带 seed 参数的调用，在相同的请求体下返回了两张不同的图像。

排行榜怎么说

我们在每个模型的页面上展示 Design Arena 评分。当我们在 2026 年 9 月 11 日通过 benchmarks API 拉取当前评分时，sourceful/riverflow-v2.5-pro 在图像榜和图像编辑榜上都获得了最高评分。微软的 MAI Image 2.6 模型和 Google 的 Gemini 图像模型在图像榜上紧随其后，而 black-forest-labs/flux.2-klein-4b 在两个榜单所列模型中评分最低。

这些评分来自模型之间的两两对战投票，Design Arena 将其转化为 Elo 评分——当模型赢下一场对决时分数上升，输掉时则下降。

有两点需要注意。Gemini 的评分基于这些 slug 的 -preview 版本，而非我们在本页链接的正式发布版本。而且 Elo 告诉你的是投票者在其提示词上的偏好，而非你的。在我们这次运行中，评分最高的模型每张图片收费 $0.064，评分最低的模型收费 $0.014。先从榜单中筛选出候选，再根据自己的提示词做决定。

我们用同一个提示词测试了六个模型

我们把同一个提示词发送给了横跨不同价位的六个模型，并将费用标注在每张图片下方。我们要求生成一个哑光黑色的咖啡袋，上面印有两行文字。

提示词

一张哑光黑色咖啡包装袋的影棚产品照，置于纯白背景之上，采用硬质主光。袋子正面以简洁的无衬线大写字母印着 OPENROUTER ROASTERS 字样，其下方以较小的无衬线大写字母印着 SINGLE ORIGIN 字样。

我们选择可读的文字，是因为它们容易评分。袋子要么写着你要求的内容，要么没有。

图 2. 同一提示词经由六个模型生成，并附上每次调用的实测成本。

六个中有五个把两行都印对了。例外是 black-forest-labs/flux.2-klein-4b，它把品牌名渲染正确，却把第二行拼错成了 SINGLE ORISION。

最有用的比较，是 Design Arena 榜单上最便宜的模型与最贵的模型之间的对比。openai/gpt-image-2 计费 $0.0135，sourceful/riverflow-v2.5-pro 计费 $0.0654，两者都生成了正确、可用的商品图。多花约五倍的钱，换来的是不同的观感，而不是更好的文字。

这并不意味着 Riverflow 定价过高。它领跑 Design Arena 各榜单，而在更难的图像、不寻常的构图或更长的文本串上，差距可能会显现出来。它真正说明的是，无论是排行榜还是价格栏，都没能预测出这个提示词上的结果，只有实际跑一遍提示词才能知道。

同一次测试还带出了两个较小的发现。在按 token 计费的模型上，提示词长度会改变你的账单，因为 openai/gpt-image-2 在之前那行单行提示词上计费 $0.006，而在这个更长的提示词上计费 $0.0135。另外，每个模型对“studio packshot”的理解都不同，从硬阴影的产品照到柔光的产品照都有，所以构图是一个需要测试的风格选择。

按任务挑选

根据对你而言最紧的那项约束来挑选模型。那可能是大批量下的成本、图像是否必须包含可读的文字、你需要发送多少张参考图，或者回复是否需要在图片之外附带文字。

大批量、普通提示词

从 openai/gpt-image-2 开始。在成本表中，它在短提示词上计费 $0.006，在较长的咖啡袋提示词上计费 $0.0135，因为它是按 token 计费的，你的提示词也是账单的一部分。对于长度相近的产品提示词，按这个区间做预算。它是我们测过的最便宜的模型，并且以最低的成本正确渲染了我们的文字。

black-forest-labs/flux.2-klein-4b 以 $0.014 成为另一个便宜选项，但有一个实测到的坑。它是六款模型中唯一拼错标签的，而且在两个榜单上都是 Design Arena 评分最低的模型。把它用于画面中没有可读文字的批量工作。当产品名称必须准确呈现时，不要用它。

OpenAI 的这些数字假设你保持 quality 未设置。把它调到 high 后，我们账单上那一行变成了 35 倍。Klein 没有 quality 设置，所以它的成本更容易预测，而且当你需要更好的结果时，也没有可调高的设置。

在咖啡袋提示词上，两者分别为 $0.0135 和 $0.014，也就是一万张图片 $135 对 $140。到了这个程度，价格已经不能决定什么了，所以把你自己的提示词分别跑一遍，让输出结果来决定。

关于 Klein 有一条操作上的说明。Black Forest Labs 在 Hugging Face 上发布其权重，仓库名为 black-forest-labs/FLUX.2-klein-4B，而不是使用我们 slug 的大小写形式。你现在可以通过我们调用它，之后再迁到内部，而无需更换你所围绕构建的模型家族。

图片中的文字

当模型把产品名称弄错时，包装、UI 模型图、幻灯片和海报都会出问题。

我们测试的六个模型中有五个无需任何辅助就能处理两行标签，所以可以按成本和风格来挑选，然后拿结果与你自己的文字而非我们的文字进行核对。

black-forest-labs/flux.2-flex 正确渲染了我们的标签，该图片计费 $0.05，并且最多接受八张参考图。如果你已经在使用 FLUX.2 且文字很重要，这就是应该迁移到的 FLUX.2 模型。如果你还没有锁定某个模型家族，openai/gpt-image-2 以大约四分之一的价格完成了同样的工作。

在做决定之前，看看 recraft/recraft-v4.1-vector，它以不同的方式解决了这个问题。它返回的是 SVG 而非像素，其端点接受 style、controls 和 text_layout 作为 provider.options 下的透传参数。对于需要缩放并保持可编辑的 logo 或标签，矢量输出胜过更清晰的位图，而每张图片 $0.08 就能得到一个可以在设计工具中打开的文件。

参考一致的品牌作品

在这里，同一个物体在它出现的所有地方都必须看起来一样。产品页面上的瓶子和宣传图中的同一个瓶子不应该出现偏差。

我们测试了这一点。我们拿来了openai/gpt-image-2已经做好的咖啡袋，将其作为input_references图像发回去，并要求四个模型在保持袋子及其印刷标签完全不变的前提下，将白色背景替换为暖色侧光下的深胡桃木台面。

图 3. 一张源图像、一条指令、四个模型，以及每次编辑的实测成本。

四个模型都保留了文字内容和字体。四个模型也都在一定程度上改变了袋子的形状、比例或光照，且没有一个能逐像素还原源袋子，因此如果一次营销活动中的每张图像都必须与一张主视觉图保持一致，应将输出结果与源图进行对比，而不是仅凭标签来判断。

为了公平地比较编辑与生成，我们还使用编辑指令作为提示词运行了生成一侧，因此两列来自相同的措辞。这一点很重要，因为这些模型中有两个按 token 计费，更长的提示词本身就会带来更高的账单。

模型生成编辑

openai/gpt-image-2$0.0133$0.0142

black-forest-labs/flux.2-pro$0.0300$0.0450

google/gemini-3-pro-image$0.1345$0.1356

sourceful/riverflow-v2.5-pro$0.0646$0.0760

black-forest-labs/flux.2-pro 的编辑费用又贵了一半。其编辑响应报告了 4,096 个提示词 token，而生成响应只报告了 34 个，这说明参考图像被计入了输入，而且其端点只列出了输出百万像素的费率，因此仅凭列出的费率无法预测编辑价格。sourceful/riverflow-v2.5-pro 的编辑费用贵了 18%。在 openai/gpt-image-2 和 google/gemini-3-pro-image 上，差距不到 7%。这些都是单次运行，因此请将较小的差距视为近似值，而非精确的溢价。

有两个数字可以缩小编辑功能的候选范围，即模型接受多少张参考图像，以及它在 Design Arena 图像编辑榜单上的评分。

black-forest-labs/flux.2-pro 接受八张参考图像，生成费用为 $0.03，编辑费用为 $0.045。black-forest-labs/flux.2-max 同样提供八张参考图像，每张生成图像的费用为 $0.07。

如果你的品牌套件超过八张图片，FLUX.2 就无法接收。Gemini 3.x 图像模型和 Seedream 5.0 可以接收十四张，OpenAI 的图像模型可以接收十六张。Grok 上限为三张。

同时包含图片和文字的回复

有时用户正在进行一段对话，而回答应当同时包含一张图片和一段文字说明。我们目录中 52 个模型里有九个将文本列为其输出模态之一，它们就是能够做到这一点的模型。它们是 Gemini 图像模型和 OpenAI 的 gpt-5-image 模型。

能够返回文本和实际做到是两回事。我们选取了这九个中的四个，通过 chat completions 端点向每个模型发送了相同的请求，并带上 modalities: ["image", "text"]，要求给出一张图片外加两句话的解释，然后统计我们同时得到两者的频率。这些成本高于这些模型在成本表中的数字，因为回复中带有文本，而在按 token 计费的模型上，两者你都要付费。

模型带文本的回复每次调用成本

openai/gpt-5-image3 个中的第 2 个$0.20 至 $0.28

google/gemini-3-pro-image3 / 3$0.138 至 $0.140

google/gemini-3.1-flash-image1 / 4$0.067

google/gemini-3.1-flash-lite-image0 / 2$0.034

上述每一次调用都至少返回了一张图片。google/gemini-3-pro-image 每次调用返回了两张图片。差异在于文字那一半，而那两个更便宜的 Gemini 模型大多跳过了它，尽管提示词直接要求了这一点。

如果文字是可选的，google/gemini-3.1-flash-image 以 $0.067 的价格可用，你自行处理空返回的情况。如果你的产品缺少文字就无法运行，那么 google/gemini-3-pro-image 以约 $0.139 的价格是四款模型中唯一在我们的测试中每次都返回文字的模型。

我们建议在新的图像工作中使用专用的 Image API，而非 chat completions，因为新的图像模型只会添加到 Image API，而 chat 路由提供的参数更少。openai/gpt-5-image 也是这里最贵的选项，每次调用 $0.20 到 $0.28，而且它在三次调用中有两次返回了文本。这些 chat 调用会在图像之外额外对提示词和补全 token 计费，因此一段很长的指令和一个很长的回答会比单张图像的价格更贵。

三项任务，两个端点

生成、编辑和聊天看起来相似，但它们是不同的请求。生成和编辑使用 images 端点，仅相差一个字段。聊天则改用 chat completions 端点，只有上面九个具备文本能力的模型才能做到。我们的OpenRouter 上的图像生成模型教程涵盖了这两个端点的完整请求和响应契约。

图 4。生成和编辑是同一个端点，只是请求体不同。聊天则是另一个端点。

生成就是 POST /api/v1/images 加上一个 model 和一个 prompt。你会得到图像字节作为返回。

编辑是同一个端点加上 input_references，因为你是在修改一张已有的图像，而不是生成一张新的。

聊天发送一个messages数组到POST /api/v1/chat/completions。文本和图像输入，文本和图像也可以返回。

在 OpenRouter 上调用它

图像路由是 POST https://openrouter.ai/api/v1/images。唯一必填字段是 model 和 prompt。

curl https://openrouter.ai/api/v1/images \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "black-forest-labs/flux.2-klein-4b", "prompt": "A studio packshot of a glass bottle, hard key light, no text.", "aspect_ratio": "1:1" }'

响应中包含图像及其费用。这是我们在 2026 年 9 月 11 日针对该请求收到的响应，已裁剪为本文讨论的字段，并移除了图像字节。

{ "data": [ { "b64_json": "<base64>", "media_type": "image/jpeg" } ], "usage": { "prompt_tokens": 16, "completion_tokens": 4096, "total_tokens": 4112, "cost": 0.014, "completion_tokens_details": { "image_tokens": 4096 } } }

要改为编辑图像，请在同一请求体中添加一个 input_references 数组。每个条目都是一个 image_url 对象，携带 HTTP(S) URL 或 base64 数据 URL。

{ "model": "black-forest-labs/flux.2-pro", "prompt": "Keep the bag and its printed label exactly as they are. Replace the white background with a dark walnut counter under warm side light.", "aspect_ratio": "1:1", "input_references": [ { "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } } ] }

我们的 TypeScript SDK 封装了同一路由，并将字段名转换为驼峰式，因此 b64_json 变为 b64Json，media_type 变为 mediaType，而 aspect_ratio 变为 aspectRatio。generate 方法的返回类型也涵盖了流式场景，因此在读取 data 属性之前，请先对其进行类型收窄。

import { OpenRouter } from '@openrouter/sdk';

const openRouter = new OpenRouter({ apiKey: process.env.OPENROUTER_API_KEY ?? '' });

const result = await openRouter.images.generate({ imageGenerationRequest: { model: 'black-forest-labs/flux.2-klein-4b', prompt: 'A studio packshot of a glass bottle, hard key light, no text.', aspectRatio: '1:1', }, });

if (!('data' in result)) { throw new Error('Expected a non-streaming image response'); }

const image = result.data[0]?.b64Json; const mediaType = result.data[0]?.mediaType; const cost = result.usage?.cost;

常见问题

2026 年最佳的图像生成模型是什么？

没有单一的最佳模型，所以要按任务来选。在我们 2026 年 9 月 11 日的测试中，openai/gpt-image-2 是我们测到的最便宜的模型，根据提示词长度不同，每张图像收费 $0.006 到 $0.0135，并且它正确渲染了两行标签和一次参考编辑。sourceful/riverflow-v2.5-pro 在 Design Arena 图像和图像编辑榜单上领先，每张图像收费 $0.064。recraft/recraft-v4.1-vector 以每张图像 $0.08 的价格返回可编辑的 SVG。

OpenRouter 上最便宜的图像生成模型是哪个？

在我们以 1024x1024 分辨率、默认设置测量的 20 个模型中，openai/gpt-image-2 收费最低，一行提示词为 $0.00599。black-forest-labs/flux.2-klein-4b 收费 $0.014，sourceful/riverflow-v2.5-fast 收费 $0.0176。在按 token 计费的模型上，提示词长度会改变账单，而在 OpenAI 模型上，quality 设置让同一张图像的费用从 $0.006 变为 $0.211。

哪些图像模型可以编辑现有图像？

任何端点列出 input_references 的模型都通过 POST /api/v1/images 接受参考图像。上限因模型而异。在 2026 年 9 月 11 日，OpenAI 图像模型接受 16 张，Gemini 3.x 图像模型和 Seedream 5.0 接受 14 张，sourceful/riverflow-v2.5-pro 接受 10 张，FLUX.2 Flex、Pro 和 Max 接受 8 张，FLUX.2 Klein 和 Qwen Image 3 接受 4 张，Grok Imagine 接受 3 张，Recraft、Krea 和 MAI Image 接受 1 张。请阅读 GET /api/v1/images/models/{model}/endpoints 了解当前数值。

哪些图像模型可以同时回复文本和图像？

输出模态包含文本的模型。在 2026 年 9 月 11 日，我们目录中的 52 个图像模型里有九个属于此类，即所有 Gemini 图像模型和 OpenAI gpt-5-image 模型。通过 POST /api/v1/chat/completions 调用它们。在我们的测试中，google/gemini-3-pro-image 在 3 次调用中有 3 次返回了文本，openai/gpt-5-image 在 3 次中有 2 次，google/gemini-3.1-flash-image 在 4 次中有 1 次，google/gemini-3.1-flash-lite-image 在 2 次中有 0 次。

Image API 返回什么图像格式？

这取决于模型。在我们的运行中，FLUX.2、Grok 和 Seedream 返回 JPEG，OpenAI、Qwen、Microsoft 和 Krea 返回 PNG，Sourceful 和 Recraft 返回 WebP，而 recraft/recraft-v4.1-vector 返回 SVG。目录中的 52 个模型里有十二个接受 output_format 参数。请读取每个响应上的 media_type 字段，而不要假设文件扩展名。
