openai/gpt-image-2 的 API 参考,该模型由 OpenAI 提供,并通过 Comfy Router 服务。
快速开始
在你的 Comfy 工作区中创建一个密钥,并将其导出为COMFY_API_KEY。Python 和 TypeScript 代码片段使用 Comfy SDK(pip install comfy-sdk 和 npm install @comfyorg/sdk);cURL 代码片段则是通过原始 HTTP 发起的同一调用。
模型 ID: openai/gpt-image-2
端点: POST https://api.comfy.org/v2/models/openai/gpt-image-2
- 等待结果
- 排队并稍后收集
相同的请求体,发送到
POST https://api.comfy.org/v2/models/openai/gpt-image-2/requests。只要运行被接纳,Router 就会立即返回 201 和一个 request_id,结果准备就绪后再进行收集,可以由当前进程或另一个进程完成。排队投递 会详细讲解状态、取消和收集。服务提供商
除非请求中指定了其他提供商,否则此模型由 Comfy Router 直接提供服务。以下提供商也在同一端点上、使用相同的模型 ID 提供该模型,通过model_provider 查询参数来选择。
- Comfy(默认):
POST https://api.comfy.org/v2/models/openai/gpt-image-2 - fal,以
fal/fal-gpt-image-2的形式:POST https://api.comfy.org/v2/models/openai/gpt-image-2?model_provider=fal - Runware,以
runware/runware-gpt-image-2的形式:POST https://api.comfy.org/v2/models/openai/gpt-image-2?model_provider=runware - WaveSpeed,以
wavespeed/wavespeed-gpt-image-2的形式:POST https://api.comfy.org/v2/models/openai/gpt-image-2?model_provider=wavespeed
strict_mode 默认为 false,因此 Router 会将本页记录的原生请求体转换为提供商自己的 schema,并把响应转换回来。请参阅 API 参考中的 model_provider、strict_mode 和 fallback_provider,以及服务提供商,了解所有以这种方式路由的模型。
架构
输入
string
背景透明度。
auto 由模型自行选择。可能的值:transparent、opaque、autostring | string[]
要编辑的来源图像。此字段是否存在即决定采用编辑操作:若要进行文生图生成,则完全省略该字段。
模型公开的示例是生成调用,其中省略了此字段。添加
image 就是两种模式之间的全部差异:相同的端点、相同的模型 id;只不过编辑提示词描述的是你想要的更改,而不是场景,因此即便结构上只有这一个字段是新增的,下面的编辑请求体读起来也与生成示例不同。
它可以按原样直接复制:{"prompt": "give the rocketship rainbow coloring", "image": ["data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAAEAAAABCAYAAAAfFcSJAAAADUlEQVR42mP8z8BQDwAEhQGAhKmMIQAAAABJRU5ErkJggg=="], "size": "1024x1024"}:该 payload 是一张完整的 1x1 PNG,而非缩写形式,并且此请求体已作为可接受用例固定在 Router 自身的请求验证测试中。请替换为你自己图像的字节。
接受单张图像或图像数组;gpt-image-1 及之后的版本最多接受 16 张,Router 会在派发之前依据此架构强制执行该限制。string
单张图像,形式为 Router 代表调用方获取的 https URL,或内联携带字节的
data:image/<format>;base64,<payload> URI。可接受的图像类型为 png、webp 和 jpeg,该集合会在解析时强制执行,而不是留给提供商处理:svg、gif、avif 或 tiff 会在此处被拒绝并指明你发送的图像,而不会变成距离根因两跳之外的合作伙伴错误。
优先使用 URL 形式。base64 payload 会膨胀约 4/3,而整个请求体上限为 100 MiB,因此内联形式最高只能支持约 75 MB 的来源图像;使用 URL 则完全绕开这一点。本描述末尾说明的单张图像与单次请求的媒体上限比请求体上限更严格,因此对于任何实际尺寸的图像,你首先遇到的是这些限制。
该 URL 必须在不使用你的凭据的情况下可解析。Router 在服务器端获取它,且请求中不会发送调用方凭据,因此支持的形式是预签名 URL,即签名位于查询字符串中的 URL。诸如 /api/assets/{id}/content 这类需要身份验证的端点会向 Router 返回 401 而不是图像;请自行请求该 URL,并传递它重定向到的签名 URL。
获取操作被限制在一组指定的主机内,而不是对整个开放互联网开放;同一份列表会同时应用到你发送的 URL 以及每一次重定向跳转,因此位于其他任何主机上的 URL,或重定向跳出该列表的 URL,都会在任何提供商被联系之前遭到拒绝。目前该列表仅包含 Comfy 自己的资产分发:位于 Comfy 资产桶下的已签名 storage.googleapis.com URL,也就是 /api/assets/{id}/content 重定向你前往的那种形式。合作伙伴 CDN 或普通的 https 主机不在该列表内。
有两项放宽正在逐步推出,当前两者都默认关闭。它们位于同一个切换开关之后并一起启用,因此请将以下所有内容视为即将推出,而不是现在就能依赖的功能:在依赖其中任何一项之前请先咨询。
第一项是 POST /customers/storage 将你的上传签名到的桶。在该推出到达你的环境之前,来自该端点的上传 URL 会在这里被拒绝,即便该桶属于 Comfy 自身、主机也是同一台:因此“先上传到 Comfy,再传递 URL”目前并不可行,可行的形式是 /api/assets/{id}/content 重定向到的签名 URL。
第二项是按账户启用,而不是一次性对所有人开放,因为这些主机背后的桶属于你而不是我们:即使上面的切换已开启,未启用第三方入站媒体的账户仍会被拒绝,并会以这样的措辞告知,而不会被告知主机不受支持。请联系你的 Comfy 对接人为此账户启用。它还会额外接纳以下第三方对象存储主机,这些主机的桶属于你,Router 对其不作所属声索:Cloudflare R2(<account>.r2.cloudflarestorage.com、<id>.r2.dev)、Amazon S3(s3.amazonaws.com 和 s3.<region>.amazonaws.com,路径风格或带 <bucket>. 前缀的形式均可)、Azure Blob Storage(<account>.blob.core.windows.net)以及阿里云 OSS(<bucket>.oss-<region>.aliyuncs.com,包括 oss-accelerate 端点)。这些具体是对象存储端点:同一提供商域名上的通用端点(例如阿里云函数计算触发器)不在列表内,会被拒绝。
下面的示例仅展示形状:真实值还会携带签名查询参数,这里故意省略,因为已发布的示例会永久留在规范中,而真实的签名既是泄露的凭据,也是会失效的链接。
每张图像上限为 25 MiB,单次请求的所有图像合计上限为 64 MiB。string
要运行的 gpt-image 模型。Router 会拼接所寻址的模型 id,因此寻址 /v2/models/openai/gpt-image-2 的调用方不会发送此字段。
string
内容审核设置可能的值:
low、autointeger
要生成的图像数量(1-10)。范围:
1 到 10integer
JPEG 或 WebP 的压缩级别(0-100)范围:
0 到 100string
输出图像的格式可能的值:
png、webp、jpeginteger
仅限 gpt-image。流式传输时发出多少张部分图像(0-3)。仅在配合
stream: true 时才有意义。范围:0 到 3string
必填
要生成的图像的文字描述,或要对
image 执行的编辑操作。string
生成或编辑后图像的质量。
xhigh 和 max 是专为 gpt-image-2.5-flare 和 gpt-image-2.5-sunburst 新增的两个档位;standard 和 hd 是 dall-e 时代的拼写,任何已收录的模型都不会读取。可能的值:auto、low、medium、high、xhigh、max、standard、hdstring
图像尺寸(例如 1024x1024、1536x1024、auto)
boolean
仅限 gpt-image。在生成过程中流式返回部分图像。OpenAI 会拒绝将
stream: true 与大于 1 的 n 组合使用。string
用于终端用户监控的唯一标识符
GET /v2/models/openai/gpt-image-2/openapi.json 上提供的 schema 生成,Router 在请求送达提供商之前正是用同一份文档来校验调用。
输出
object[]
string
Base64 编码的图像数据
string
修订后的提示词
string
图像的 URL
object
integer
object
integer
integer
integer
object
integer
integer
integer
string
已生成图像的背景是
opaque 还是 transparent,即 OpenAI 为本次生成所解析采用的值。该请求参数默认为 auto,因此对于未固定该参数的调用方来说,这里正是获知实际生成结果的地方。integer
生成完成时的 Unix 时间戳,单位为秒。它是 OpenAI 在图像生成响应中声明为 REQUIRED(必填)的唯一成员,因此只要生产者是 OpenAI,该字段就会出现;而由 fal 或 wavespeed 提供的
openai/gpt-image-2 响应则会完全省略它,与另外四个已解析参数成员一样。声明为 int64,因为当今的 epoch 值已十分接近 2^31,在很多 SDK 生成器中,未指定格式的 integer 会生成 32 位字段。格式:int64string
data[].b64_json 中字节的编码格式:png、webp 或 jpeg。它是 OpenAI 实际编码所用的格式:发送了请求的 output_format 时即为该值,未发送时则为 png,因此解码器可以直接依据它,而无需从请求中重新推导格式。string
本次生成实际运行的质量档位:OpenAI 报告为
low、medium、high、xhigh 或 max 之一。它是已解析(RESOLVED)的档位,而非对请求的回显,因为请求自身的 quality 默认为 auto。string
本次生成实际运行的像素尺寸,格式为
<width>x<height>。它是已解析(RESOLVED)的尺寸:请求的 size 默认为 auto 且明确接受 auto,因此这里是唯一报告实际所用尺寸的地方。示例
输入
输出
发布前须知
SDK 会生成Idempotency-Key 并在自动重试中复用它。手动重试时,请复用原始 key。Router 最长可保持连接 10 分钟。
请求失败时,Router 会发送 X-Comfy-Error-Type 响应头说明原因。422 表示 Router 在调用提供商之前就拒绝了输入,413 表示请求体超出了 Router 可接受的大小。已生成的资源请及时下载,因为结果 URL 会过期。
上文任何字段描述中提到的尺寸限制,都是提供商对该字段自身的限定,引自提供商的规范。Router 会对整个请求体另行设置上限,base64 编码的媒体内容也计入其中:参见请求体大小。
本页记录的是通过 Comfy Router 调用的某一个合作伙伴模型。同一个 comfy-sdk / @comfyorg/sdk 包还提供第二个客户端,用于在 Comfy Cloud 上运行完整的 ComfyUI 工作流图:Comfy(api_key=...) / new Comfy({ apiKey }),并带有 client.workflows、client.assets 和 client.jobs。请参阅 Comfy SDKs。
请求头
身份验证、幂等性、请求 ID、错误分类、重试节奏、消费限额。
使用 Router API
模型发现、验证错误、重试与计费。
限制
Router 目前不支持的功能,以及替代方案。