3 分钟跑通 GPT-Image-2 生图接口

摘要:这篇文章分享一个我自己实测跑通的方案。用 Shell 脚本调用 GPT-Image-2,自动完成接口请求、图片数据解析和本地落图,不用额外装客户端,也不用手动处理 Base64。如果你想快速生成汉服拆解图、文博图鉴或中文信息图,这套方式上手成本很低,几分钟就能跑出第一张图。

最近我在折腾一个很具体的小需求:怎么快速生成一张中文信息完整、画面够清晰、还带点博物馆图鉴气质的汉服拆解图?

一开始整个上午要么找工具跑接口,要么跑通接口后,在将 Base64 转换味图片这里卡住,折腾了一上午。最后下午很快搞定了。结果实测下来,比预想简单不少。直接用一个 Shell 脚本调用 GPT-Image-2,再把接口返回结果自动转成图片,几分钟就能拿到成品。

说实话,这种体验对程序员还挺友好。

不用装一堆客户端,不用自己抠 Base64,也不用把整个调用流程拆得七零八落。对我这种平时习惯先看稳定性、再看效率的人来说,这种方案就很舒服。

这篇文章我直接把跑通方式、完整脚本和踩坑点一次讲清楚。你照着做,基本可以很快出第一张图。

一、先看效果:终端跑一下,直接出高清中文图鉴图

在这里插入图片描述

上面这类图,我这次是直接用 Mac 自带终端跑出来的。

整个过程非常克制:

  • 没装额外客户端
  • 没手动转 Base64
  • 没额外写解析程序
  • 没做复杂环境配置

最后直接落地一张 2048x2048 的高清图片,整体是比较典型的中文图鉴风:

  • 有主视觉
  • 有结构拆解
  • 有中文标注
  • 有材质和纹样说明
  • 适合拿来做汉服图鉴、文博信息图、结构说明图

如果你也是想做这类内容,这种方式真的比手工折腾省事很多。

二、为什么这套方法值得试

先说结论:门槛低,复用性强,出图效率高。

它最省心的地方在于,整个流程其实只有 3 步:

  1. 拿一个 API Key
  2. 改脚本前面的几个参数
  3. 在终端执行脚本

剩下的事情,脚本自己做:

  • 调接口
  • 接收返回值
  • 提取图片数据
  • 解码成 PNG
  • 自动打开图片

这就很像我们平时写自动化脚本的思路:把重复动作收口,把手工操作减到最少。

三、先准备 API Key

先去 SiliconRouter 官网注册账号并创建应用,拿到自己的 API Key

https://www.siliconrouter.ai/ai-router/home

流程不复杂,注册登录后进入控制台,创建应用就能看到密钥。

这里建议顺手把 API Key 单独保存一下,不然后面复制丢了,还得回去翻一遍。

四、完整脚本直接贴,改 3 个参数就能跑(直接复制我的就行)

新建一个脚本文件,命名为 generate_image.sh,然后把下面这段内容完整复制进去。

真正需要你手动改的,只有最上面的 3 个参数:

  • API_KEY
  • THEME
  • OUTPUT_IMAGE
#!/bin/bash

# ============ 只改这 3 个配置就够了 ============
API_KEY="替换成你的 SiliconRouter_API_KEY"
THEME="明制汉服拆解图"
OUTPUT_IMAGE="明制汉服博物馆图鉴.png"
# ================================================

PROMPT="请根据【${THEME}】自动生成一张“博物馆图鉴式中文拆解信息图”。要求整张图兼具真实写实主视觉、结构拆解、中文标注、材质说明、纹样寓意、色彩含义和核心特征总结。你需要根据【${THEME}】自动判断最合适的主体对象、服饰体系、器物结构、时代风格、关键部件、材质工艺、颜色方案与版式结构,用户无需再提供其他信息。整体风格应为:国家博物馆展板、历史服饰图鉴、文博专题信息图,而不是普通海报、古风写真、电商详情页或动漫插画。背景采用米白、绢纸白、浅茶色等纸张质感,整体高级、克制、专业、可收藏。版式固定为:顶部:中文主标题 + 副标题 + 导语;左侧:结构拆解区,中文引线标注关键部件,并配局部特写;右上:材质 / 工艺 / 质感区,展示真实纹理小样并附说明;右中:纹样 / 色彩 / 寓意区,展示主色板、纹样样本和文化解释;底部:穿着顺序 / 构成流程图 + 核心特征总结。若主题适合人物展示,则以真实人物全身站姿为中央主体;若更适合器物或单体结构,则改为中心主体拆解图,但整体仍保持完整中文信息图形式。所有文字必须为简体中文,清晰、规整、可读,不要乱码、错字、英文或拼音。重点突出真实结构、材质差异、文化说明、纹样寓意与图鉴气质。避免:海报感、影楼感、电商感、动漫感、cosplay感、乱标注、错结构、糊字、假材质、过度装饰。"

echo "开始生成主题:${THEME}"
echo "输出文件名:${OUTPUT_IMAGE}"

curl -s -X POST https://api.siliconrouter.com/v1/images/generations \
  -H "Authorization: Bearer ${API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-image-2",
    "prompt": "'"${PROMPT}"'",
    "size": "2048x2048",
    "quality": "medium",
    "output_compression": 100,
    "output_format": "png",
    "n": 1,
    "moderation": "low"
  }' > response.json

echo "解析 Base64 图片数据..."
B64=$(cat response.json | grep -o '"b64_json":"[^"]*"' | sed 's/"b64_json":"//;s/"$//')

echo "保存本地图片..."
echo ${B64} | base64 -d > "${OUTPUT_IMAGE}"

echo "生成完成,准备打开图片"
open "${OUTPUT_IMAGE}"

五、这段脚本到底做了什么

如果你不喜欢只看“照着抄”,那这部分可以顺手看一下。

这段脚本的执行逻辑其实很直接:

  1. 把主题词拼进固定 Prompt
  2. 调用图片生成接口
  3. 把返回结果写入 response.json
  4. 提取其中的 b64_json
  5. 解码生成本地 PNG 文件
  6. 自动打开图片

也就是说,它不是“单纯请求一下接口”,而是把调用、解析、落盘、查看这一整套动作串起来了。

这种脚本用起来会很顺,因为你不需要每次都手动处理中间结果。

六、终端怎么执行

脚本保存好以后,打开终端,执行下面几条命令:

cd Desktop
chmod +x generate_image.sh
./generate_image.sh

如果你的脚本不在桌面,把 cd Desktop 改成对应目录就行。

执行成功后,终端一般会按这个顺序输出:

  • 开始生成主题
  • 调用接口
  • 解析图片数据
  • 保存本地图片
  • 自动打开结果图

我这边实测,几分钟左右就能看到成品。

七、想换主题?不用改脚本主体

这一点我觉得很实用。

如果你后面不想生成“明制汉服拆解图”,只需要改这两行:

THEME="宋制汉服拆解图"
OUTPUT_IMAGE="宋制汉服图鉴.png"

然后重新执行:

./generate_image.sh

就可以继续出新图。

这套方式不只适合汉服,理论上你还可以继续拿它生成:

  • 凤冠霞帔图鉴
  • 宋朝褙子结构图
  • 甲胄拆解图
  • 文物器型说明图
  • 产品结构信息图

只要主题适合“中文图鉴式表达”,这套 Prompt 都有复用空间。

八、实测踩坑总结:这几处最容易翻车

1. 报 401,先查 API Key

接口报 401 的时候,先不要急着怀疑平台或者脚本。

大部分情况下,问题都在这里:

  • API Key 复制错了
  • 前后多了空格
  • 粘贴了旧 Key

这个排查逻辑其实很像数据库连不上先看账号密码,不复杂,但特别常见。

2. 主题词别一开始就写太满

虽然 GPT-Image-2 对中文理解已经不错了,但如果你一口气把需求堆得特别散,模型也容易把图做偏。

建议先从短主题开始,比如:

  • 明制汉服拆解图
  • 宋朝褙子图鉴
  • 清朝旗装结构说明图

先看基础结果,再往上叠加限定条件,这样成功率会更高。

3. 没出图,先看 response.json

如果执行完没有生成结果,不要只盯着终端表面输出,先去看 response.json

重点检查:

  • 接口有没有返回错误信息
  • 是否成功拿到 b64_json
  • 返回内容是不是被截断了

这种思路和排查 SQL 异常、接口超时其实是一样的。出问题先看返回,再决定下一步,不要上来就乱改脚本。

4. base64 参数在不同系统里可能不一样

我这篇文章是按 Mac 环境跑通的。

如果你在 Linux 或其他环境中执行,base64 的参数细节可能略有差异,这时候可以先看本机帮助:

base64 --help

或者:

man base64

九、为什么我这次选 SiliconRouter

官网地址放一下:

https://www.siliconrouter.ai/ai-router/home

关注“硅基路由”公号,可以领取专属优惠。

1. 接入成本低

很多时候最消耗开发时间的,不是模型能力,而是接入过程本身。

参数风格不统一、接口规范不一致、迁移时还要反复改代码,这些东西才是真的磨人。

这个平台比较省事的地方在于,拿到 API Key 之后就能很快开始调。对于想快速验证想法、先把效果跑出来的人来说,这一点很关键。

2. 适合做统一调用

如果你后面不是只生成一张图,而是准备把生图能力接进脚本、服务或者工作流里,那统一路由会更方便一些。

这样后续切换模型或者扩展能力时,不用每次都大改接入层。

3. 中文图鉴场景表现不错

这次我主要测的是“中文信息图”这类场景。

也就是说,不只是要有图,还得尽量让中文排版、信息区域、结构表达看起来靠谱。

从实测结果看,GPT-Image-2 在这类任务里确实能用,而且不是那种只能凑合看的水平,是能明显帮你提效的那种。

十、总结:这套方法为什么值得收藏

如果你最近正好想做:

  • 汉服拆解图
  • 文博图鉴
  • 中文结构说明图
  • 可复用的 AI 生图脚本

那这套方法很适合先收藏再实操。

它的核心优势就 3 个字:省、快、稳。

  • 省的是操作成本
  • 快的是出图效率
  • 稳的是脚本复用和执行链路

说到底,这不是一篇“看起来很厉害但不好落地”的演示文,而是一套你今天复制、今天就能跑起来的方案。

如果你平时也喜欢把重复动作脚本化,把试错成本压低,把结果尽快跑出来,那这套方式应该会挺对胃口。

如果你也在折腾 AI 生图、中文信息图,或者想把模型能力接进自己的自动化脚本里,这套方案可以先跑一遍,基本能快速验证思路。

PS:创作不易,如果这篇文章对你有帮助,欢迎点赞、收藏,也欢迎在评论区“交作业”。😄

参考来源

https://x.com/MrLarus/status/2045504669401653414/photo/1

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐