3 分钟跑通 GPT-Image-2 生图接口
3 分钟跑通 GPT-Image-2 生图接口
摘要:这篇文章分享一个我自己实测跑通的方案。用
Shell脚本调用GPT-Image-2,自动完成接口请求、图片数据解析和本地落图,不用额外装客户端,也不用手动处理Base64。如果你想快速生成汉服拆解图、文博图鉴或中文信息图,这套方式上手成本很低,几分钟就能跑出第一张图。
最近我在折腾一个很具体的小需求:怎么快速生成一张中文信息完整、画面够清晰、还带点博物馆图鉴气质的汉服拆解图?
一开始整个上午要么找工具跑接口,要么跑通接口后,在将 Base64 转换味图片这里卡住,折腾了一上午。最后下午很快搞定了。结果实测下来,比预想简单不少。直接用一个 Shell 脚本调用 GPT-Image-2,再把接口返回结果自动转成图片,几分钟就能拿到成品。
说实话,这种体验对程序员还挺友好。
不用装一堆客户端,不用自己抠 Base64,也不用把整个调用流程拆得七零八落。对我这种平时习惯先看稳定性、再看效率的人来说,这种方案就很舒服。
这篇文章我直接把跑通方式、完整脚本和踩坑点一次讲清楚。你照着做,基本可以很快出第一张图。
一、先看效果:终端跑一下,直接出高清中文图鉴图

上面这类图,我这次是直接用 Mac 自带终端跑出来的。
整个过程非常克制:
- 没装额外客户端
- 没手动转
Base64 - 没额外写解析程序
- 没做复杂环境配置
最后直接落地一张 2048x2048 的高清图片,整体是比较典型的中文图鉴风:
- 有主视觉
- 有结构拆解
- 有中文标注
- 有材质和纹样说明
- 适合拿来做汉服图鉴、文博信息图、结构说明图
如果你也是想做这类内容,这种方式真的比手工折腾省事很多。
二、为什么这套方法值得试
先说结论:门槛低,复用性强,出图效率高。
它最省心的地方在于,整个流程其实只有 3 步:
- 拿一个
API Key - 改脚本前面的几个参数
- 在终端执行脚本
剩下的事情,脚本自己做:
- 调接口
- 接收返回值
- 提取图片数据
- 解码成 PNG
- 自动打开图片
这就很像我们平时写自动化脚本的思路:把重复动作收口,把手工操作减到最少。
三、先准备 API Key
先去 SiliconRouter 官网注册账号并创建应用,拿到自己的 API Key:
https://www.siliconrouter.ai/ai-router/home
流程不复杂,注册登录后进入控制台,创建应用就能看到密钥。
这里建议顺手把 API Key 单独保存一下,不然后面复制丢了,还得回去翻一遍。
四、完整脚本直接贴,改 3 个参数就能跑(直接复制我的就行)
新建一个脚本文件,命名为 generate_image.sh,然后把下面这段内容完整复制进去。
真正需要你手动改的,只有最上面的 3 个参数:
API_KEYTHEMEOUTPUT_IMAGE
#!/bin/bash
# ============ 只改这 3 个配置就够了 ============
API_KEY="替换成你的 SiliconRouter_API_KEY"
THEME="明制汉服拆解图"
OUTPUT_IMAGE="明制汉服博物馆图鉴.png"
# ================================================
PROMPT="请根据【${THEME}】自动生成一张“博物馆图鉴式中文拆解信息图”。要求整张图兼具真实写实主视觉、结构拆解、中文标注、材质说明、纹样寓意、色彩含义和核心特征总结。你需要根据【${THEME}】自动判断最合适的主体对象、服饰体系、器物结构、时代风格、关键部件、材质工艺、颜色方案与版式结构,用户无需再提供其他信息。整体风格应为:国家博物馆展板、历史服饰图鉴、文博专题信息图,而不是普通海报、古风写真、电商详情页或动漫插画。背景采用米白、绢纸白、浅茶色等纸张质感,整体高级、克制、专业、可收藏。版式固定为:顶部:中文主标题 + 副标题 + 导语;左侧:结构拆解区,中文引线标注关键部件,并配局部特写;右上:材质 / 工艺 / 质感区,展示真实纹理小样并附说明;右中:纹样 / 色彩 / 寓意区,展示主色板、纹样样本和文化解释;底部:穿着顺序 / 构成流程图 + 核心特征总结。若主题适合人物展示,则以真实人物全身站姿为中央主体;若更适合器物或单体结构,则改为中心主体拆解图,但整体仍保持完整中文信息图形式。所有文字必须为简体中文,清晰、规整、可读,不要乱码、错字、英文或拼音。重点突出真实结构、材质差异、文化说明、纹样寓意与图鉴气质。避免:海报感、影楼感、电商感、动漫感、cosplay感、乱标注、错结构、糊字、假材质、过度装饰。"
echo "开始生成主题:${THEME}"
echo "输出文件名:${OUTPUT_IMAGE}"
curl -s -X POST https://api.siliconrouter.com/v1/images/generations \
-H "Authorization: Bearer ${API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2",
"prompt": "'"${PROMPT}"'",
"size": "2048x2048",
"quality": "medium",
"output_compression": 100,
"output_format": "png",
"n": 1,
"moderation": "low"
}' > response.json
echo "解析 Base64 图片数据..."
B64=$(cat response.json | grep -o '"b64_json":"[^"]*"' | sed 's/"b64_json":"//;s/"$//')
echo "保存本地图片..."
echo ${B64} | base64 -d > "${OUTPUT_IMAGE}"
echo "生成完成,准备打开图片"
open "${OUTPUT_IMAGE}"
五、这段脚本到底做了什么
如果你不喜欢只看“照着抄”,那这部分可以顺手看一下。
这段脚本的执行逻辑其实很直接:
- 把主题词拼进固定 Prompt
- 调用图片生成接口
- 把返回结果写入
response.json - 提取其中的
b64_json - 解码生成本地 PNG 文件
- 自动打开图片
也就是说,它不是“单纯请求一下接口”,而是把调用、解析、落盘、查看这一整套动作串起来了。
这种脚本用起来会很顺,因为你不需要每次都手动处理中间结果。
六、终端怎么执行
脚本保存好以后,打开终端,执行下面几条命令:
cd Desktop
chmod +x generate_image.sh
./generate_image.sh
如果你的脚本不在桌面,把 cd Desktop 改成对应目录就行。
执行成功后,终端一般会按这个顺序输出:
- 开始生成主题
- 调用接口
- 解析图片数据
- 保存本地图片
- 自动打开结果图
我这边实测,几分钟左右就能看到成品。
七、想换主题?不用改脚本主体
这一点我觉得很实用。
如果你后面不想生成“明制汉服拆解图”,只需要改这两行:
THEME="宋制汉服拆解图"
OUTPUT_IMAGE="宋制汉服图鉴.png"
然后重新执行:
./generate_image.sh
就可以继续出新图。
这套方式不只适合汉服,理论上你还可以继续拿它生成:
- 凤冠霞帔图鉴
- 宋朝褙子结构图
- 甲胄拆解图
- 文物器型说明图
- 产品结构信息图
只要主题适合“中文图鉴式表达”,这套 Prompt 都有复用空间。
八、实测踩坑总结:这几处最容易翻车
1. 报 401,先查 API Key
接口报 401 的时候,先不要急着怀疑平台或者脚本。
大部分情况下,问题都在这里:
API Key复制错了- 前后多了空格
- 粘贴了旧 Key
这个排查逻辑其实很像数据库连不上先看账号密码,不复杂,但特别常见。
2. 主题词别一开始就写太满
虽然 GPT-Image-2 对中文理解已经不错了,但如果你一口气把需求堆得特别散,模型也容易把图做偏。
建议先从短主题开始,比如:
明制汉服拆解图宋朝褙子图鉴清朝旗装结构说明图
先看基础结果,再往上叠加限定条件,这样成功率会更高。
3. 没出图,先看 response.json
如果执行完没有生成结果,不要只盯着终端表面输出,先去看 response.json。
重点检查:
- 接口有没有返回错误信息
- 是否成功拿到
b64_json - 返回内容是不是被截断了
这种思路和排查 SQL 异常、接口超时其实是一样的。出问题先看返回,再决定下一步,不要上来就乱改脚本。
4. base64 参数在不同系统里可能不一样
我这篇文章是按 Mac 环境跑通的。
如果你在 Linux 或其他环境中执行,base64 的参数细节可能略有差异,这时候可以先看本机帮助:
base64 --help
或者:
man base64
九、为什么我这次选 SiliconRouter
官网地址放一下:
https://www.siliconrouter.ai/ai-router/home
关注“硅基路由”公号,可以领取专属优惠。
1. 接入成本低
很多时候最消耗开发时间的,不是模型能力,而是接入过程本身。
参数风格不统一、接口规范不一致、迁移时还要反复改代码,这些东西才是真的磨人。
这个平台比较省事的地方在于,拿到 API Key 之后就能很快开始调。对于想快速验证想法、先把效果跑出来的人来说,这一点很关键。
2. 适合做统一调用
如果你后面不是只生成一张图,而是准备把生图能力接进脚本、服务或者工作流里,那统一路由会更方便一些。
这样后续切换模型或者扩展能力时,不用每次都大改接入层。
3. 中文图鉴场景表现不错
这次我主要测的是“中文信息图”这类场景。
也就是说,不只是要有图,还得尽量让中文排版、信息区域、结构表达看起来靠谱。
从实测结果看,GPT-Image-2 在这类任务里确实能用,而且不是那种只能凑合看的水平,是能明显帮你提效的那种。
十、总结:这套方法为什么值得收藏
如果你最近正好想做:
- 汉服拆解图
- 文博图鉴
- 中文结构说明图
- 可复用的 AI 生图脚本
那这套方法很适合先收藏再实操。
它的核心优势就 3 个字:省、快、稳。
- 省的是操作成本
- 快的是出图效率
- 稳的是脚本复用和执行链路
说到底,这不是一篇“看起来很厉害但不好落地”的演示文,而是一套你今天复制、今天就能跑起来的方案。
如果你平时也喜欢把重复动作脚本化,把试错成本压低,把结果尽快跑出来,那这套方式应该会挺对胃口。
如果你也在折腾 AI 生图、中文信息图,或者想把模型能力接进自己的自动化脚本里,这套方案可以先跑一遍,基本能快速验证思路。
PS:创作不易,如果这篇文章对你有帮助,欢迎点赞、收藏,也欢迎在评论区“交作业”。😄
参考来源
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)