OpenAI GPT Image 2.5 提示词指南全解
OpenAI 悄然发布了 GPT Image 2.5 的完整提示词指南。本文解读其核心内容:模型选择、参数规范、8 条规则、12 种技巧。
大多数提示词建议属于民间经验。有人发现某个词组有效,发出来,“cinematic lighting, 8k, masterpiece” 就成了工程标准。
OpenAI 官方的 GPT Image 2.5 提示词指南并非如此。它像一份规格说明书:选对模型,把设置留在参数里,像设计师一样简明描述图片,每次只改一项。没有神奇词汇——这恰恰是它最有价值的地方。
这里是整份指南的解读:双模型架构、六步迁移流程、常见参数误区,以及 8 条规则和 12 种技巧,配有两个模型的对比输出。

OpenAI 实际发布了什么
这份指南藏在 API 文档的 Image prompting 部分,这是首次为图像家族配备书面使用手册。
它依次回答了四个问题:
- 应该用哪个模型?
- 如何迁移现有流程而不损失质量?
- 哪些设置应放在 API 参数而不是提示词里?
- 一个合格的提示词应包含哪些内容?
其余部分为示例——超过二十组,每组都用 GPT Image 2.5 Flare 和 GPT Image 2.5 Sunburst 渲染,便于对比同一输入下的表现。
整份文档的核心:
先确定你需要的图像,再描述主体、构图、风格和约束。编辑时,指出要变动和保持不变的内容。每次只调整一项,检查结果。
这三句话就是指南的精髓。其余为细节——而细节决定输出质量。
Flare 与 Sunburst:先做架构决策
GPT Image 2.5 并非单一模型,而是两个。指南将选择权归为工作流决策,而非个人偏好。
| 模型 | 定义 | 适用场景 |
|---|---|---|
gpt-image-2.5-flare | 小型模型,速度优先 | 图像质量与 GPT Image 2 相当,延迟更低 |
gpt-image-2.5-sunburst | 基础模型,质量优先 | 图像质量高于 GPT Image 2,单张生成更慢 |
指南的决策表非常直接。如果你现有的 GPT Image 2 流程已达标,先测试 Flare,看能否保持质量并降低延迟。如果需求复杂,GPT Image 2 不够用,先用 Sunburst,确认其能否达标。
接下来是关键细节:如果 Sunburst 达标,再用同样的提示词、参考图、尺寸测试 Flare。只有在质量不变且延迟下降时才切换,否则继续用 Sunburst。
这一节有两条容易忽视但代价高昂的规则:
- 同一质量标签在不同模型下不等于同一画质。 Flare 上的
quality="high"与 Sunburst 上的quality="high"生成的图片不同。 - 速度提升依赖具体任务。 指南明确警告:某一任务的加速不代表其他任务也一样,因为提示词、参考图、输出尺寸和质量设置都会影响速度。
两个模型都支持生成、编辑和透明背景,选择只关乎质量与延迟,而非功能。
六步迁移流程
这部分最不花哨,却最实用。它为生产环境替换 GPT Image 2 的团队而写,也适合个人测试新模型。
- 保存基线。 收集具有代表性的生产提示词和参考图,包括难题:复杂编辑、精确文本、人脸、产品结构、透明素材。记录模型、设置和结果。
- 选择首个候选。 已验证的 GPT Image 2 流程:先用 Flare。复杂场景 GPT Image 2 不足:先用 Sunburst。首次对比时,提示词、参考图、尺寸、格式保持不变。
- 检查完整结果。 比较指令执行、身份和产品还原、文本准确性、无关变动和透明度。多次请求以检测一致性,编辑流程要测试完整编辑序列,而非单步。
- 质量达标后再测延迟提升。 这时才用 Flare 按同样要求对比。
- 每次只调一个设置。 先对比质量等级,再考虑重写提示词。测量典型和慢速响应、失败、重试、每张被接受图片的成本。指南特别提醒:确认当前价格,不要假设快的模型更便宜。
- 按工作流逐步切换。 先迁移小部分流量,持续监控同样指标,逐步扩大,保留旧模型以便回滚。
还有一条实话,适合所有生产检查表:多次编辑仍可能改变你想保留的细节。重申这些约束,逐步检查结果——若某区域必须像素级不变,应将审核通过的编辑合成回原图,而非只靠提示词。
参数不是提示词
指南一句话点明:API 参数应与提示词分开设置。 在句子里说“生成 4K”只是建议,设置 size 才有保证。
| 参数 | GPT Image 2.5 设置 |
|---|---|
model | gpt-image-2.5-flare 或 gpt-image-2.5-sunburst |
quality | auto(默认)、low、medium、high、xhigh、max |
size | auto 或自定义分辨率——常用如 1024x1024、1536x1024、1024x1536、2048x2048、3840x2160、2160x3840 |
background | auto、opaque 或 transparent |
自定义分辨率有硬性规则,指南将其列为约束而非建议:
- 每条边最大 3,840 像素。
- 两条边都需为 16 的倍数。
- 长短边比例不超过 3:1。
- 总像素数需在 655,360 到 8,294,400 之间。
超过 3,686,400 像素(即 2560×1440 以上)为实验性,需额外检查后再上线。
质量梯度有其逻辑,并非“越高越保险”:
- 从输出失败处起步。 小字模糊或图表标签塌陷时再升一级。
- 达标后降级测试。 结果满足需求后,尝试降低设置,看能否保持质量并缩短延迟。
- 仅在满足需求且延迟可控时用
xhigh或max。
高设置不保证每个提示词都出更好图片。
透明度有专门警告,也是团队最易出错的地方。必须同时做两件事:请求独立主体 且 设置 background="transparent",格式为 PNG 或 WebP。画出的棋盘格不等于透明。然后检查解码文件的 alpha 通道——头发、玻璃、阴影和物体边缘最易出错——PNG 不要用 output_compression。

GPT Image 2.5 的 8 条提示词规则
指南的“提示词基础”有八条原则。每次怪模型前先自查一遍。
- 定义结果。 明确主体和用途——如产品照、广告、图表。指定构图、比例和摆放约束。复杂需求时,将提示词分为场景、主体、细节、约束等标注区块。
- 选用易维护格式。 简短提示、描述性段落、类 JSON 结构、指令、标签都能表达同一意图。选最易读和维护的格式,无需特殊语法。
- 描述可见细节。 明确材料、光线、色彩和媒介。需“写实”或“真实照片”时要直说。相机参数仅影响外观,不等于物理模拟——宽幅、电影感、低光、雨夜或霓虹场景应指定比例、氛围和色彩,而非只用情绪词。
- 明确人物与动作。 描述身体取景、比例、视线及与物体的互动。“全身可见,含双脚”“手自然握把手”比“动态姿势”更有效。
- 精确指定文本。 用引号标出必现文字,描述位置和字体,生僻词或品牌名需逐字拼写。加上“无额外文本”,检查输出拼写和清晰度——小字、密集或多字体时用中高质量对比。
- 区分变动与约束。 编辑时写明“仅改 X”,列出必须保留的内容:身份、结构、布局、光线、标签。也要列出排除项——多余文本、logo、水印。精确局部编辑时,还要锁定饱和度、对比度、箭头、相机角度和周边物体。
- 为参考图分配角色。 按编号和用途标明每个输入:主体、风格、服装、背景。说明如何组合,哪些元素移动,哪些保持不变。
- 有计划地迭代。 将上一步输出作为下一步输入,每次只改一项,重复需保留的细节。“同前风格”可传递上下文,但关键约束要重申,结果偏离时尤其如此——多加指令前先对比。
注意缺席内容:没有“masterpiece”,没有堆砌质量形容词,没有神秘 token。指南把提示词当作设计简报。
12 种技巧,配官方提示词
指南每个示例演示一种技巧。下方为技巧说明、核心规则和官方提示词精简版。
1. 控制风格与光线
通过主体、取景、光线和质感描述照片——并排除模型默认的美化。
生成一张写实抓拍照,内容为一位老水手站在小渔船上。
皮肤风化,皱纹、毛孔和日晒质感清晰。几处褪色的传统纹身。
如 35mm 胶片照片拍摄,中近景,视线平齐,50mm 镜头。
柔和海岸日光,浅景深,细腻胶片颗粒,自然色彩平衡。
真实自然,无美化,无重度修饰。
2. 视觉化流程说明
写明流程、受众和图片需传达的信息。图解需核查标签和事实关系,而非只看外观。
制作一张详细信息图,展示自动咖啡机的工作原理和流程。
从豆仓到研磨、秤重、水箱、锅炉等。
希望技术和视觉上都能理解流程。
3. 呈现精确文本
引用文案,说明出现次数,避免添加无关指令。
为街头服饰品牌 Thread 拍摄广告/时尚照。
一群朋友聚会,标语为“Yours to Create.”
精致广告图:时尚、现代、有活力、有品位。
标语只出现一次,清晰可读,融入版面。
无多余文字,无水印,无无关 logo。
4. 设计可复用 logo
描述品牌和标志应有的形状,保证各尺寸下清晰,提示词和 API 都要求透明。用 n 比较不同方案。
为本地烘焙坊 Field & Flour 设计原创、不侵权 logo。
温暖、简洁、耐看。干净的矢量感形状,轮廓鲜明,留白均衡。
偏简不繁,保证大尺寸和小尺寸都清晰。
扁平设计,线条极简,无需渐变除非必要。
全透明背景。logo 居中,留白充足,alpha 边缘干净,
无实底、无场景、无棋盘格、无水印。
5. 利用历史与现实语境
写明地点和日期。模型可推断语境,但仍需检查服装、布景和环境准确性。
生成 1969 年 8 月 16 日纽约贝塞尔户外人群场景。
写实,服装、布景和环境符合年代。
6. 故事转为漫画分镜
将叙事拆为清晰视觉节点,每格一项,描述具体、聚焦动作。
制作一组 4 格竖版漫画分镜。
第 1 格:主人离开前门,宠物在窗内注视。
第 2 格:门关上,宠物缓慢转身看向空房。
第 3 格:宠物摊在沙发上,阳光洒满房间。
第 4 格:门打开,宠物端坐门口。
7. 创建界面预览
像产品已存在一样描述。布局、层级、间距、真实界面元素——避免概念艺术语言,输出更像成品而非草图。
本地农贸市场的真实手机应用 UI 模型。
今日市场标题,简短摊主列表(小图和分类),
小型“今日特价”区,位置和营业时间。
实用易用。白底,淡雅自然点缀色,字体清晰,
装饰极简。将模型置于 iPhone 框架中。
8. 制作科学与教育视觉图
按教学设计简报写:受众、教学目标、格式、必备标签、科学约束。
高中生用生物图解,标题“细胞呼吸一览”。
展示葡萄糖在细胞内转化为能量:糖酵解、克雷布斯循环、电子传递链。
用箭头连接步骤,标注葡萄糖、丙酮酸、ATP、NADH、FADH2、CO2、O2、H2O。
教室讲义风格:白底、简洁图标、标签清晰、文字易读。
避免小字和多余装饰。
9. 制作幻灯片、图表与流程图
写明交付物类型,定义画布和层级,提供真实文本或数据。
一页标题为“市场机会”的路演幻灯片,风格如真实 A 轮融资 PPT。
白底,Inter 风格无衬线字体,极简清晰布局。
TAM/SAM/SOM 同心圆,柔和蓝灰色:TAM $42B,SAM $8.7B,SOM $340M。
下方柱状图展示 2021–2026 市场增长,趋势微升。
脚注:“AGI Research, 2024” 和 “Internal analysis.”
10. 分配角色并组合参考图
按用途编号每个输入,说明移动内容和保持不变的部分。
将第二张图片中的狗放入第一张图片的场景,紧挨女性。
保持相同光线、构图和背景。其他内容不变。
11. 精准编辑
写明对象和变动,保护周边内容,确保编辑局部化。
移除男子手中的花。其他内容不变。
这张房间照片,仅将白色椅子换成木椅。
保持相机角度、房间光线、地面阴影和周边物体不变。
同样模式适用于风格迁移(为参考图指定角色:色板、纹理、媒介)和抠图(隔离主体,保留结构和标签清晰度,无背景,alpha 干净)。
12. 多轮细化
先生成一版,检查后作为下一步输入——每次只改一项。
生成一张洗发水在公路广告牌上的写实模型,场景为日落时分。
广告牌文字(精确):“Fresh and clean”
粗体无衬线,高对比度,居中,字距整齐。文字只出现一次且清晰可读。
无水印,无 logo。
然后:Make it look like a winter evening with snowfall. 这就是第二轮——只变一项,其余保持。
多图角色保持一致时,指南建议用可复用角色参考,并在每个新场景重复关键描述。环境可变,角色描述不变。

指南留给你的部分
三件事始终无法自动化,指南也直说。
核查。 检查输出是否符合要求:文本准确清晰?图表标签和关系正确?身份、产品形状和标签保留?编辑只改了指定内容?需要透明时,文件是否真有 alpha 通道而非画出的背景?
质量与成本判断。 每次更换提示词或模型时,用代表性输入对比质量、延迟和成本。指南建议查当前价格,而非承诺降价。
简报本身。 格式不做规定。推荐场景/主体/细节/约束结构,因为最耐编辑,但核心原则更简单:选你能读懂、能维护的结构。
无需 API Key 也能用这些技巧
上述方法适用于原生 API——无需手动管理 size、quality、background。
Felo 的 GPT-Image 2.5 工作区 可在浏览器直接运行同一模型家族:
- 免费试用,无需 API Key,无需配置。 复制本指南任意提示词即可生成。
- 格式与分辨率预设 替代参数字符串——方形、横幅、竖幅,最高支持原生 4K。
- 两种模型同台切换。 任务需要时可在 GPT-Image 2.5 与其他主流图像模型间切换。
- 无水印,商用全权开放,免费计划同样适用。
如需更多基于同样规则的提示词,我们在实用指南中整理了 12 个可直接复制的 GPT Image 2.5 提示词。
常见问题
GPT Image 2.5 Flare 和 Sunburst 有何区别? Flare 为小型、速度优先模型,画质与 GPT Image 2 相当。Sunburst 为基础、质量优先模型,画质高于 GPT Image 2。若速度重要且质量已达标,先用 Flare;复杂、高细节或面向客户的场景用 Sunburst。
OpenAI 推荐特定提示词格式吗? 不推荐。指南称短提示、段落、类 JSON 结构、指令、标签都可用——选最易读和维护的即可。复杂需求建议分区:场景、主体、细节、约束。
为何尺寸、质量和背景要放在参数而非提示词?
因为它们是 API 参数,有保证,而提示词只是建议。“生成 4K”只是请求,size 才能实现。格式决策放在参数里,提示词可复用,输出尺寸变动时无需重写。
如何防止编辑时其他内容被改动? 写明“仅改 X”,列出需保留的内容(身份、结构、布局、光线、标签),并指明排除项如多余文本、logo、水印。若某区域必须像素级不变,应将审核通过的编辑合成回原图,而非只靠提示词。
如何让图片中文字清晰可读? 引用精确文案,说明位置和出现次数,描述字体,加上“无额外文本”。逐字检查输出,小字或密集时用中高质量设置。
用这些技巧需要 OpenAI API 吗? 不需要。技巧关乎如何写简报,与调用哪个接口无关。Felo 的 GPT-Image 2.5 工作区 可在浏览器免费运行,无需 API Key。
手册就是头条
带手册上线的模型在传递一个信号:结果取决于你的简报,而非找到“神奇咒语”。
为任务选对模型。把设置写进参数。写明场景、主体、细节和约束。每次只改一项,检查返回结果。
这就是整份指南——也是输出不再靠运气的原因。
本文还提供以下语言版本:English、日本語、한국어、繁體中文、हिन्दी、Français、العربية、Русский、اردو、Bahasa Indonesia、Deutsch、Tiếng Việt、Türkçe、Italiano、ไทย、Español、বাংলা、Português。