OpenAIのGPT Image 2.5プロンプトガイド徹底解説
OpenAIはGPT Image 2.5向けのプロンプトガイドをひっそりと公開した。内容を解説する:モデル選択、パラメータ管理、8つのルール、12のテクニック。
多くのプロンプトのアドバイスは伝説のようなものだ。誰かが一度うまくいったフレーズを見つけて投稿し、「cinematic lighting, 8k, masterpiece」がエンジニアリングとして扱われる。
OpenAI公式のGPT Image 2.5プロンプトガイドはそれとは異なる。仕様書のような内容だ:適切なモデルを選び、設定を文章から分離し、デザイナーのように画像を設計し、一度に一つだけ変更する。魔法の言葉は存在しない——それこそが最も役立つ点だ。
ガイド全体を解説する:2モデル構成、6ステップの移行手順、多くの人が破るパラメータのルール、そして8つのルールと12のテクニックを両モデルの出力比較で示している。

OpenAIが実際に公開したもの
ガイドはAPIドキュメント内のImage promptingにあり、画像ファミリーに初めて書面のマニュアルが付属した。
順番に4つの問いに答えている:
- どのモデルを使うべきか?
- 既存のワークフローを品質を損なわずに移行するには?
- どの設定をプロンプトではなくAPIコールで指定するべきか?
- 良いプロンプトには何が含まれるか?
その他はすべて例だ——20以上あり、GPT Image 2.5 FlareとGPT Image 2.5 Sunburst両方でレンダリングされているので、同じ入力で両モデルを比較できる。
ドキュメント全体を支える一文:
必要な画像から始め、被写体、構図、スタイル、制約を記述する。編集の場合、変更点と維持すべき点を特定する。一度に一つだけ修正し、結果を確認する。
ガイドの要点はこの三文だ。残りは詳細——だが詳細こそが出力品質を左右する。
FlareとSunburst:まずアーキテクチャの選択
GPT Image 2.5は一つのモデルではない。二つあり、ガイドは選択を好みではなくワークフローの決定として扱う。
| Model | What it is | What it is for |
|---|---|---|
gpt-image-2.5-flare | 小型モデル、速度重視 | GPT Image 2と同等の画像品質、低遅延 |
gpt-image-2.5-sunburst | 基本モデル、品質重視 | GPT Image 2より高品質、画像ごとに遅延が大きい |
ガイドの決定表は率直だ。既存のGPT Image 2ワークフローが品質基準を満たしているなら、まずFlareを試し、品質を維持しつつ遅延を減らせるか確認する。GPT Image 2で不足する複雑なケースなら、Sunburstから始め、基準を満たすか確認する。
重要なニュアンス:Sunburstが基準を満たしたら、同じプロンプト、同じ参照、同じサイズでFlareをテストする。品質が維持されて遅延が改善した場合のみ切り替える。そうでなければSunburstを使い続ける。
このセクションの二つのルールは見落としやすく、無視すると高くつく:
- 同じ品質ラベルでもモデル間で画像品質は異なる。 Flareの
quality="high"とSunburstのquality="high"は同じ画像にならない。 - 速度向上はワークロードごとに異なる。 ガイドは明確に、あるワークロードでの改善が他のワークロードには当てはまらないと警告している。プロンプト、参照、出力サイズ、品質設定がすべて数値を変動させる。
両モデルとも生成・編集・透過背景に対応しているので、選択は品質と遅延のトレードオフ——機能の違いではない。
6ステップ移行手順
この部分は派手さはないが実用的だ。GPT Image 2を本番で置き換えるチーム向けに書かれているが、一人で新モデルを試す場合にも使える。
- ベースラインを保存する。 代表的なプロンプトと参照画像を集める——難しい編集、正確なテキスト、顔、製品形状、透過素材も含める。モデル、設定、結果を記録する。
- 最初の候補を選ぶ。 GPT Image 2ワークフローが検証済みならFlareから。GPT Image 2で不足する複雑なケースならSunburstから。最初の比較ではプロンプト、参照、サイズ、形式を変更しない。
- 結果全体を確認する。 指示通りの動作、アイデンティティや製品の維持、テキストの正確さ、不要な変更、透過性を比較する。リクエストを繰り返して一貫性を測り、編集ワークフローでは編集の全工程をテストする。
- 品質が通った後で遅延改善をテストする。 その時点でFlareを同じ要件で比較する。
- 一度に一つだけ設定を調整する。 プロンプトを書き換える前に品質レベルを比較する。通常と遅いレスポンス、失敗、再試行、受理画像ごとのコストを測る。ガイドは「速いモデルが安いとは限らない」と明記しているので、現行価格を必ず確認する。
- ワークフローごとに段階的に移行する。 少量のトラフィックを移し、同じ指標を監視し、徐々に拡大し、前のモデルをロールバック用に残す。
また、すべての本番チェックリストに必要な正直な指摘もある:繰り返し編集すると維持したい細部が変わることがある。制約を再記述し、各結果を確認する——領域をピクセル単位で維持する必要がある場合は、承認済み編集を元画像に合成する。
パラメータは文章ではない
ガイドは一行で明言する:APIパラメータはプロンプトと分けて設定する。 「4Kにして」と文章で伝えても提案に過ぎない。sizeを設定すれば保証される。
| Parameter | GPT Image 2.5 settings |
|---|---|
model | gpt-image-2.5-flare または gpt-image-2.5-sunburst |
quality | auto(デフォルト)、low、medium、high、xhigh、max |
size | autoまたはカスタム解像度——よく使われるサイズ:1024x1024, 1536x1024, 1024x1536, 2048x2048, 3840x2160, 2160x3840 |
background | auto, opaque, transparent |
カスタム解像度には厳格なルールがあり、ガイドはヒントではなく制約として列挙している:
- 各辺は最大3,840ピクセルまで。
- 両辺とも16ピクセル単位。
- 長辺と短辺の比率は最大3:1。
- 総ピクセル数は655,360〜8,294,400。
3,686,400ピクセル(2560×1440)を超えると実験的扱いなので、出荷前に確認する。
品質階層には独自の論理があり、「高いほど安全」ではない:
- 出力が失敗するところから始める。 小さい文字が潰れる、図のラベルが崩れる場合は階層を上げる。
- 要件を満たしたら階層を下げる。 結果が要件を満たしたら、低い設定で品質と遅延を比較する。
xhighやmaxは未達要件を解決する場合のみ使う。 遅延予算内で。
高い設定でもすべてのプロンプトで良い画像になるとは限らない。
透過については特別な警告があり、多くのチームが間違える。二つとも必要だ:被写体を単独で指定し、background="transparent"をPNGまたはWebPで設定する。描かれたチェッカーボードは透過ではない。デコードしたファイルのアルファチャンネルを確認する——髪、ガラス、影、物体の端で破綻しやすい——PNGにはoutput_compressionを適用しない。

GPT Image 2.5の8つのプロンプトルール
ガイドの「プロンプトの基本」は8つの原則。モデルを責める前にチェックリストとして読む。
- 結果を定義する。 被写体と用途を明示する——商品写真、広告、図など。構図、アスペクト比、配置制約を指定する。複雑なリクエストの場合、プロンプトを「シーン」「被写体」「詳細」「制約」などラベル付きセクションに分ける。
- 保守しやすい形式を選ぶ。 短いプロンプト、説明的な段落、JSON風構造、指示、タグはすべて同じ意図を表現できる。読みやすく更新しやすい形式を選ぶ。特別な構文は不要。
- 見える詳細を記述する。 材質、照明、色、媒体を明示する。目標が「フォトリアル」や「実写」の場合は明確に指定する。カメラ仕様は見た目の手がかりであり物理シミュレーションではない——広角、映画風、暗所、雨、ネオンなどはスケール、雰囲気、色を指定し、ムードワードに頼らない。
- 人物と動作を指定する。 体のフレーミング、相対的な大きさ、視線、物体との関わりを記述する。「全身が見える、足も含む」「手が自然にハンドルを握る」などは「ダイナミックなポーズ」より具体的。
- 正確なテキストを指定する。 必要な文言を引用符で囲み、位置や書体を記述し、特殊な単語やブランド名は一文字ずつ綴る。余計なテキスト禁止と明記し、出力のスペルと判読性を確認する——小さい・密集・複数フォントの場合は中品質や高品質で比較する。
- 変更点と制約を分離する。 編集の場合「Xだけ変更」と述べ、維持すべきもの(アイデンティティ、形状、レイアウト、照明、ラベル)を列挙する。除外項目も明示——不要なテキスト、ロゴ、ウォーターマーク。局所編集では彩度、コントラスト、矢印、カメラアングル、周囲の物体も固定する。
- 参照に役割を割り当てる。 各入力を番号と目的で識別:被写体、スタイル、服装、背景。組み合わせ方と移動する要素を説明する。
- 意図的に反復する。 前回出力を次回入力として渡し、一つだけ変更し、維持すべき詳細を繰り返す。「前回と同じスタイル」は文脈を引き継げるが、結果が逸脱したら重要な制約を再記述する——指示を増やす前に比較する。
注目すべきは欠落しているもの:「masterpiece」や品質形容詞の羅列、魔法のトークンはない。ガイドはプロンプトをブリーフィングとして扱う。
12のテクニック——公式プロンプト付き
ガイドの各例は一つのテクニックを示す。以下はテクニック、ルールの要約、公式プロンプトの抜粋。
1. スタイルと照明を制御する
被写体、フレーミング、光、質感で写真を記述し、モデルが加えるレタッチを除外する。
Create a photorealistic candid photograph of an elderly sailor standing on a small fishing boat.
Weathered skin with visible wrinkles, pores, and sun texture. A few faded traditional tattoos.
Shot like a 35mm film photograph, medium close-up at eye level, 50mm lens.
Soft coastal daylight, shallow depth of field, subtle film grain, natural color balance.
Honest and unposed. No glamorization, no heavy retouching.
2. プロセスを視覚化する
プロセス名、対象者、画像が伝えるべき情報を記述する。図の場合、ラベルと事実関係を見た目だけでなく検証する。
Create a detailed infographic of the functioning and flow of an automatic coffee machine.
From bean basket to grinding, scale, water tank, boiler, and so on.
I want to understand the flow technically and visually.
3. 正確なテキストを描画する
コピーを引用し、出現回数を明示し、無関係な指示を追加しない。
Ad / fashion shot for a young streetwear brand called Thread.
A group of friends hanging out, tagline "Yours to Create."
Polished campaign image: stylish, contemporary, energetic, tasteful.
Render the tagline exactly once, clearly and legibly, integrated into the layout.
No extra text, no watermarks, no unrelated logos.
4. 再利用可能なロゴを設計する
ブランドとマークを定義する形状を記述し、どのサイズでも判読できる構成を維持し、プロンプトとAPI両方で透過を要求する。nでバリエーションを比較する。
Original, non-infringing logo for a local bakery called Field & Flour.
Warm, simple, timeless. Clean vector-like shapes, strong silhouette, balanced negative space.
Simpler rather than detailed, so it reads at small and large sizes.
Flat design, minimal strokes, no gradients unless essential.
Fully transparent background. One centered logo, generous padding, clean alpha edges,
no solid backdrop, scenery, checkerboard, or watermark.
5. 歴史的・現実的な文脈を使う
場所と日付を明示する。モデルは文脈を推測するが、服装、演出、周囲の正確さを必ず確認する。
Create a realistic outdoor crowd scene in Bethel, New York on August 16, 1969.
Photorealistic, period-accurate clothing, staging, and environment.
6. ストーリーをコミックにする
物語を明確な視覚的ビートの連続として定義し、各パネルごとに具体的な描写と動作を記述する。
Create a short vertical comic-style reel with 4 panels.
Panel 1: The owner leaves through the front door; the pet is framed in the window behind them.
Panel 2: The door clicks shut; the pet slowly turns toward the empty house.
Panel 3: The pet sprawls across the couch like it owns the place, sunlight across the room.
Panel 4: The door opens; the pet is seated perfectly by the entrance.
7. インターフェースのプレビューを作る
製品を既に存在するものとして記述する。レイアウト、階層、間隔、実際のUI要素を記述し、コンセプトアート的な言葉を避けて完成品らしい見た目にする。
Realistic mobile app UI mockup for a local farmers market.
Today's market header, a short list of vendors with small photos and categories,
a small "Today's specials" section, location and hours.
Practical and easy to use. White background, subtle natural accent colors, clear typography,
minimal decoration. Place the mockup in an iPhone frame.
8. 科学・教育用ビジュアルを作る
インストラクショナルデザインのブリーフのように書く:対象者、学習目標、形式、必要なラベル、科学的制約。
Biology diagram titled "Cellular Respiration at a Glance" for high school students.
Show glucose turning into energy inside a cell: glycolysis, the Krebs cycle, the electron
transport chain. Arrows connect the steps; label glucose, pyruvate, ATP, NADH, FADH2, CO2, O2, H2O.
Clean classroom handout: white background, simple icons, clear labels, readable text.
Avoid tiny text and extra decoration.
9. スライド・図・チャートを作る
イラスト依頼ではなく成果物仕様を書く:納品物名、キャンバスと階層を定義し、実際のテキストやデータを提供する。
One pitch-deck slide titled "Market Opportunity," like a real Series A slide.
White background, Inter-style sans-serif, crisp minimal layout.
TAM/SAM/SOM concentric circles in muted blues and grays: TAM $42B, SAM $8.7B, SOM $340M.
Bar chart below showing market growth 2021–2026 with a subtle upward trend.
Footnotes: "AGI Research, 2024" and "Internal analysis."
10. 役割を割り当て参照を組み合わせる
各入力を目的ごとに番号付けし、何をどこに移動し、何を変更しないか明示する。
Place the dog from the second image into the setting of image 1, right next to the woman.
Use the same lighting, composition, and background. Do not change anything else.
11. 精密な編集を行う
対象物、変更点、周囲の保護を明示し、編集範囲を限定する。
Remove the flower from the man's hand. Do not change anything else.
In this room photo, replace ONLY the white chairs with chairs made of wood.
Preserve camera angle, room lighting, floor shadows, and surrounding objects.
同じパターンでスタイル転送(参照に役割:パレット、質感、媒体)や切り抜き(被写体を単独化、形状とラベル判読性維持、背景追加なし、アルファを清潔に)も対応できる。
12. ターンごとに精査・修正する
一つ出力を得て確認し、次の入力として使い、一度に一つだけ変更する。
Create a realistic billboard mockup of the shampoo on a highway scene during sunset.
Billboard text (EXACT): "Fresh and clean"
Bold sans-serif, high contrast, centered, clean kerning. Text appears once and is legible.
No watermarks, no logos.
次に:Make it look like a winter evening with snowfall. これが二回目のターン——一つ条件だけ変更し、他は維持する。
複数画像でキャラクターを扱う場合、ガイドの方法は再利用可能なキャラクター参照+各新シーンで定義詳細を繰り返す。環境は変わるがキャラクターの記述は変わらない。

ガイドがあなたに委ねるもの
三つのことは自動化されず、ガイドも明言している。
検証。 出力が要件を満たしているか確認する:必要なテキストが正確で判読できるか?図のラベルと関係が正しいか?アイデンティティ、製品形状、ラベルが維持されたか?編集が指定した部分だけ変わったか?透過が必要なら、ファイルに実際にアルファチャンネルがあるか(背景が描画されていないか)?
品質とコストの判断。 プロンプトやモデルを変更するたび、代表的な入力で品質、遅延、コストを比較する。ガイドは割引を約束せず現行価格を指示する。
ブリーフ自体。 形式は指定されていない。Scene / subject / details / constraintsが編集に強いと推奨されているが、ルールはもっと単純だ:読みやすく更新しやすい構造を選ぶ。
APIキーなしでテクニックを試す
上記はすべて生APIで使える——size, quality, backgroundを手動管理する必要はない。
FeloのGPT-Image 2.5ワークスペースは同じモデルファミリーをブラウザで動かせる:
- 無料で開始、APIキー不要、セットアップ不要。 ガイドの任意のプロンプトを貼り付けて生成できる。
- 形式と解像度プリセット(パラメータ文字列不要)——正方形、横長、縦長、最大ネイティブ4Kまで。
- 両モデルを一つの場所で。 GPT-Image 2.5と他の主要画像モデルを切り替え、用途ごとに最適な強みを選べる。
- ウォーターマークなし、商用利用権あり(無料プランも対象)。
同じルールで作成したプロンプトをもっと知りたい場合、12個のコピペ可能なGPT Image 2.5プロンプトを実用ガイドにまとめている。
FAQ
GPT Image 2.5 FlareとSunburstの違いは? Flareは小型・速度重視で、GPT Image 2と同等の品質。Sunburstは基本・品質重視で、GPT Image 2より高品質。速度重視かつ品質基準を満たしているならFlareから、複雑・高詳細・対顧客用途ならSunburstから始める。
OpenAIは特定のプロンプト形式を推奨している? いいえ。ガイドは短いプロンプト、段落、JSON風構造、指示、タグのどれでも機能すると述べている——読みやすく更新しやすいものを選ぶ。複雑なリクエストには「シーン」「被写体」「詳細」「制約」などラベル付きセクションを推奨。
なぜサイズ・品質・背景をプロンプトに書かない方が良い?
APIパラメータは保証されるが、文章は提案に過ぎない。「4Kにして」はお願い、sizeは確約。パラメータで形式を決めれば、出力サイズを変えてもプロンプトを再利用できる。
編集が他の部分まで変わるのを防ぐには? 「Xだけ変更」と述べ、維持すべきもの(アイデンティティ、形状、レイアウト、照明、ラベル)を列挙し、除外項目(余計なテキスト、ロゴ、ウォーターマーク)も明示する。領域をピクセル単位で維持する必要がある場合、承認済み編集を元画像に合成する。
画像内のテキストを判読可能にするには? 正確なコピーを引用し、位置と出現回数を明示し、書体を記述し、「余計なテキストなし」と加える。出力の全単語を確認し、小さい・密集した場合は中品質や高品質を使う。
これらのテクニックにOpenAI APIは必要? 不要。テクニックはブリーフの書き方であり、エンドポイントの選択ではない。FeloのGPT-Image 2.5ワークスペースはAPIキー不要で無料利用できる。
マニュアルこそが主役
マニュアル付きで出荷されるモデルはこう伝えている:結果はブリーフ次第であり、呪文探しではない。
用途に合ったモデルを選ぶ。設定はパラメータで管理する。シーン、被写体、詳細、制約を書く。一度に一つだけ変更し、戻ってきた結果を確認する。
それがガイドの全て——出力が運任せでなくなる理由だ。
この記事は次の言語でもお読みいただけます:English、简体中文、한국어、繁體中文、हिन्दी、Français、العربية、Русский、اردو、Bahasa Indonesia、Deutsch、Tiếng Việt、Türkçe、Italiano、ไทย、Español、বাংলা、Português。