テキスト画像生成(Text-to-Image)

テキスト画像生成(T2I)は、文章のプロンプトから完成した画像を直接生成するAI技術です。仕組み、得意分野、効果的なプロンプトの書き方を解説します。

ジェネレーターを開く

実際の動作を見る

実際のプロンプトと、Molyin で生成された結果です。Remix を押せばここから始められます。

Nano Banana 2 official sample — glossy magazine cover with bold Nano Banana serif title and a model playfully holding the number 2, crisp photoreal typography
  • Nano Banana 2
  • Text to image
  • 3:2
  • 2K

光沢のある雑誌の表紙の写真。ミニマルなブルーの表紙には、大きく太い Nano Banana の文字。文字はセリフ体で、画面いっぱいに広がっている。他の文字は入れない。文字の手前には、洗練されたミニマルなドレスをまとった人物のポートレート。彼女は遊び心たっぷりに数字の 2 を抱えていて、それが画面の焦点になっている。 隅には号数と "Feb 2026" の日付、そしてバーコードを入れること。雑誌はデザイナーズショップの中、オレンジの漆喰壁を背にした棚に置かれている。

**テキスト画像生成(Text-to-Image、略してT2I)**は、文章による描写──プロンプト──を完成した画像に変換する生成AI技術です。構図・光・スタイル・ディテールのすべてが、あなたの言葉からレンダリングされます。あなたが描写し、モデルが描きます。

仕組み

主流のテキスト画像生成モデルは、膨大な「画像+キャプション」のペアデータで学習された拡散モデル(Diffusion Model)です。生成は純粋なノイズから始まり、プロンプトに導かれながら段階的に「デノイズ」されて一枚の画像になります。最新世代は拡散コアに言語モデルのフロントエンドを組み合わせ、プロンプトをキーワードの羅列ではなく指示として読み取ります。空間関係(「本の上にあるカップ」)、物体の数、画像内の文字まで、正確に再現できる場面が大きく増えました。

得意な場面

手元に言葉しかないとき、テキスト画像生成は最も力を発揮します。

  • コンセプトアートとムードボード —— 方向性を決める前に、スタイル・配色・構図を素早く探索する。
  • マーケティングビジュアル —— ヒーロー画像、サムネイル、バナー、SNS用画像を任意の比率で。撮影は不要です。
  • イラストの量産 —— スタイル描写を固定し被写体だけを変えれば、統一感のあるシリーズが作れます。

良いプロンプトの構成要素

優れたT2Iプロンプトは、アートディレクターの発注書のように読めます。被写体(フレームに何があるか)、構図(フレーミング・視点・焦点)、スタイル(画材・参照画風・レンダリング技法)、光と雰囲気(ゴールデンアワー、ネオンノワール、柔らかいスタジオ光)の4要素を押さえましょう。具体は常に曖昧に勝ちます。「リネンのクロスに置かれた陶器のティーポット、俯瞰、柔らかい窓光、ミニマルなプロダクト写真」は「素敵なティーポット」より必ず良い結果を生みます。

テキスト画像生成(Text-to-Image)についてよくある質問

画像を無料で生成できますか?

できます。登録時のクレジットで、最も手頃なモデルなら最初の数枚を生成できます。1 枚 3 クレジットから、料金は生成前に表示されます。

対応する解像度とアスペクト比は?

モデルによって最大 4K。アスペクト比はウルトラワイドから縦型まで、一部モデルは透過出力にも対応します。ジェネレーターには選択中モデルが実際に対応する選択肢だけが表示されます。

さらに深く

テキスト画像生成(Text-to-Image)とは? | Molyin