Text zu Bild (T2I) ist eine generative KI-Technik, die eine geschriebene Beschreibung — einen Prompt — in ein fertiges Bild verwandelt: Komposition, Licht, Stil und Details, alles aus deinen Worten gerendert. Du beschreibst das Bild; das Modell malt es.
So funktioniert es
Moderne Text-zu-Bild-Modelle sind Diffusionsmodelle, trainiert auf riesigen Bibliotheken aus Bildern mit passenden Beschreibungen. Die Generierung startet mit reinem Rauschen, das das Modell Schritt für Schritt zu einem Bild „entrauscht“ — bei jedem Schritt von deinem Prompt gesteuert. Die neueste Generation kombiniert den Diffusionskern mit einem Sprachmodell-Frontend, das deinen Prompt als Anweisungen liest statt als lose Keyword-Sammlung — räumliche Beziehungen („die Tasse auf dem Buch“), Objektanzahlen und sogar lesbarer Text im Bild gelingen dadurch deutlich häufiger.
Was es am besten kann
Text zu Bild glänzt, wenn du ein Visual brauchst und nichts als Worte hast:
-
Concept Art und Moodboards — erkunde Stile, Farbpaletten und Kompositionen, bevor du dich auf eine Richtung festlegst.
-
Marketing-Visuals — Hero-Images, Thumbnails, Banner und Social Graphics in jedem Seitenverhältnis, ganz ohne Fotoshooting.
-
Illustration in Serie — generiere eine konsistente Reihe, indem du deine Stilbeschreibung fixierst und nur das Subjekt variierst.
Was ein guter Prompt enthält
Ein starker T2I-Prompt liest sich wie das Briefing eines Art Directors. Deck vier Dinge ab: das Subjekt (was im Frame ist), die Komposition (Framing, Perspektive, Fokuspunkt), den Stil (Medium, Künstlerreferenz, Rendering-Technik) sowie Licht und Stimmung (Golden Hour, Neon-Noir, weiches Studiolicht). Spezifisch schlägt vage: „eine Keramik-Teekanne auf einem Leinentuch, Aufnahme von oben, weiches Fensterlicht, minimalistische Produktfotografie“ gewinnt jedes Mal gegen „eine schöne Teekanne“.
Text zu Bild auf Molyin
Molyins Bildgenerator betreibt GPT Image 2 und die Nano-Banana-Familie (2 Lite, 2 und Pro) im Text-zu-Bild-Modus — mit Auflösungen bis 4K, Seitenverhältnissen von 21:9 Ultrawide bis 9:16 Hochformat (auf Nano Banana 2 sogar 8:1-Bannerformate) und Output mit transparentem Hintergrund für Design-Workflows.
Verwandte Begriffe
-
Bild zu Bild — transformiere ein vorhandenes Bild, statt nur von Worten zu starten.
-
Text zu Video — dieselbe Idee, erweitert in Bewegung.
Probier es selbst mit dem KI-Bild-Generator.