文生图(Text-to-Image)

文生图(T2I)是一种把文字提示词直接生成完整图片的 AI 技术。了解它的原理、擅长的场景,以及如何写出有效的提示词。

打开完整生成器

看它怎么工作

一条真实提示词和它在 Molyin 上生成的结果。点 Remix 从这里起步。

Nano Banana 2 official sample — glossy magazine cover with bold Nano Banana serif title and a model playfully holding the number 2, crisp photoreal typography
  • Nano Banana 2
  • Text to image
  • 3:2
  • 2K

一张光面杂志封面的照片,极简的蓝色封面上印着加大加粗的 Nano Banana 字样。文字用衬线字体,撑满整个画面。没有其他文字。文字前方是一位人物肖像,穿着简洁利落的极简连衣裙。她俏皮地举着数字 2,这是整个画面的焦点。 在角落放上期号和 "Feb 2026" 日期,再配一个条形码。杂志摆在货架上,背景是一面橙色抹灰墙,场景是一家设计师买手店。

**文生图(Text-to-Image,简称 T2I)**是一种生成式 AI 技术:你用文字描述一幅画面,模型把它"画"出来——构图、光影、风格、细节,全部从你的文字生成。你负责描述,模型负责作画。

工作原理

主流的文生图模型底层是扩散模型(Diffusion Model),在海量"图片 + 文字描述"配对数据上训练而成。生成时,模型从纯噪声出发,在提示词的引导下逐步"去噪"成一张完整图片。新一代模型在扩散核心之上加入了语言模型前端,能把提示词当作指令而非关键词堆来理解——空间关系("杯子在书上面")、物体数量、甚至图片内的文字,准确率都大幅提升。

擅长的场景

当你只有文字、需要一张图时,文生图最能发挥价值:

  • 概念图与情绪板 —— 在确定方向之前,快速探索风格、配色与构图。
  • 营销视觉 —— 头图、封面、横幅、社交配图,任意比例,无需摄影棚。
  • 批量插画 —— 锁定风格描述、只换主体,就能产出风格统一的系列插画。

好的提示词包含什么

强大的 T2I 提示词读起来像美术指导的需求单。覆盖四个要素:主体(画面里有什么)、构图(取景、视角、焦点)、风格(媒介、参考画风、渲染方式)、光线与氛围(黄昏逆光、霓虹夜色、柔和棚拍光)。具体永远胜过笼统:"亚麻桌布上的陶瓷茶壶,俯拍,柔和窗光,极简产品摄影"远好于"一个好看的茶壶"。

关于文生图(Text-to-Image)的常见问题

可以免费生成图片吗?

可以。注册赠送的积分够在最实惠的模型上先出几张图,单价最低 3 积分/张,生成前会显示价格。

支持哪些分辨率和比例?

最高 4K,视模型而定;比例从超宽到竖版都有,部分模型支持透明背景输出。生成器只显示所选模型真正支持的选项。

再往下走

什么是文生图(Text-to-Image)? | Molyin