AI 文生视频

写下你想看到的画面,拿到一条成片视频——不用素材,不用照片,不用剪辑。Seedance 2.5、Kling 3.0、MiniMax H3、HappyHorse、Wan、LTX、Veo 与 FLUX 3 把一段提示词变成带原生音频的电影感短片,最长 30 秒、最高 4K。

  • 生成失败自动退积分
  • 积分包永不过期
  • 每个模型明码标价
  • 一键取消订阅
14 个
文生视频模型
30 秒
时长最长
4K
最高输出
6 积分/秒
起步价

文生视频样片与完整提示词

每条样片都附有生成它的完整提示词。点任意一条样片的 Remix,提示词与模型设置会载入创作台——改写成你的画面描述,即可生成自己的版本。

  • Seedance 2.5
  • Text to video
  • 8s
  • 720P

写实自然纪录片风格,电影级真实光影,温暖的午后, 在森林草坡上, 一只圆滚滚的熊猫幼崽从坡上滚下来. 熊猫黑白毛发蓬松真实,体型小而胖,动作笨拙可爱。场景为绿色森林斜坡,地面覆盖青草、苔藓、三叶草、泥土、小石块、枯枝和少量小黄花,虚化背景中有高大树干与树林。镜头为低机位中远景,轻微手持感,整体基本固定,始终保持熊猫在画面中。 0s-3s:一只熊猫幼崽趴在绿色草坡上,身体圆滚滚, 它刚开始顺着斜坡慢慢侧滚,动作笨拙,草叶被身体轻轻压弯。微风拂过, 阳光从左上方穿过树林,形成斑驳光影。 3s-8s:熊猫滚到画面右下方,动作逐渐停止,从侧躺变成趴卧。它的圆脸朝向镜头,前爪压在草地上,熊猫趴在前景草丛中,身体调整到舒服的姿势,头部小幅抬起又放低, 发出轻微哼唧声。 低机位,轻微手持感,轻微跟随熊猫向右下方移动。景深自然,前景草叶轻微虚化,熊猫主体清晰,背景树林柔和虚化。自然环境音,风声、熊猫滚动时轻微柔软的扑通声, 整体温暖、真实、自然。

  • Wan 3.0
  • Text to video
  • 30s
  • 720P

这是一段30秒电影级高强度单镜头(One-Take)视觉奇观短片,整体风格定位为“西海岸街头幻想主义”,视觉语言融合了90年代街头滑板录像的粗粝感与现代商业大片的精致质感。画面整体采用极致的“加州阳光”电影级调色,高饱和度的蓝色天空与阳光直射下的棕榈树影子形成强烈的对比,空气中弥漫着柏油马路的炙热感、购物车轮摩擦的金属声以及一种无所畏惧的青春叛逆气息。空间透视随着主角的极速滑行不断被拉长,镜头通过极低角度的跟随与极高动态的物理穿梭营造强烈的视觉冲力。 主角是一位穿着撞色条纹衫、带着黑色棒球帽的潮酷少年,神情从最初的慵懒松弛瞬间切换为冲破极限的亢奋;第二个场景的主角则是同一个少年,但他以一种“审视者”的姿态出现在现实维度。 第一个镜头 0-6s: 起幅为特写镜头,少年慵懒地躺在一辆红色铁质购物车内,背景是加州标志性的笔直大道与高耸入云的棕榈树。随着音乐节奏爆发,摄影机执行一个极速的向后拉远并下沉至地面,以极低角度紧贴车轮。少年开始在陡峭的公路上俯冲,购物车在路面上剧烈颠簸,两侧的汽车急速倒退,镜头捕捉到一种近乎疯狂的加速感。 第二个镜头 7-15s: 不切镜,摄影机像一个滑板手般紧紧贴地跟随,镜头在少年越过一个简易木质斜坡的瞬间,顺势执行一个优美的抛物线拉升。购物车腾空而起,摄影机从购物车底部穿过。此时,前方的巨型商业广告牌迅速占据整个视野,镜头以一种不可思议的“准心式”推进,直指广告牌中心。 第三个镜头 16-24s: 不切镜,少年连同购物车以一种“破裂次元壁”的方式直接嵌入了巨大的广告牌中。原本三维的身体在接触海报的瞬间发生“扁平化”质变,画面中出现真实的纸张撕裂纹理与彩色故障墨迹。少年保持着滑行的姿态,却化为了广告牌上的一幅平面艺术作品。摄影机在此时执行一个180度的水平环绕,并在高空进行一个俯冲降落,重回地面。 第四个镜头 25-30s: 不切镜,镜头平滑降落至广告牌正下方的街道,画面中出现另一个“真实”的少年。他停下脚步,缓缓压低帽檐,带着一丝玩味的微笑抬头望向广告牌上那个“被定格”的自己。摄影机顺着他的视线执行一个快速的变焦推近,最终定格在广告牌上“WAN”字样旁那个被撕裂的洞口。背景音乐融合了高能的嘻哈节奏与胶片卷动的物理声,视觉信息高度凝练且充满时尚反叛力。

  • HappyHorse 1.1
  • Text to video
  • 10s
  • 1080P

现代演播室里,一位职业新闻主播端坐于流线型主播台后的中景镜头,冷蓝色打光,身后屏幕柔和发光。0-5 秒:他直视镜头,以清晰而沉稳的声音说道:"Good evening. Tonight, a breakthrough that could change how millions of us work." 5-10 秒:他微微转向第二台摄像机:"We'll have the full story, and what it means for you, right after this." 精准口型同步,细微的演播室环境底噪,清晰的广播级画质,浅景深。

  • MiniMax H3
  • Text to video
  • 15s
  • 2K

生成一段15秒、16:9宽银幕的轻悬疑犯罪片开场序列。整体风格参考以下概念的视觉语言:复古日式动画片头、硬边剪影、漫画风拼贴、不对称分屏、强烈的几何色块、英文片头字幕、少量作装饰的日文片假名,以及爵士犯罪氛围。氛围为六成悬疑、四成爵士:神秘、冷峻、灵动,带都市犯罪感——既不恐怖也不沉重,更绝不是欢快的爵士 MV。开场的动态效果要像动态图形拼贴:先出现黑色线框,分屏边框快速绘出,色块与画框逐块贴入;角色剪影、道具特写与英文片头字幕随鼓点滑入、弹出或经遮罩显现。避免写实的叙事动画——要有片头序列的精致感。英文字幕必须清晰可读,允许动画效果:细线框先绘出,名字滑入框内,字母逐个出现并由移动色块揭示,最后短暂停顿。不要添加中文文字,避免乱码,确保英文人名无拼写错误。序列规则:每条英文字幕与头衔只出现一次。不要重复相同头衔,不要重复相同名字,不要给同一个人分配多个职务。转场必须多样:黑胶唱片圆形遮罩、车门竖切、角色影子作划像、红线切割、大号英文字母遮罩、分屏边框重组、硬几何色块切换,以及逐帧拼贴显现。所有转场都与鼓点同步——精准、悬疑、灵动,带漫画拼贴气质。避免柔和叠化与流体转场。BGM:创作一段原创 BGM。

  • FLUX 3
  • Text to video
  • 15s
  • 720P

黏土定格动画故事:一个男人总是被一只闯进画面的巨大手掌压扁,压得他没法正常生活

什么是 AI 文生视频?

AI 文生视频只靠一段文字描述就能生成视频。你打出主体、动作、场景、运镜和声音,模型凭这些文字创造出每一帧——大多数模型还会同时生成音轨。全程不用拍摄、不用上传素材、不用剪辑。文生视频词条讲解这个术语本身,这个页面是你动手生成一条的地方。

Molyin 把每个主流文生视频模型都接进了同一个创作台,你写一次提示词,换哪个模型来渲染都行。Seedance 2.5 与 Wan 3.0 能把一句话拉伸成 30 秒的长序列;Kling 3.0 能撑住一个最高 4K 的电影感镜头,带对白与对口型;HappyHorse 擅长口型精准的说话人像;MiniMax H3 在 2K 分辨率下做风格化运动设计与清晰的屏幕字体;LTX 2.5 能跑最长 20 秒、多个角色对话的剧本场景;Veo 3.1 与 FLUX 3 补齐了这份阵容。每一个都在生成画面的同一次渲染里生成声音。

文生视频是AI 视频生成器四种模式之一:图生视频、参考生视频与视频编辑共用同一个提示词输入框和积分余额,想从一张特定图片开始时切换模式就行,不用换工具。每条视频按秒计费,生成失败自动退还积分,定价页上的每个付费方案都包含商业使用权。

写哪种提示词,配哪个模型

Molyin 上的每个文生视频模型,单靠文字各自最擅长什么。先按你要写的镜头类型来选,再看时长和分辨率。

模型最擅长时长输出
Seedance 2.5单条提示词就能拍出照片级真实运动与多镜头叙事,最长 30 秒序列4–30 秒480P / 720P / 1080P,带音频
Seedance 2.0 (Standard / Fast / Mini)同一套提示词公式分三档——Standard 冲到 4K,Fast 与 Mini 用分辨率换速度4–15 秒Standard 最高 4K,Fast 与 Mini 为 480P / 720P,带音频
Kling 3.0长镜头电影感对白与对口型,画面文字在运动中依然清晰3–15 秒720P / 1080P / 4K,原生音频与对口型
MiniMax H3风格化运动设计、片头字幕与清晰排版,原创配乐一次到位4–15 秒768P / 2K,恒带音频
HappyHorse 1.1说话人像对白,口型精准;九种画面比例含 4:5、5:4 与 9:213–15 秒720P / 1080P,恒带音频
Wan 3.0按时间戳脚本导演的 30 秒一镜到底,音频可选2–30 秒480P / 720P / 1080P,音频可选
Wan 2.7稳定可靠的日常短片,每次渲染都带声音2–15 秒720P / 1080P,恒带音频
LTX 2.5 (Fast / Pro)带运镜、音效设计和多个说话角色的剧本场景,最长 20 秒;Fast 冲到 4K6–20 秒(Pro:6–10 秒)Fast 最高 4K,Pro 为 720P / 1080P,带音频
Veo 3.1 (Standard / Fast)16:9 或 9:16 下打磨精致的 8 秒电影感短片8 秒720P / 1080P / 4K,恒带音频
FLUX 3极短提示词也能出丰富成片——独白、纪录片式段落、定格黏土动画,原生音频5–20 秒720P / 1080P,带音频

时长与输出按文生视频列出。同样这些模型在创作台的其他模式下也接受图片或参考图输入。

如何用一段文字生成视频

从一个想法到成片 MP4 只需三步——大多数视频几分钟内完成渲染。

写提示词

描述一个镜头:主体是什么、在做什么、在哪里、一个运镜,以及声音或台词。具体的名词加一个动作要点,永远比堆形容词管用。想要一个验证过的起点,就从上方样片里挑一条提示词。

选模型和参数

按镜头类型挑模型——长镜头、对白、风格化字体,还是照片级自然风光——再设置时长、画面比例和分辨率。积分预估会在提交前实时更新。

生成并下载

模型会在几分钟内渲染出每一帧和音轨。预览结果,下载无水印的 MP4,或者微调提示词用 Remix 再来一版。

文生视频 vs. 图生视频

同样的模型,不同的起点:一个只靠文字,另一个从你手头已有的图片开始。

文生视频图生视频
起点一段文字描述——不需要图片、素材或任何文件一张照片、渲染图或画作,会成为第一帧
你能控制什么一切都靠文字——主体、场景、风格、动作、声音精确的第一帧;提示词负责指挥动作和声音
一致性每次生成都会重新诠释这段描述——适合探索,不适合反复出同一个镜头主体、取景与色调从第一帧起就锁定在你的图片上
最适合还不存在的概念和场景、风格化世界、对白与旁白产品图、人像、品牌素材、分镜关键帧

很多创作者会把两者结合:先用文生视频起草场景,生成一张满意的定格画面,再用图生视频让它动起来。

文生视频积分,按秒计费

每个模型都按你选择的分辨率、以秒计费,生成失败会自动退还积分。

AI 视频模型积分价目(按分辨率分档)——积分/秒与整条示例
模型分辨率积分/秒5 秒视频5 秒视频 + 3 秒参考视频
480p25125 积分170 积分
720p56280 积分381 积分
1080p139695 积分946 积分
480p1155 积分75 积分
720p28140 积分191 积分
1080p65325 积分442 积分
4k135675 积分918 积分
480p945 积分62 积分
720p20100 积分136 积分
480p630 积分41 积分
720p1260 积分82 积分
768p1890 积分144 积分
2k29145 积分232 积分
720p1890 积分仅支持参考图
1080p24120 积分仅支持参考图
Wan 2.7
720p1890 积分144 积分
1080p30150 积分240 积分
480p1050 积分80 积分
720p1890 积分144 积分
1080p36180 积分288 积分
720p22110 积分仅支持参考图
1080p29145 积分仅支持参考图
4k71355 积分仅支持参考图
720p20100 积分
1080p29145 积分
1440p43215 积分
4k67335 积分
720p27135 积分
1080p38190 积分
Veo 3.1
720p41205 积分
1080p42210 积分
4k60300 积分
Veo 3.1 Fast
720p1050 积分仅支持参考图
1080p1155 积分仅支持参考图
4k30150 积分仅支持参考图
720p38190 积分仅支持参考图
1080p65325 积分仅支持参考图
  • 上传的参考视频时长按 60% 计费——生成 5 秒并携带 10 秒参考视频,按 11 秒而非 15 秒计费。
  • 例外:MiniMax H3 / Wan 2.7 / Wan 3.0 的参考视频秒数按全价计入计费秒数。
  • MiniMax H3:前 5 张参考图免费,超出后每张加收 9 积分。

订阅档位与一次性积分包的完整对比见定价页

去积分价目页查看全部模型的价格

AI 文生视频常见问题

关于在 Molyin 用文字生成视频的一切。

现在就开始用 Molyin 创作

免费注册,几分钟内把你的第一个想法变成电影感视频。