文生影片(Text-to-Video)

July 11, 2026
文生影片(T2V)是一種把文字提示詞直接生成動態影片的 AI 技術。了解它的原理、擅長的場景,以及如何寫出有效的提示詞。
AI Video

**文生影片(Text-to-Video,簡稱 T2V)**是一種生成式 AI 技術:你用文字描述一個場景,模型把它「拍」成一段動態影片——包含運動、光影,在新一代模型上甚至有同步音訊。你負責描述,模型負責拍攝。

工作原理

主流的文生影片模型底層是擴散模型(Diffusion Model),在海量「影片+字幕」配對資料上訓練而成。生成時,模型從純雜訊出發,在提示詞的引導下逐步「去噪」成一幀幀畫面。由於所有幀在同一個時間脈絡中生成,輸出具備連貫性:物體不會憑空消失,運動自然流暢,鏡頭表現得像真正的攝影機,而不是幻燈片。

擅長的場景

當你手裡只有一個想法、沒有任何素材時,文生影片最能發揮價值:

  • 概念探索 —— 在實拍或畫分鏡之前,先把腦中的畫面視覺化。
  • 短內容生產 —— 開場鉤子、B-roll 空鏡、產品預告、直式或橫式社群短片。
  • 不可能的鏡頭 —— 無人機穿過鑰匙孔、玻璃鑄成的城市、穿太空衣的狐狸。只要你能描述,模型就能嘗試。

好的提示詞包含什麼

強大的 T2V 提示詞讀起來像導演的分鏡筆記,而不是許願。覆蓋四個要素:主體(誰/什麼)、動作(時間維度上發生什麼)、鏡頭(構圖與運鏡)、氛圍(光線、色調、情緒)。完整方法論見《如何寫出真正有效的 AI 影片提示詞》

在 Molyin 上使用文生影片

Molyin 的生成器搭載 Seedance 2.0 文生影片模式:支援 5 秒或 10 秒時長、最高 1080p 解析度、從 21:9 電影寬幅到 9:16 直式共六種長寬比、可選 AI 生成音訊,並支援 seed 控制以重現結果。

相關詞條

現在就用 AI 影片生成器試試看。

文生影片(Text-to-Video) | Molyin