文生影片(Text-to-Video)

文生影片(T2V)是一種把文字提示詞直接生成動態影片的 AI 技術。了解它的原理、擅長的場景,以及如何寫出有效的提示詞。

打開完整生成器

看它怎麼運作

一條真實提示詞和它在 Molyin 上生成的結果。點 Remix 從這裡起步。

  • Wan 3.0
  • Text to video
  • 15s
  • 720P

少林寺後院石板地上,光頭小武僧排成整齊方陣。教頭一聲令下,全體重複踢腿訓練:高抬腿、側踹、迴旋踢連貫出招,整齊劃一。鏡頭特寫一位小武僧單腳獨立金雞式,雙手合十紋絲不動數分鐘。教頭巡視到他面前,棍尖輕點他的肘部糾正動作。鏡頭切到牆邊整排木人樁,幾名大師兄正在對打木樁,雙臂在樁臂間靈活穿梭防守反擊。整個訓練場只有擊打聲與呼喝聲迴盪。

**文生影片(Text-to-Video,簡稱 T2V)**是一種生成式 AI 技術:你用文字描述一個場景,模型把它「拍」成一段動態影片——包含運動、光影,在新一代模型上甚至有同步音訊。你負責描述,模型負責拍攝。

工作原理

主流的文生影片模型底層是擴散模型(Diffusion Model),在海量「影片+字幕」配對資料上訓練而成。生成時,模型從純雜訊出發,在提示詞的引導下逐步「去噪」成一幀幀畫面。由於所有幀在同一個時間脈絡中生成,輸出具備連貫性:物體不會憑空消失,運動自然流暢,鏡頭表現得像真正的攝影機,而不是幻燈片。

擅長的場景

當你手裡只有一個想法、沒有任何素材時,文生影片最能發揮價值:

  • 概念探索 —— 在實拍或畫分鏡之前,先把腦中的畫面視覺化。
  • 短內容生產 —— 開場鉤子、B-roll 空鏡、產品預告、直式或橫式社群短片。
  • 不可能的鏡頭 —— 無人機穿過鑰匙孔、玻璃鑄成的城市、穿太空衣的狐狸。只要你能描述,模型就能嘗試。

好的提示詞包含什麼

強大的 T2V 提示詞讀起來像導演的分鏡筆記,而不是許願。覆蓋四個要素:主體(誰/什麼)、動作(時間維度上發生什麼)、鏡頭(構圖與運鏡)、氛圍(光線、色調、情緒)。完整方法論見《如何寫出真正有效的 AI 影片提示詞》。

關於文生影片(Text-to-Video)的常見問題

Molyin 上哪些模型支援文生影片?

生成器裡每個上線的影片模型都接受文字提示詞,目前共 14 個。選好模型,每秒價格會在生成前即時更新;新模型上線即接入。

生成一支文生影片要多少積分?

按輸出秒數計費,單價取決於模型和解析度,最低 3 積分/秒。生成器會在你點擊生成前顯示準確總價,失敗的任務自動退回積分。

再往下走

什麼是文生影片(Text-to-Video)? | Molyin