圖生影片(Image-to-Video)

圖生影片(I2V)是一種讓靜態圖片動起來的 AI 技術:以你的圖片作為首幀生成影片。了解它的原理和適用場景。

打開完整生成器

看它怎麼運作

一條真實提示詞和它在 Molyin 上生成的結果。點 Remix 從這裡起步。

  • Kling 3.0
  • Image to video
  • 15s
  • 1080P

開場為超廣角中遠景橫移跟拍,穩定器貼近地面低機位運動,冷藍夜色與銀白星空構成對比強烈的浪漫電影色調,散發濃厚的詩意寫實主義與古典史詩氣質。主角是一位身穿墨綠色長裙的年輕女子,在月光照亮的花園草坪上奮力奔跑;裙擺隨風翻湧成洶湧的動態曲線,她右手緊攥一朵小白花,左手提起裙擺,呼吸急促而眼神堅定。第 4 秒,鏡頭隨她一同加速前進,背景左右兩側陸續闖入多位身著舊時代舞會禮服的男女,與她並肩奔跑——有人試圖靠近,有人回頭呼喊,卻無人真正觸碰到她,暗示著追逐與逃離。第 8 秒,鏡頭逐漸推近至中景,搖至主角正前方跟拍前移並微微上升;她短暫回望身後一位年輕男性角色,兩人目光在一瞬間交會,情緒在奔跑中爆發,女子與男子牽起手一同奔跑。第 12 秒,音樂與運動到達高潮;鏡頭貼著她的側臉與飛揚的髮絲向前推進,她鬆開手中的白花拋向空中,白花以慢動作飄落,身後的人群與它擦身而過。最後 3 秒,鏡頭持續前移,女子與男子衝破人群,向花園盡頭的星空奔去,身影漸漸占據畫面中心。整體氛圍熾烈、浪漫而決絕,是一段關於命運、選擇與自由的敘事爆發。

**圖生影片(Image-to-Video,簡稱 I2V)**是一種讓靜態圖片「活過來」的生成式 AI 技術。你提供一張圖——產品圖、人像、插畫——模型以這張圖為起點生成影片,讓畫面動起來,並可用文字提示詞引導運動方向。

工作原理

在圖生影片中,你的圖片會被用作首幀——一個模型必須遵守的視覺錨點。從首幀出發,影片擴散模型預測場景應如何演化:髮絲隨風飄動、咖啡杯升起熱氣、鏡頭緩緩推近。此時提示詞不再需要描述畫面長什麼樣(圖片已經說明了),而是描述接下來發生什麼。

為什麼從圖片出發?

與文生影片相比,從圖片出發給了你一樣寶貴的東西:對畫面的精確控制。構圖、色彩、臉孔、產品標籤——從第一幀起全部鎖定。以下場景中 I2V 是首選:

  • 手裡有品牌素材 —— 讓產品圖動起來,而不用擔心模型「重新發明」你的包裝。
  • 主體必須精確 —— 真實的人、真實的地點、既有的藝術作品或插畫。
  • 追求可預測性 —— 首幀固定,每次疊代只改變運動方式。

提示詞技巧

圖片已經解決了「是什麼」,提示詞就該專注「怎麼動」:描述運動(細微、劇烈、循環)、鏡頭(固定、緩推、環繞)、以及你希望發展出的氛圍。在圖生影片裡,簡短聚焦運動的提示詞通常勝過冗長的場景描述。更多技巧見提示詞寫作指南。

關於圖生影片(Image-to-Video)的常見問題

圖生影片該上傳什麼樣的圖?

用手邊最清晰的一張,比例就按你想要的影片比例來。多數模型會原樣保留首幀,模糊或裁切過的地方會留在每一幀裡。

首幀之後的畫面能控制嗎?

可以。提示詞負責描述動作、運鏡和聲音,部分模型還接受尾幀或驅動人聲。不用再描述主體,圖已經說清了,把字省給動作。

再往下走

什麼是圖生影片(Image-to-Video)? | Molyin