テキスト動画生成AI

見たい映像を言葉で書けば、そのまま動画になります——映像素材も、写真も、編集もいりません。Seedance 2.5、Kling 3.0、MiniMax H3、HappyHorse、Wan、LTX、Veo、FLUX 3 が一文をネイティブ音声付きのシネマティックなクリップに変換します——最長30秒、最大4K。

  • 生成失敗時はクレジット自動返還
  • クレジットパックは無期限
  • 全モデルの料金を公開
  • ワンクリックでいつでも解約
14
対応モデル数
30 秒
クリップの長さは最大
4K
出力解像度は最大
6 クレジット/秒から
クレジット単価

一文の入力から、一本の動画へ

完成したテキストから動画のクリップを、それを生んだ完全なプロンプトとセットで並べています——被写体・動作・シーン・カメラワーク・音の公式で書かれた一文が、そのまま最初のプロンプトになります。Remixを押せば同じ設定からやり直せます。

  • Seedance 2.5
  • Text to video
  • 8s
  • 720P

リアルな自然ドキュメンタリースタイル、映画レベルのリアルな光と影。暖かい午後、森の草の斜面で、まんまるに太ったパンダの赤ちゃんが坂を転がり落ちてくる。 パンダの白黒の毛はふわふわでリアル、体は小さくぽっちゃりして、動きは不器用で愛らしい。舞台は緑の森の斜面。地面は草、苔、クローバー、土、小石、枯れ枝、そして少しの小さな黄色い花に覆われ、ぼけた背景には高い木の幹と林が見える。カメラはローポジションのミディアムワイドで、わずかな手持ち感。全体としてはほぼフィックスで、常にパンダをフレーム内に収める。 0〜3秒:パンダの赤ちゃんが緑の草の斜面に腹ばいになっている。体はまんまる。ちょうど斜面に沿ってゆっくり横向きに転がり始めたところで、動きは不器用、草の葉が体に押されてそっとしなる。そよ風が吹き、左上から木々を抜けた陽光がまだらな光と影を作る。 3〜8秒:パンダは画面右下へ転がり、動きが次第に止まって、横倒れから腹ばいへ。丸い顔がカメラの方を向き、前足を草地に突く。前景の草むらに伏せたパンダは、楽な姿勢に体を整え、頭を小さく持ち上げてはまた下ろし、かすかにクゥンと鼻を鳴らす。 ローポジション、わずかな手持ち感、パンダを追ってゆるやかに右下へ移動。自然な被写界深度:前景の草の葉はわずかにぼけ、パンダの主体はシャープ、背景の林は柔らかくぼける。自然の環境音——風の音、パンダが転がるときの柔らかくかすかなポフッという音。全体は温かく、リアルで、自然。

  • Wan 3.0
  • Text to video
  • 30s
  • 720P

これは 30 秒、16:9 横長の、シネマティックで高強度なワンテイク(One-Take)の視覚スペクタクル。全体のスタイルは「ウエストコースト・ストリート幻想主義」——90 年代のストリートスケートビデオの粗い質感と、現代の商業大作の精緻さを融合した映像言語。画面全体を極限の「カリフォルニアの陽光」でシネマティックにグレーディングする:高彩度の青空と、直射日光が落とすヤシの木の硬い影が強いコントラストを作り、アスファルトの熱、ショッピングカートの車輪が擦れる金属音、そして何も恐れない青春の反抗心が空気に満ちている。主人公の疾走に合わせて空間のパースは伸び続け、カメラは極端なローアングルの追走と、ダイナミックな物理フライスルーによって強烈な推進力を生む。 主人公は、カラーブロックのボーダーシャツに黒いベースボールキャップの、ストリートで格好いい少年。表情は最初の気だるい緩みから、限界を突き破る高揚へ一瞬で切り替わる。2 つ目の場面の主人公は同じ少年だが、彼は「観察者」の姿勢で現実の次元に現れる。 ショット 1、0-6s: ファーストカットはクローズアップ。少年は赤い鉄製のショッピングカートの中に気だるく寝そべり、背景はカリフォルニア名物のまっすぐな大通りと、天を突くヤシの木。音楽が弾けると同時に、カメラは高速で後方へ引きながら地面まで沈み込み、極端なローアングルで車輪に貼りつく。少年は急な坂道を滑り降り始める。カートは路面で激しく跳ね、両側の車が猛スピードで後ろへ流れ、カメラは狂気じみた加速感を捉える。 ショット 2、7-15s: カットを割らない。カメラはスケーターのように地面すれすれで追走し、少年が簡易な木製スロープを越えた瞬間、その勢いのまま美しい放物線を描いて上昇する。カートが宙に浮き、カメラはその真下を通り抜ける。前方の巨大な商業ビルボードが一気に視界を埋め尽くし、カメラはあり得ないほど正確な「照準」でその中心へ突き進む。 ショット 3、16-24s: カットを割らない。少年はカートごと「次元の壁を破る」ようにビルボードへ突き刺さる。ポスターに触れた瞬間、三次元だった身体が「平面化」する質的変化を起こし、画面には本物の紙が裂けるテクスチャと、カラーのグリッチインクが現れる。少年は滑走の姿勢を保ったまま、ビルボード上の一枚の平面アート作品になる。カメラはここで水平 180 度の旋回を行い、そのまま高所から地上へ急降下する。 ショット 4、25-30s: カットを割らない。カメラはビルボードの真下の路上へ滑らかに着地し、そこに「本物」の少年が現れる。彼は足を止め、ゆっくりと帽子のつばを下げ、ビルボードの上で静止したままの自分自身を、少し面白がるような笑みで見上げる。カメラは彼の視線をたどって高速のズームインを行い、最後にビルボードの「WAN」の文字の脇にある、破れた穴で止まる。BGM は高エネルギーなヒップホップと、フィルムが巻き取られる物理的な音を融合させる。視覚情報は高度に凝縮され、スタイリッシュな反抗心に満ちている。

  • HappyHorse 1.1
  • Text to video
  • 10s
  • 1080P

モダンな放送スタジオ、洗練されたデスクに座るプロのニュースキャスターのミディアムショット。クールブルーの照明、背後には柔らかく光るスクリーン。0-5秒:カメラを見つめ、明瞭で落ち着いた声で言う。"Good evening. Tonight, a breakthrough that could change how millions of us work." 5-10秒:わずかに 2 台目のカメラへ向き直り、"We'll have the full story, and what it means for you, right after this." 精密なリップシンク、かすかなスタジオの環境音、クリアな放送品質、浅い被写界深度。

  • MiniMax H3
  • Text to video
  • 15s
  • 2K

15秒・16:9ワイドスクリーンのライトサスペンス犯罪映画のオープニングシーケンスを生成してください。全体のスタイルは次のコンセプトのビジュアル言語を参照:レトロな日本アニメのオープニング、ハードエッジのシルエット、コミック風コラージュ、非対称の分割画面、強い幾何学的カラーブロック、英語のタイトルクレジット、装飾としての最小限のカタカナ、そしてジャズ×クライムの空気感。ムードはサスペンス60%・ジャズ40%:ミステリアスでクール、俊敏で、都会的な犯罪の匂い——怖くも重くもなく、陽気なジャズMVでは決してない。オープニングのモーション演出はアニメーションするグラフィックコラージュのように:まず黒い線のフレームが現れ、分割画面の枠が素早く描き出され、カラーブロックとフレームが一枚ずつ貼り込まれていく。キャラクターのシルエット、小道具のクローズアップ、英語のタイトルクレジットが、ドラムのビートに合わせてスライドイン、バウンドアウト、あるいはマスクで現れる。リアル寄りのナラティブアニメーションは避け、オープニングシーケンスらしい磨き上げられた質感にすること。英語のクレジットは判読可能に。アニメーション効果は許可:細い線のフレームが先に描かれ、名前がフレーム内にスライドインし、文字は一文字ずつ出現して動くカラーブロックによって現れ、最後に短くポーズする。中国語のテキストを加えない、文字化けを避ける、英語の人名にスペルミスがないようにすること。シーケンスのルール:各英語クレジットとタイトルは一度だけ登場させる。同じタイトルを繰り返さない、同じ名前を繰り返さない、同一人物に複数の役職を割り当てない。トランジションは多彩に:レコード盤の円形マスク、車のドアによる縦のカット、キャラクターの影によるワイプ、赤いラインのカット、大きな英字によるマスキング、分割フレームの枠の再構成、ハードな幾何学カラーブロックのカット、そしてコマ単位のコラージュによる出現。すべてのトランジションはドラムのビートに同期させる——正確に、サスペンスフルに、俊敏に、コミックコラージュの雰囲気で。ソフトなディゾルブや流れるようなトランジションは避ける。BGM:オリジナルのBGMを制作すること。

  • FLUX 3
  • Text to video
  • 15s
  • 720P

クレイアニメの物語:画面に入ってくる巨大な手に男が何度も押しつぶされ、まともに生活できない

テキスト動画生成AIとは?

テキスト動画生成AIは、書かれた説明文だけから動画を生成します。被写体・動作・場所・カメラワーク・音をテキストで書けば、モデルはその言葉だけからすべてのフレームを——多くのモデルでは音声トラックも——作り出します。撮影も、素材のアップロードも、編集も必要ありません。用語そのものの解説はテキストから動画の用語解説にまとめています。このページは、実際に1本作る場所です。

Molyin は主要なテキスト動画生成モデルをすべて一つのスタジオで動かします。Seedance 2.5 と Wan 3.0 は一文を30秒のシーケンスへ引き伸ばし、Kling 3.0 は最大4Kでネイティブな対話とリップシンク付きの長回しを撮り、HappyHorse は正確なリップシンクのトーキングヘッドが得意、MiniMax H3 は2Kでスタイリッシュなモーションデザインと読みやすい文字組みを実現、LTX 2.5 は最長20秒で複数の話者が登場する台本付きシーンを生成し、Veo 3.1 と FLUX 3 がラインナップを締めくくります。どのモデルも映像と同じワンパスで音声を生成します。

テキストから動画はAI 動画ジェネレーターにある4つのモードのひとつです:画像から動画、参照から動画、動画編集が同じプロンプト欄とクレジット残高を共有します。特定の1枚の画像から始めたいときはツールを変えるのではなくモードを切り替えるだけ。すべてのクリップは秒単位で課金され、生成に失敗した場合はクレジットが自動返還され、料金ページのすべての有料プランに商用利用権が含まれます。

どのプロンプトにどのモデルか

Molyin の全テキスト動画生成モデルを、言葉だけで最も得意なこととともに並べています。書きたいショットの種類で選び、次にクリップの長さと解像度で絞り込んでください。

モデル得意なことクリップの長さ出力
Seedance 2.51つのプロンプトからフォトリアルな動きとマルチショットのストーリーテリング、最長30秒のシーケンス4–30 秒480P / 720P / 1080P、音声付き
Seedance 2.0 (Standard / Fast / Mini)同じプロンプトの公式を3段階で——Standard は4Kに到達、Fast と Mini は解像度を抑えて速度を優先4–15 秒Standard は最大4K、Fast と Mini は 480P / 720P、音声付き
Kling 3.0対話とリップシンク付きの長い映画的な長回し。動きの中でも画面の文字は読みやすいまま3–15 秒720P / 1080P / 4K、ネイティブ音声&リップシンク
MiniMax H3スタイリッシュなモーションデザイン、タイトルシーケンス、読みやすい文字組みをオリジナル楽曲付きでワンパスで実現4–15 秒768P / 2K、常時音声あり
HappyHorse 1.1正確なリップシンク付きのトーキングヘッド対話。4:5、5:4、9:21を含む9種類のアスペクト比3–15 秒720P / 1080P、常時音声あり
Wan 3.0タイムスタンプ付き台本で演出する30秒の長回し、音声はオンオフ可2–30 秒480P / 720P / 1080P、音声はオンオフ可
Wan 2.7毎回音声付きで届く、頼りになる日常使いのクリップ2–15 秒720P / 1080P、常時音声あり
LTX 2.5 (Fast / Pro)カメラワーク、音響設計、複数の話者が登場する最長20秒の台本付きシーン。Fastは4Kに到達6–20 秒(Pro:6–10 秒)Fast は最大4K、Pro は 720P / 1080P、音声付き
Veo 3.1 (Standard / Fast)16:9または9:16で仕上げる、洗練された8秒のシネマティッククリップ8 秒720P / 1080P / 4K、常時音声あり
FLUX 3ごく短いプロンプトからでも豊かな結果——モノローグ、ドキュメンタリー風のシーン、クレイアニメーション——ネイティブ音声付き5–20 秒720P / 1080P、音声付き

クリップの長さと出力はテキストから動画の場合を示しています。同じモデルはスタジオの他のモードでも画像や参照画像の入力に対応しています。

テキストから動画を生成する方法

書かれたアイデアから完成したMP4まで3ステップ——ほとんどのクリップは数分でレンダリングが完了します。

プロンプトを書く

1つのショットを記述しましょう:被写体、何をしているか、どこにいるか、ひとつのカメラワーク、そして音やセリフ。具体的な名詞とひとつの動作のポイントは、形容詞の羅列よりも常に効果的です。実績あるスタート地点が欲しければ、上のギャラリーからサンプルプロンプトを借りてください。

モデルと設定を選ぶ

ショットに合うモデルを選びましょう——長回し、対話、スタイリッシュな文字組み、あるいはフォトリアルな自然風景。次にクリップの長さ、アスペクト比、解像度を設定します。クレジットの見積もりは送信前に更新されます。

生成してダウンロード

モデルが数分ですべてのフレームと音声トラックをレンダリングします。結果をプレビューし、ウォーターマークなしの MP4 をダウンロード、またはプロンプトを微調整してRemixでもう一本試してください。

テキストから動画 vs. 画像から動画

モデルは同じですが、出発点が違います:一方は言葉だけから、もう一方はすでに手元にある画像から始まります。

テキストから動画画像から動画
起点書かれた説明だけ——画像や映像素材、ファイルは一切不要最初のフレームになる写真・レンダー画像・アートワーク
コントロールできるものすべてを言葉で——被写体、シーン、スタイル、動き、音正確な最初のフレーム。動きと音はプロンプトで指示
一貫性生成のたびに説明が新たに解釈し直される——探索には向くが、同じショットの繰り返しには向かない被写体・構図・色調が最初のフレームからあなたの画像に固定される
最適な用途まだ存在しないコンセプトやシーン、スタイライズされた世界観、対話やナレーション商品写真、ポートレート、ブランド素材、ストーリーボードのコマ

多くのクリエイターは両方を使います:まずテキストから動画でシーンを下描きし、欲しいフレームの静止画を生成してから、画像から動画で動かします。

テキストから動画のクレジットは秒単位

すべてのモデルは選んだ解像度で秒単位で課金され、生成に失敗した場合はクレジットが自動返還されます。

AI 動画モデルのクレジット料金表(解像度別)——秒単価とクリップ例
モデル解像度クレジット/秒5秒の動画5秒の動画 + 参照動画3秒
480p25125 クレジット170 クレジット
720p56280 クレジット381 クレジット
1080p139695 クレジット946 クレジット
480p1155 クレジット75 クレジット
720p28140 クレジット191 クレジット
1080p65325 クレジット442 クレジット
4k135675 クレジット918 クレジット
480p945 クレジット62 クレジット
720p20100 クレジット136 クレジット
480p630 クレジット41 クレジット
720p1260 クレジット82 クレジット
768p1890 クレジット144 クレジット
2k29145 クレジット232 クレジット
720p1890 クレジット参照画像のみ対応
1080p24120 クレジット参照画像のみ対応
Wan 2.7
720p1890 クレジット144 クレジット
1080p30150 クレジット240 クレジット
480p1050 クレジット80 クレジット
720p1890 クレジット144 クレジット
1080p36180 クレジット288 クレジット
720p22110 クレジット参照画像のみ対応
1080p29145 クレジット参照画像のみ対応
4k71355 クレジット参照画像のみ対応
720p20100 クレジット
1080p29145 クレジット
1440p43215 クレジット
4k67335 クレジット
720p27135 クレジット
1080p38190 クレジット
Veo 3.1
720p41205 クレジット
1080p42210 クレジット
4k60300 クレジット
Veo 3.1 Fast
720p1050 クレジット参照画像のみ対応
1080p1155 クレジット参照画像のみ対応
4k30150 クレジット参照画像のみ対応
720p38190 クレジット参照画像のみ対応
1080p65325 クレジット参照画像のみ対応
  • アップロードした参照動画の長さは 60% のレートで課金されます——5 秒の生成に 10 秒の参照動画を添えても、15 秒ではなく 11 秒分の課金です。
  • 例外:MiniMax H3 / Wan 2.7 / Wan 3.0 の参照動画の秒数は全額レートで課金秒数に計上されます。
  • MiniMax H3:参照画像は 5 枚まで無料、超過分は 1 枚あたり 9 クレジット加算されます。

サブスクリプションプランと買い切りクレジットパックの比較は料金ページをご覧ください。

クレジットページで全モデルの価格を見る

テキスト動画生成AI FAQ

Molyin でテキストから動画を生成することについて、知っておきたいすべて。

今すぐ Molyin で創作を始めよう

無料登録して、最初のアイデアを数分でシネマティックな動画に。