Seedance


概要[編集]

『モンキー・D・ルフィがサウザンド・サニー号の上でMacBookでコーディングしているが、激怒し、最終的にそれを海に投げ捨てる。』というプロンプトでSeedance 2.0が生成した動画。


Seedance(シーダンス、Seedance 1.0 / 2.0)は、ByteDanceのSEEDチームが開発した生成系映像AIモデルおよび、そのモデルを用いたクラウド型AI動画生成サービスである。 テキストや画像を入力として、数秒の高解像度動画を自動生成できることを特徴とする。

サイトリンク(Seedance 2.0):https://seedance2.ai/

詳細[編集]

Seedanceは、テキストから動画を生成する「Text-to-Video」と、静止画から動画を生成する「Image-to-Video」を統合的にサポートする基盤モデルである。 24fpsのフレームレートで5〜10秒程度のHD(最大1080p)動画を生成でき、マルチショット構成やストーリー性のある映像制作にも対応している。

Seedance 1.0は2025年に論文として公表され、推論効率と高画質を両立したビデオ基盤モデルとして位置付けられている。 その後、2K解像度などに対応したSeedance 2.0が報告されており、映像と音声を統合的に扱うアーキテクチャが採用されているとされる。

開発[編集]

Seedanceは、中国やシンガポール、米国などに拠点を持つByteDanceの研究組織「SEED」チームによって開発された。 SEEDチームは大規模言語モデル、音声、ビジョン、ワールドモデルなど汎用AIの研究を担当しており、その中核プロジェクトの一つとしてSeedanceが位置付けられている。

学術的な技術仕様は、論文「Seedance 1.0: Exploring the Boundaries of Video Generation Models」としてarXivに公開されている。 商用利用向けには、ブラウザ上から利用可能な無料/フリーミアム型のAI動画生成サービスが「Seedance」ブランドで提供されている。

特徴[編集]

高性能ビデオ基盤モデル[編集]

Seedance 1.0は、高性能かつ推論効率の高いビデオ基盤生成モデルとして設計されている。 マルチソースな動画データと精度の高いキャプションを用いたデータセット構築により、多様なシナリオに対応できる学習が行われている。

モデルはテキストからの動画生成と画像からの動画生成を統合的に学習しており、単一モデルで両タスクを処理できる点が特徴とされる。

マルチショット・ストーリーテリング[編集]

Seedanceはマルチショット動画の生成や、複数シーンをまたいだストーリーテリングに強みを持つ。 キャラクターの一貫性や背景・環境の連続性を維持するアルゴリズムにより、複雑な物語構造でも視覚的な整合性を保った映像を生成できるとされる。

複数カットを跨いだナラティブの流れを意識した設計により、シーン間のスムーズなトランジションや論理的な展開を自動的に構成可能である。

スペース・タイムの分離アーキテクチャ[編集]

Seedance 1.0の中核には、空間層と時間層を分離したDiffusion Transformer(DiT)が採用されている。 空間層は各フレーム内でのアテンション計算を担い、時間層はフレーム間の時間方向のアテンションを担当することで、学習と推論の効率化が図られている。

時間層ではフレーム内のウィンドウ分割を行いつつ、時間方向には全体的な受容野を確保することで、長い時間スケールの動きと一貫性を確保している。 テキストトークンは主に空間層におけるクロスモダリティ相互作用に参加する設計となっている。

画質・動きと推論速度[編集]

Seedance 1.0は、拡散過程の加速と性能維持を両立するため、マルチステージ蒸留や教師モデルとのスコアディスティレーションなど複数の最適化手法を導入している。 その結果、5秒の1080p動画を数十秒程度で生成できるとされ、既存の高画質モデルと比較して約10倍の推論高速化を実現したと報告されている。

評価指標においては、Seedance 1.0はKling 2.1やVeo 3と並び、テキストから動画タスクにおいて高いスコアを示している。 特に、プロンプトの追従性、モーションの滑らかさ、構造の安定性、長時間の時系列整合性などでバランスの取れた性能を持つとされる。

実用的な生成機能[編集]

Seedanceの一般向けサービスでは、テキストプロンプトの入力、参照画像のアップロード、動画長(5秒または10秒)や解像度などの設定を行うだけで、簡便にショートクリップを生成できる。 静止画像をアップロードした場合、元のスタイルを保持したまま物理的に自然な動きを付与するアニメーション動画を生成できる。

生成された動画は、TikTokやReelsなどのショート動画プラットフォーム向けのクリップ制作、広告、プレゼンテーション用素材などに活用されている。

技術[編集]

学習データとキャプション[編集]

Seedance 1.0では、精度の高い動画キャプションを付与したマルチソースのデータセットを用いることで、多様なシーンやアクションに対応できる表現力を獲得している。 意味的に豊かな説明文をメタデータとして付与することで、テキストプロンプトに対する追従性や指示理解能力が向上しているとされる。

拡散スケジューリングとフロー・マッチング[編集]

Seedanceはフロー・マッチング(flow matching)フレームワークと速度予測(velocity prediction)を組み合わせたトレーニングを採用している。 訓練時のタイムステップはロジット正規分布からサンプリングされ、高解像度かつ長尺の動画ほど強いノイズを加える「解像度依存のシフト」によって、効率的な学習が行われる。

推論加速のために、教師モデルからの時間ステップ条件付き蒸留(TSCD)や、RayFlowに基づくスコアディスティレーションが用いられ、拡散過程のステップ数を削減しながら品質を維持している。

ポストトレーニングとRLHF[編集]

Seedance 1.0は、微細な教師ありファインチューニングと、動画特化のRLHF(人間のフィードバックによる強化学習)を組み合わせて性能を向上させている。 RLHFでは、映像の品質、動きの自然さ、プロンプトの遵守度など複数次元の報酬を導入し、総合的な評価に基づいた学習が行われる。

Dual Branch Diffusion Transformer(2.0)[編集]

Seedance 2.0では、「Dual Branch Diffusion Transformer」と呼ばれるアーキテクチャが採用されていると報告されている。 これは映像生成用ブランチと音声生成用ブランチを並列に動作させる構成であり、2K解像度クラスの高精細な動画生成に対応しつつ、音声との同期や統合的なメディア生成を目指した設計であるとされる。

機能[編集]

テキストからの動画生成(Text-to-Video)[編集]

ユーザーは自然言語のプロンプトを入力することで、シネマティックなモーションやライティング、カメラワークを備えた動画を生成できる。 Seedance 1.0のパイプラインでは、テキストプロンプトがDiffusion Transformerに入力され、潜在空間でノイズから構造化された映像表現へと変換される。

その後、VAE(変分オートエンコーダ)によりフレームが再構成され、拡散リファイナによって最終的な解像度までアップサンプリングされる。 このカスケード型の拡散パイプラインにより、高解像度かつ時間的に滑らかな動画が得られる。

画像からの動画生成(Image-to-Video)[編集]

静止画像を入力した場合、Seedanceは元画像のスタイルや構図を維持しながら、現実的で滑らかな動きを付与した動画を生成する。 人物やオブジェクトのポーズ変化、カメラのパン・チルト、背景の微妙な動きなどを自然に合成することで、短いアニメーションクリップとして出力できる。

マルチショット生成と一貫性[編集]

Seedanceは複数カットにまたがる動画生成をサポートし、同一キャラクターや環境を別カットでも一貫した見た目で再現できる。 これにより、単一のショートクリップだけでなく、ショートフィルムや広告、PV的な構成の動画制作も可能である。

ユースケース[編集]

Seedanceは、以下のような用途で利用されている。

  • ショート動画プラットフォーム(TikTok、Reels等)向けのクリップ生成
  • 広告用のプロモーション動画作成
  • SNS投稿用のビジュアルコンテンツ制作
  • 映像作家・クリエイターのプロトタイピング、コンセプトムービー制作
  • マーケティング資料やプレゼンテーション用の背景映像

ノーコードかつブラウザベースであることから、映像編集ソフトや専門的なスキルがなくても、スマートフォンやPCから短時間で動画生成が可能となっている。

評価[編集]

Seedance 1.0は、テキストから動画生成タスクにおいて、他の最新モデルと比較して高い評価スコアを示したと報告されている。 Kling 2.1やVeo 3と並び、モーション品質やビジュアルの忠実度で高水準を達成しつつ、プロンプト追従性やマルチサブジェクト環境での指示理解に優れるとされる。

また、推論高速化により、1080p・5秒動画を数十秒レベルで生成できる点は、実用的なユーザー体験に寄与していると評価されている。 マルチショット生成や長時間の時間的整合性においても強みを持ち、ストーリーテリング用途での有用性が指摘されている。

余談[編集]

  • 2026年2月、「One Piece」や「チェンソーマン」など数々の日本のアニメキャラクターがseedanceによって生成され、話題となった。[1][2]
  • その高い生成能力で話題となったが、実はそれだけではなく、他の生成AIには必ずと言えるほど適用される二つの規制からSeedanceは自由である。
    • 著作権制限がないのでアニメキャラクター、実在する人物がリアルに表現される。
    • NSFW(エロなど)について規制がないため、刺激的なコンテンツも生成可能。好きなアニメキャラでエロ動画を作ることも可能ということ

この記事に足りない情報、ありませんか?

一行のメモでも、個人的な感想でも大歓迎。ログインなしでそのまま書き足せます。

この記事に追記する