Seedance 2.5は、セリフのある会話からアニメ調の戦闘、トランプの構造物が崩れる場面まで、5つの場面を使った比較で最も幅広いAI動画生成タスクに対応しました。ただし、総合首位のモデルがすべてのショットに最適とは限りません。Kling 3.0は、説得力のある演技と元画像を使った安定したアニメーションを、はるかに少ないクレジットで実現しました。重要なのは、各場面の要求にどのモデルが応えられるかです。

4モデルを実用性で4段階に分類

以下のランクは、1人の評価者による主観的な結果を編集上の判断で整理したもので、別途測定したスコアではありません。クレジット消費量は、Higgsfieldでの検証条件における10秒間の生成に必要な数です。

ランク モデル クレジット 最も適した用途 今回の検証での主な弱点
S Seedance 2.5 65 実写風とアニメ調の場面を通じた、細かな指示の再現 クレジット消費量が最多。元画像を使うテストでは画角がやや狭い
A Kling 3.0 17.5 感情を伴う会話と、元画像からの安定したアニメーション アニメ調のアクションとトランプの衝突表現が弱い
B Happy Horse 25 手描き風の映像と、ろうそくの光がつくる雰囲気 一連の動作をつなげることと、元画像からの動きの維持が苦手
C Gemini Omni Flash 30 トランプが崩れる際の物理表現と、実用水準のリップシンク 明示された指示を守れず、元画像も使えない

この評価には、映像の魅力だけでなく、失敗の種類の違いも反映されています。Seedance 2.5は5つのプロンプトを通じて、最も要件を満たす結果を出しました。Kling 3.0はこの条件で生成に必要なクレジットが最も少なく、1つのショットで何度も試作する場合には、より実用的な選択肢となるかもしれません。Gemini Omni FlashのCランクは、すべての出力が失敗だったという意味ではありません。トランプの衝突は、同モデルの中でも出来のよい結果の一つでした。

厳密な指示で最大の差が表れた

2つの場面では、見栄えのよい映像と、指示に忠実な一連の動作との差が比較的はっきり表れました。一方の場面では、3本のろうそくのうち中央の赤い1本だけに火をつけ、マッチを振って消し、残る白い2本は消えたままにする必要がありました。これは、起きてはいけないことを指定する否定条件のテストです。

Seedance 2.5は、暗い室内と使い終わったマッチを含め、この一連の動作を再現しました。Kling 3.0は赤いろうそくだけに火をつけましたが、室内を明るくしすぎ、人物がマッチを口で吹き消しました。Happy Horseは暗闇からろうそくの明かりへの印象的な変化を作りましたが、その後、火がついたままのマッチを置きました。Gemini Omni Flashの出力では、最初のフレームから白いろうそく2本にも火がついていました。小道具や照明に厳密な条件があるショットでは、雰囲気のよさ以上にこうした違いが重要です。

セルシェーディングで描かれた闘技場での決闘の隣に、3本のろうそくを置いた暗いテーブルがあり、中央の赤いろうそくだけが燃えています。

▲ アニメの戦闘と赤いろうそくの点火

もう一方の場面では、鎧を着た剣闘士たちが闘技場で模擬戦を行う様子を、セルシェーディングという平面的な色使いと2階調の描画スタイルで、一続きのショットとして表現する必要がありました。Seedance 2.5は2Dの見た目を保ち、剣闘士同士の大きさの比率を維持しながら滑らかな戦闘を生成しました。Happy Horseの手描き風の表現には魅力がありましたが、攻防は単調になりました。Kling 3.0は動きがぎこちなく、人物の姿も不明瞭でした。Gemini Omni Flashは3D寄りの見た目になり、鎧がなくなったうえ、無人のはずの観客席に人を配置しました。リアルな顔の表現に優れたモデルでも、様式化されたアクションには適さない場合があります。

会話と元画像では異なる選び方が必要

会話のプロンプトでは、夜間に停車した車内で、女性がつらい電話をしている場面を設定しました。セリフ、抑えた感情表現、助手席からのカメラ位置、物語上の複数の展開を指定しています。4モデルとも、口の動きが音声に合うリップシンクは機能しましたが、演出指示への忠実さには差がありました。

Seedance 2.5は指示どおりカメラを車内に置き、セリフに自然な呼吸、雨、街灯の光を組み合わせました。Kling 3.0は感情のこもった演技が最も強く感じられましたが、カメラを運転席側の窓の外に移しました。Happy Horseはカメラをフロントガラスの外に置き、女性本人に話させる代わりに電話からセリフを流しました。Gemini Omni Flashはカメラ位置こそ正確でしたが、冒頭から女性をあからさまに泣かせ、車を走らせました。

セリフ中心の広告やドラマの試作では、カメラ位置の正確さより演技を重視するなら、Kling 3.0が効率的な最初の選択肢となるかもしれません。画角と台本どおりの展開も守る必要があるなら、この車内のテストではSeedance 2.5が有利です。

屋上の場面では、テキストだけでショット全体を作るのではなく、与えられた静止画を動かす画像からの動画生成を試しました。GPT Image 2で作成した4Kの元画像には、夕暮れの屋上でベージュのトレンチコートを着た女性が写っています。指定した動きは、上昇するヘリコプター、サーチライト、回転翼が起こす風、女性の反応です。

トレンチコートを着た女性が目をかばい、夕暮れの屋上の背後ではヘリコプターが上昇し、サーチライトの光が空を切り裂いています。

▲ 屋上場面における元画像の一貫性

Kling 3.0は滑らかなカメラの動きを加えながら、女性の容姿や服装、街の背景を特に安定して維持しました。Seedance 2.5も女性の容姿を保って指定の動作を実行しましたが、画角はやや寄り気味でした。Happy Horseは当初一貫性を保っていたものの、動きの中で女性の顔が崩れ、ヘリコプターの方を振り向く動作も再現できませんでした。Gemini Omni Flashは元画像のアップロードに対応しておらず、このテストには参加できませんでした。複数のショットにわたって特定の人物や衣装を維持する必要がある制作では、この制約が重要になります。

物理表現は独立した評価項目

トランプの場面では、回転するカードを2段に組んだカードの構造物の根元に当て、途切れることなく崩れさせる必要がありました。Seedance 2.5は明確な衝突と、カードが自然に散らばる様子を見せました。Gemini Omni Flashも、連鎖する崩壊を説得力ある形で生成しました。Kling 3.0は構造物に当てられず、その後、崩壊の原因になったように見えるカードを新たに出現させました。Happy Horseではカードの形が崩れ、構造物は遅れて倒れました。この結果から、演技や映像スタイルの説得力だけで、物体同士の衝突表現まで優れているとは予測できないことがうかがえます。

結果をどう活用するか

比較ではHiggsfield上で、プロンプト、アスペクト比16:9、長さ10秒、出力解像度720pという基本条件をモデル間で揃えました。評価時にはモデル名を伏せています。それでも、これらのランクは5つの場面に対する1人の評価者の判断であり、あらゆるプロンプトや後のモデルビルドで同じ結果になる保証はありません。この比較にはHiggsfieldの紹介特典が付随していました。複数のモデルを1つのプラットフォームで利用する利点を判断する際には、この販促上の関係も考慮する必要があります。

ショットで譲れない条件に応じて選んでください。クレジット消費が重要なら、会話や元画像を使うショットの試作にはKling 3.0が適しています。厳密な指示、様式化された動き、確かな物体の接触が必要な最終ショットには、Seedance 2.5を検討できます。どちらかに決める前に、同じプロンプトを共通の長さと解像度で試し、最初のフレームの見栄えだけでなく、カメラ位置、禁止した動作、人物の一貫性、物理的な出来事を確認してください。