YouTubeの共同創業者チャド・ハーリーが設立したシリコンバレーのスタートアップEyeTellは、YouTubeが動画の配信で成し遂げたことを、動画の制作で実現しようとしています。同社はさまざまな生成AIの動画・アニメーションツールを、誰でも扱える一つのソフトウェアにまとめました。社内のスタッフはすでに、かつてはスタジオが必要だった作品をこのツールで作っています。ある脚本家は、俳優もセットも馬も使わずに、リージェンシー時代の時代劇を1話まるごと1週間で完成させました。同社が掲げるのは新たな語り手の波です。一方で、著作権や報酬、雇用をめぐる反発も現実のものです。2026年のArtsyの調査では、AIを積極的に取り入れていると答えたアーティストはわずか14%でした。

配信から制作へ

ハーリー氏がEyeTellの構想を得たのは、YouTubeを離れた後のことでした。YouTubeは、すでに動画を作っていた人々に視聴者へ届ける手段を与えました。同氏が気づいたのは、創作のアイデアを持ちながら、技術や資金が足りずに作品として形にできない、はるかに大きな層の存在でした。

EyeTellが狙うのはまさにこの層です。ハーリー氏は、AI動画ツールがかつてない規模でストーリーテリングのルネサンスを巻き起こし、YouTubeが配信を開放したように制作を開放すると予測しています。あくまで創業者の見通しですが、同社はその実現に向けた人員をそろえています。チームには経験豊富な技術者に加え、プロのアニメーターや映画畑のベテランの語り手が加わっています。

1週間で作られた時代劇

ツールの実力を最もよく示すのが「Ashcombe House」です。馬車での移動、凝った衣装、応接間、馬が登場する英国リージェンシー様式のオリジナルドラマです。大手スタジオがこうした作品を作れば、俳優の起用、ロケ地探し、セットの建設に、通常は数百万ドル規模の費用がかかります。

今回はそのどれも行われていません。従来の映画制作の経験を持つEyeTellの脚本家兼AIプロデューサーが、1話分すべてを1週間で一人で作り上げました。作業したのはWeWorkの共有オフィスの一角で、使ったのは基本的なコンピュータースキルとEyeTellの生成ツールだけです。映像のスタイルは、2005年の映画版「プライドと偏見」から着想を得ています。

従来の制作 「Ashcombe House」
キャスト 俳優を起用 俳優なし
ロケ地とセット 探して建てる なし
スタッフ スタジオのチーム 脚本家1人
予算と期間 大手スタジオで数百万ドル 基本的なコンピュータースキルと1週間

写真1枚と声から話すキャラクターを作る

EyeTellのデスクトップソフトウェアは、ユーザーがAIへの指示を入力するプロンプトエンジンと、シーンを組み立てるタイムライン編集機能を並べて備えています。手描きの2Dロボットのスケッチを、ポーズを付けられるレンダリング済みの3Dキャラクターに変えることもできます。

さらに目を引くのは、ある人物の静止画1枚と短い音声録音だけから始まるデモです。ソフトウェアはこの二つの入力から、様式化されたローポリゴン(少数の平らな多角形で形づくる3D表現)の3Dキャラクターを作ります。キャラクターは本人の声を複製した声で話し、未来都市のスカイラインを見下ろす高層ラウンジに座っています。

人物写真と音声波形が、未来的な高層ラウンジに座るローポリゴンの3Dキャラクターに変わっていく様子

▲ 写真1枚と声から作る話す3Dキャラクター

では、プロンプトエンジンが質問まで書き、人間の語り手を完全に置き換えられるのでしょうか。EyeTellのチーフストーリーテラーは、AIがせりふや筋の展開を自動で書けることは認めつつ、人が方向付けして磨き上げなければ、完全に自動化された出力は不自然で作り物のように感じられることが多いと話します。つまり、ツールは制作のコストを下げても、何を作る価値があるかを決めるのは依然として人間の仕事だといえそうです。

スタジオの門番をなくす

このチーフストーリーテラーは業界で豊富な経験を積んできた人物で、PixarとWarner Bros.でリードアニメーターとして「トイ・ストーリー」や「モンスターズ・インク」などアカデミー賞受賞作に携わりました。同氏は、従来のハリウッドの仕組みは、売り込まれた企画のどれを承認するかを決める企業内の門番に左右されていると指摘します。同氏の見方では、生成AIは個人のクリエイターに、アニメーションスタジオ一つ分に相当する力をパソコン上で与えます。

反発するアーティストへの答えも用意しています。同氏は映画制作における過去の二つの転換を挙げます。

  • 「ジュラシック・パーク」にコンピューターグラフィックスの恐竜が登場したとき、実物の特殊効果を作るアーティストたちは危機感を抱きました。
  • Pixarが「トイ・ストーリー」を公開したとき、アニメーション業界の一部は3Dコンピューターアニメーションを醜く、機械的で、魂がないと評しましたが、優れた語り手たちが観客の心を動かせることを証明しました。

今日の抵抗も同じ道をたどるという主張です。ただしこれはツールを作る側の見方であり、続く懸念を解消するものではありません。

著作権、同意、そしてContent ID型の解決策

映画業界で働く人々は、生成AIが仕事を奪い、本人の同意や正当な対価なしに容姿、声、知的財産を使うことを懸念しています。

ハーリー氏の主張は逆で、AIは出典の表示やライセンス供与をむしろ容易にできるといいます。同氏は、EyeTellの取り組みを、自身がYouTubeで開発を主導したContent ID(アップロードされた動画に含まれる著作物を識別する仕組み)になぞらえます。同氏によれば、同様のデジタルの仕組みがあれば、AI生成作品に流れ込んだ知的財産を検出できます。そうすれば権利者は、一律の削除や制限だけに頼るのではなく、ファンが作ったコンテンツにライセンスを与えて収益を得られるようになります。このモデルが実際にクリエイターの収入につながるかどうかが、残された問いだといえそうです。

観客が物語を動かすEyeTell TV

EyeTellは、EyeTell TVという実験も始めました。ハーリー氏がYouTubeで初めて披露したもので、観客がチャットに入力した内容に応じて変化するAI生成の物語を配信します。

一例が、パン屋を舞台にしたアニメーション作品「Crumb and Ledger」です。観客が「願い」を送ると、AIがそれをほぼリアルタイムで場面に取り込みます。寄せられた要望には次のようなものがありました。

  • 郵便配達員がピザを届ける
  • パンダが食べ物を食べる
  • アヒルが店に飛び込み、パンをくわえて飛び去る

観客のチャットの要望で場面が変わり、アヒルがパンをくわえ、パンダが食事をするパン屋のアニメーション

▲ 観客の要望で進むAIアニメーション

ハーリー氏は、受け身で見るだけの体験を能動的な参加に変え、観客が一緒に物語の行き先を決められるようにすることが狙いだと説明します。誰でも要望を入力できるため、EyeTellは安全対策を何層にも重ねています。基盤となるAIモデルに組み込まれた制限と、EyeTell独自のモデレーションフィルターが連携し、露骨な内容、暴力的な内容、憎悪を含む提案が画面に出ないようにしています。

ほかにも、歴史上の出来事のアニメーション化、昔の家族写真に命を吹き込むこと、インディペンデント映画の制作といった用途が提案されています。

何を意味し、何をすべきか

「Ashcombe House」を手がけた脚本家は、AIによる映画制作を従来の映画の代わりとは見ていません。両者は並び立ち、型どおりのスタジオ企画の外に新しい声の通り道を開くと考えています。ただ、多くのアーティストはまだその段階にありません。2026年のArtsyの調査では、86%が自らをAIの積極的な利用者とは考えていませんでした。EyeTellのような企業にとって、その信頼を得ることが次の壁になりそうです。

AI動画ツールを試すクリエイターや、こうした製品を作るチームにとって、実践上のポイントはいくつかあります。

  1. プロンプトを演出の指示として扱い、完全自動の脚本に頼らず、出力は自分で磨き上げます。
  2. 時代劇や複雑なSFのように費用のかさむアイデアは、ロケ地、セット、スタッフにお金をかける前に、AIで試作します。
  3. 鮮明な人物写真とクリアな音声録音を組み合わせれば、話すキャラクターを素早く作れます。ただし容姿や声をめぐる業界の懸念を踏まえ、それらを使う権利があるかを確認します。
  4. ユーザーがプロンプトを送れるサービスなら、基盤モデルの制限だけに頼らず、生成の前に要望を選別する独自のフィルターを加えます。