由YouTube联合创始人查德·赫利创办的硅谷初创公司EyeTell,希望在视频制作领域复制YouTube在视频分发领域取得的成就。该公司将多种生成式AI视频和动画工具整合为一套易于上手的软件,公司员工已在用它制作过去需要一个工作室才能完成的作品。一位编剧在不用演员、不搭布景、也不用马匹的情况下,仅用一周就完成了一整集摄政时期古装剧。EyeTell描绘的是一波新讲述者的兴起,但围绕版权、报酬和就业的反对声音同样真实:2026年Artsy的一项调查显示,自认为积极拥抱AI的艺术家只有14%。

从分发走向制作

赫利表示,创办EyeTell的想法源于他离开YouTube之后。YouTube让已经在做视频的人有了触达观众的途径,而他注意到,还有一个大得多的群体有创意想法,却缺乏把它们变成成品的技术或资金。

EyeTell瞄准的正是这一群体。赫利预测,AI视频工具将以前所未有的规模掀起一场讲故事的复兴,像YouTube开放分发那样开放制作。这只是创始人的预测,但公司已按这一目标配置团队:成员既有经验丰富的技术人员,也有专业动画师和资深电影叙事者。

一周完成的古装剧

最能说明这些工具能力的例子是《Ashcombe House》。这是一部英国摄政风格的原创剧,有马车出行、精致服装、会客厅和马匹。若由大型制片厂制作,聘请演员、勘景和搭建布景通常要花费数百万美元。

这次这些都没有发生。EyeTell一位有传统影视制作背景的编剧兼AI制片人,独自用一周时间完成了整集。她在WeWork共享办公室的一张桌子前工作,用的只是基本的电脑技能和EyeTell的生成工具。影片的视觉风格取材自2005年的电影版《傲慢与偏见》。

传统制作 《Ashcombe House》
演员 聘请演员 无演员
外景与布景 勘景并搭建 无
团队 制片厂团队 一名编剧
预算与时间 大型制片厂数百万美元 基本电脑技能,一周

用一张照片和一段声音生成会说话的角色

EyeTell的桌面软件把提示词引擎和时间线编辑器并排放在一起:用户在前者中输入给AI的指令,在后者中组接镜头。它还能把一张手绘的2D机器人草图变成可调整姿势的渲染3D角色。

更引人注目的演示只需要一个人的一张静态照片和一小段录音。软件据此生成一个风格化的低多边形(用少量平面多边形构成的3D效果)3D角色。这个角色用克隆出的本人声音说话,坐在一处可俯瞰未来城市天际线的高层休息室里。

一张人像照片和一段声音波形逐步变成坐在未来感高层休息室里的低多边形3D角色

▲ 由一张照片和声音生成的3D角色

那么,提示词引擎能否连提问也一并写好,彻底取代人类讲述者?EyeTell的首席故事官承认,AI可以自行写出对白和情节节点,但如果没有人来引导和打磨,完全自动生成的内容往往显得不自然、很假。换言之,工具也许能降低制作成本,但决定什么值得做,似乎仍然是人的工作。

绕开制片厂的把关人

这位首席故事官有着深厚的行业经验:他曾在Pixar和Warner Bros.担任首席动画师,参与过《玩具总动员》《怪兽电力公司》等奥斯卡获奖影片。他认为,传统好莱坞体系依赖企业内部的把关人来决定哪些提案能获批。在他看来,生成式AI让个人创作者在自己的电脑上就拥有相当于一整个动画工作室的能力。

对于持反对意见的艺术家,他也有回应,并举出电影制作史上的两次转变:

  • 《侏罗纪公园》中出现电脑生成的恐龙时,制作实物特效的艺术家深感担忧。
  • Pixar推出《玩具总动员》时,动画业界有人批评3D电脑动画丑陋、机械、没有灵魂,直到出色的讲述者证明它同样能打动观众。

他的观点是,今天的抵触也会走上同样的路。不过这是工具开发者的看法,并不能消除下文提到的担忧。

版权、同意与类似Content ID的方案

影视行业从业者担心,生成式AI会抢走工作,并在未经同意、未给合理报酬的情况下使用他人的肖像、声音和知识产权。

赫利的观点正好相反:他认为AI可以让署名和授权变得更容易。他把EyeTell的做法比作他在YouTube参与开创的Content ID(识别上传视频中受版权保护内容的系统)。他表示,类似的数字系统可以识别流入AI生成作品的知识产权。这样,版权方就可以为粉丝创作的内容发放授权并从中获益,而不只是依赖一刀切的下架和限制。这种模式能否真正让创作者增加收入,似乎仍是悬而未决的问题。

让观众左右剧情的EyeTell TV

EyeTell还启动了名为EyeTell TV的实验,由赫利首次在YouTube上推出。它播放由AI生成的故事,剧情会根据观众在聊天栏中输入的内容而改变。

其中一个例子是以面包店为背景的动画《Crumb and Ledger》。观众提交“愿望”后,AI几乎实时地把它们融入画面。收到的请求包括:

  • 邮递员送来一份比萨
  • 一只熊猫吃掉了食物
  • 一只鸭子飞进店里,叼起面包又飞走

观众在聊天中提出请求后画面随之改变的面包店动画,鸭子叼走面包,熊猫在吃东西

▲ 由观众请求推动的AI动画

赫利表示,目标是把被动观看变成主动参与,让观众共同决定故事的走向。由于任何人都能输入请求,EyeTell设置了多层防护:底层AI模型内置的限制与EyeTell自有的审核过滤器协同工作,防止露骨、暴力或含仇恨内容的提议出现在画面上。

其他设想中的用途还包括把历史事件做成动画、让旧家庭照片动起来,以及制作独立电影。

意味着什么,该怎么做

《Ashcombe House》背后的编剧并不认为AI电影制作会取代传统电影。她认为两者将并存,为新的声音提供一条绕开套路化制片厂项目的道路。但大多数艺术家还没有走到这一步:在2026年的Artsy调查中,86%的人并不认为自己是积极拥抱AI的人。对EyeTell这样的公司来说,赢得这份信任看来是下一道关卡。

无论你是在尝试AI视频工具的创作者,还是在打造此类产品的团队,以下几点值得参考:

  1. 把提示词当作导演指令,亲自打磨输出,而不是完全依赖自动生成的剧本。
  2. 对古装剧或复杂科幻片这类成本高昂的创意,在投入外景、布景或团队之前,先用AI做出原型。
  3. 把清晰的人像照片与干净的录音搭配起来,就能快速做出会说话的角色;但考虑到业界对肖像和声音的担忧,应先确认自己有权使用它们。
  4. 如果用户可以提交提示词,不要只依赖基础模型的限制,还要加上自己的过滤器,在生成之前筛查请求。