
这个正在威尼斯电影节红毯上,同时斩获两项AI影像大奖的年轻人,你或许已经听过他的名字——DiDi_OK。 前几天,DiDi_OK分享了他用Seedance 2.5创作的最新作品《Candy》(中文名《糖果》),仅仅瞥一眼,我就被深深震撼了。 我毫不犹豫地转发了,力荐每一位朋友逐帧学习。虽然在AI影视圈,DiDi_OK已经接近家喻户晓,但也许仍有朋友不熟悉这个名字,没关系,你很可能已经看过他之前的作品。 比如《箭头》、《网站》、《垃圾站》,还有更多更多。数据表现最为出色,要数今年2月那个刷屏全网的《牌子》。 这个短片,光在B站上的播放量就超过了两千万人,全网播放量更是逼近一亿。 我至今清晰地记得,第一次看到《牌子》的那个夜晚,循环播放了六七遍后,脑海中浮现出的疑问: 明明都是人类,为何在DiDi_OK面前,我却像一个只能流口水的局外人?他的思维与审美,究竟是如何构建起来的? 这并非夸张,而是真实的感叹。DiDi_OK自那以后,在我心中,已无可争议地成为AI影像领域的翘楚。 而这次的《糖果》,更是DiDi_OK在这个主持人平行宇宙系列中,将技术与创意推向顶点,达到了令人惊叹的境地。如果你还没看过,不妨先睹为快,我保证,你会为之倾倒。 与现在许多平庸、油腻的AI作品不同,《糖果》依然保留着浓厚的Di味,散发着独特的个人风格。 它巧妙地展开了一些高维规则,蕴含着SCP的神秘感,又带着一丝黑镜式的反思,甚至能窥见刘慈欣式的科幻深度。 当然,更不可或缺的是他精湛的叙事节奏、独具匠心的镜头语言,以及对细节的极致追求。因此,我将《糖果》的发布视作一个绝佳的机会。

我渴望与他深入交流,进行一次简短的专访,了解他的创作理念与经历。 考虑到他目前身处国外,正忙于威尼斯电影节的领奖活动,我们之间存在着时差,经过几天的尝试,我们终于敲定了采访时间。 采访那天,北京时间上午十点半。他身在黑山,那边已经是凌晨四点半,他早早地起了床,因为六点多还需要前往山区拍摄… 我们畅快地交流了将近两个小时,探讨了我想知道的诸多问题。谈话结束后,我坚信必须将这些内容记录下来,与大家分享。 那么,让我们开始吧。 一. 他迎来了AI时代的崛起 DiDi_OK,是一个极具魅力的人。 他目前长期居住在伦敦,在WPP Production工作,WPP是全球最大的广告与营销传播集团之一,你或许听说过它的子公司——奥美。 而WPP Production则是WPP旗下最核心的制作团队。 在AI技术出现之前,DiDi_OK就一直在动画、3D和游戏领域潜心创作。他的本科和硕士专业都是动画。 进入WPP后,他也从动画工作做起。他去英国的故事也颇具趣味。 当时,他和朋友合伙成立了工作室,靠着拍摄广告维持生计。然而,他渐渐觉得这种生活缺乏意义。 有一天下午,他们在户外拍摄广告,他突然对朋友说:要不然,我们出国吧? 朋友好奇地问:去哪里? 他回答:去英国吧?

前往英国的原因也显得有些异想天开。 他们过去在拍摄完广告后,经常一起观看影视飓风的电影,而影视飓风的创始人Tim,成为了DiDi_OK的偶像。 Tim以前在英国工作… 所以,不如就去英国吧。 他真的回家学了半年英语,成功申请了伦敦艺术大学。他妈妈最初甚至没有帮他报名,认为这个孩子绝对考不上。 最终,他偷偷地报名了,结果,竟然真的考上了… 几年后,那个曾经在广告拍摄结束后熬夜观看影视飓风电影的小伙,受到了Tim的邀请,加入了影视飓风的AI课程,并分享了自己的创作心得。 你看,世界总是如此奇妙,人生有时候也像一个写得有些俗套的剧本。 在AI技术普及之前,他其实已经在创作了。 2021年,他在伦敦艺术大学创作了一部名为《Moth》的作品,已经展现出独特的Di味。 一个被迷雾笼罩的封闭世界,中央耸立着一座巨塔。所有人都认为那里禁足不得,但主角却如同飞蛾扑火般,执意前往。 即使真相令人失望,即使将面临死亡。他也渴望看清世界的真面目。 他脑海中关于科技、未知世界、以及文明的思考,实在是太多了。 然而,过去被限制的,是那个时代的生产力。 传统的动画工作流程过于冗长,几乎不可能由一个人独立完成一部影片。

流程越繁琐,参与人数越多,想法在传递的过程中,会不可避免地损失一些信息。 而经过建模、绑定、动画、后期等一系列环节,最终呈现的效果,可能连最初的灵感都难以企及。 所以,这些年,他一直在探索一种方法,他称之为力道,力求以尽可能最低的损耗,将脑海中的创意和感受传递给观众。 终于,他迎来了属于他的时代。 AI,到来。 二. 《糖果》:罪恶终将消散 如果让我来介绍《糖果》, 我可能会认真解释半天: 这是一个关于一级文明、外星规则、暴力、秩序、人性和科技发展的科幻故事。 然而,如果让DiDi_OK来解释,他只是简单地概括了十个字: 坏人会爆炸,好人就没事。 极其朴素,却又精准到位。 故事的开端,人类的能源利用能力抵达了文明的一级门槛。 与此同时,土星的一颗卫星潘靠近了地球。

紧接着,全世界发生一件令人费解的事情: 只要有人准备伤害他人, 砰,就会发生爆炸。 这种爆炸并不会造成血肉飞溅,而是会变成: 一大堆糖果。 一开始,大家都困惑不已: 外星人?新型武器?上帝? 渐渐地,他们发现这个规则只针对: 暴力。 DiDi_OK赋予它的底层判断标准,也充满了中国特色,那就是四个字: 起心动念。 这部短片一经发布,我就反复观看了四遍,当时我问了他一个让我感到非常矛盾的问题:这似乎是一个反对暴力的故事,但观众最大的爽点却是看到坏人被更强大的力量毁灭。 这本身不是一种暴力吗?

DiDi_OK笑了笑,说我抓住了精髓,而且,这正是他的初衷。 影片随后将屡次违反规则的人送往月球。 乍一看,似乎是文明与和平的象征。 然而,这背后同样潜藏着群体暴力。 他甚至花费了大量时间设计片子里代表大众意见的女性发言人,他希望她能够拥有特别容易被大众接受、信任的气质。 这有些类似于《三体》里的程心。 因为这件事本身就带着一种所有人都觉得这一定是正确的的危险。 DiDi自己也没有站在绝对非暴力的立场上。 他认为现实生活中,常有一个残酷的问题:善良的人,往往是那些被欺负的人。 因此,从中古世纪西方的骑士,到中国的侠客,人类几千年来一直在幻想着: 正义最好拥有力量。 于是,这个时候,《糖果》的内核变得与众不同。 一颗外星卫星拥有判断什么是恶的最终解释权,全人类因为恐惧惩罚而维持文明,然后大家集体同意,将不符合规则的人送往月球。

这究竟算是文明?还是秩序?又或者是暴政?又或者是一个比我们现在稍微好一点的世界? DiDi_OK没有给出答案,这个问题,留给每一个观众去思考。 三. AI的真正进步 在采访之前,我反复观看了DiDi_OK的《箭头》、《牌子》、《网站》、《垃圾站》等作品。 我发现了一个显著的变化,那就是《糖果》这部作品,由于使用了Seedance 2.5,终于能够大胆地放慢节奏了。 比如,这个教科书级别的长镜头。 坦率地说,DiDi_OK以往的作品经常会快速切换镜头,比如《箭头》和《牌子》,经常5秒就会更换一个场景。 背后的原因很简单,AI影视行业的人可能都猜得到这个现实原因。 因为你不敢慢,因为模型的能力,完全达不到。 过去的模型能力,是无法支持长镜头细节不变的这种镜头叙事的。 于是呢,就只能不停用新的视觉刺激,把模型来不及暴露的问题给掩盖过去。 但是《糖果》里,第一次出现了大量安静的叙事。 比如这个镜头。

实验室里,一位年长的官员缓缓走上前,身后的年轻研究员一路紧随,态度极其谄媚,期盼着得到关注。 然而官员始终保持冷淡,直到突然搭理了他一句。 那个年轻人的身体立刻微微弯曲了一点,眼神也变得明亮起来。 这时候,你能清晰地感受到: 诶,他听到了我说话。 DiDi说,这才是他认为模型真正突破的地方,便是表演。 以前他一直觉得AI表演无法超越人类,那些表演的细节度不够,所以,一直少了一些叙事空间。 现在Seedance 2.5在他眼里,这个鸿沟已经正式跨越了。 开头那个女孩吃糖的镜头也是如此。 他特别在意女孩脸上的一个小痘痘。 我甚至第一次看的时候都没有注意。 但是对DiDi_OK来说,这是一个极其重要的信息锚点。 因为这个极小的细节,会让观众第一眼看到的时候,觉得,这是一个真实存在的人。

当演员的脸本身可以提供信息的时候,导演才敢把镜头停在那里。 还有这个手指甲超近特写下,皮肤和指甲的质感。 还有这个超近景特写中,角色呈现出来的高精度皮肤微观细节,包括毛孔、细纹、皮脂光泽及受光变化;同时细微表演如眼神、呼吸、肌肉牵动与微表情均具备可信度。 而这种细节度和精细度,DiDi_OK说,只有Seedance 2.5才能达到。 他认为,这个模型至少为他节省了60%的叙事成本。 我特别喜欢这个词。 大家天天讨论AI能降低多少制作成本。 他谈论的是叙事成本。 我认为,真正改变叙事的,从来都不是所谓的分辨率更高或者价格更便宜。 是我们过去只能绕着模型的缺陷去讲我们的故事。 但现在,模型开始允许我们,按照脑海中的想法去讲故事。 这才是,真正的进步。

四. Seedance 2.5 改变的一切 对于Seedance 2.5这个模型,我们聊了很多。 DiDi_OK说,如果有人现在告诉他,以后这辈子都不会再有新的视频模型,只能永远使用Seedance 2.5, 他觉得,也足够了。 因为坦率地讲,从我的视角来看,Seedance 2.0发布的时候,全网的反响远比这一次2.5大。 但那时候,DiDi_OK觉得,2.0还可以,确实震撼,但是好像没有那么大的变革。 直到这次Seedance 2.5。 也许很多人第一眼觉得,啊?不还是AI视频吗?跟2.0区别也不是很大啊。 但是DiDi_OK觉得,这反而是一次真正意义上的跨时代升级。 我问他:到底跨在哪? 他说了两个词。 高度定制化。 高精度的运动规律。 这两个词听起来特别技术化,尤其是运动规律,实在是没有电影感、1080P、一镜到底听起来性感。

但观众的眼睛特别诚实。 比如一辆车拐弯,车身应该有侧倾,悬挂应该有压缩,刹车和加速应该产生不同的俯仰。 一颗糖果从人体里面炸出去,它应该有质量,有初速度,撞到东西以后会反弹,几百颗糖果之间还会互相碰撞,跟镜头的距离不同,虚实也不一样。 所谓运动规律,其实就是:这个世界到底符不符合我们从认知到的物理规律。 所以《糖果》里面那个最核心的糖果爆炸,其实也是AI能力的一次极限测试。 DiDi_OK说,现在Seedance 2.5生成的视觉效果,已经可以经得起慢放和暂停了。 他甚至故意设计了那种让大家来暂停看看的镜头。 比如警察局的这场戏,画面里面同时有很多人,DiDi_OK给后面一个黑人角色单独设计了一条故事线。 先挣脱、然后推桌子、拿起电视,再准备攻击警察,随后灯光闪烁,所有人的动作短暂停顿,特定的人同时炸成糖果。 DiDi_OK借助模型的能力,同时指挥十几个人的动作,每个人都有自己的故事线。 这就是DiDi所谓的第二个特点,定制化。 因为过去,我们用AI做一个怪兽啥的,其实真的都不算难。

难的东西往往都很日常,比如让左边第三个人先往后看。然后拿起电视。右边警察继续保持现在动作。灯闪以后第二个人爆炸。 AI真正进入工业生产以后,最需要的能力,恰恰是这种定制化。 DiDi_OK说,他感觉,几乎没有什么是他想实现,但是实现不了的了。 比如一堆糖果组成马蒂斯的《舞蹈》。 微缩景观下的移轴动画。 等等等等。 因为模型能力的增强,运动规律和可定制化都变得极强,所以也带来了一个变化,过去的工作流很多就有点跟不上版本了。 比如过去,为了一个镜头,可能要垫好几张图,来让模型理解。 所以,他说那时候,他有一个明确的优先级: 参考图,大于提示词,大于模型选择。 甚至为了让模型完成它能力本身完成不了的动画和运镜效果,他会大量使用Blender来建模进行参考。

比如角色和表面之间的运动追踪,就像手机屏幕上的字,以前AI生不准。那就一个字一个字追,全是后期进行人工修复的。 基本就是能工智人。 本质上很简单,都是因为模型能力达不到,而DiDi_OK又不想降低自己的作品效果,就会用很多其他手法来进行弥补。 然后,就来到了《糖果》。 他说,这套逻辑明显开始反过来了。 参考图的重要性明显下降。 Prompt的重要性开始疯狂上升。 因为模型理解能力变强了。 很多过去必须先做好的关键帧才能做的动画,现在可以直接用嘴说了。 所有的传统辅助工具都变得不再重要,很多过去要额外做两个星期的后期,也消失了。 DiDi_OK说,这是他第一个,几乎百分百纯度的AI片子。 甚至他用上Seedance 2.5之前,他已经用2.0做了3分钟的《糖果》了,做了将近40%,在他用上2.5之后,毅然决然,全部推翻重来。 这也是这个AI时代非常操蛋的一点。 你的苦心经营的半年的技巧,还有很多所谓保持一致性的工作流,可能就会被一次模型发布直接吞噬。

DiDi_OK说,那些都属于小数点后面的技术,他现在也越来越没有兴趣了,真正决定你上限的,还是你的个人能力,还有模型本身的理解力。 当模型开始吞掉工作流。 创作者剩下来的,才是真正属于创作者的东西。 五. 创作到底是什么? 我问DiDi_OK:你觉得AI真的能算创作吗?很多人说,不就是抽卡吗?创作在哪里呢? 他给我讲了一个特别好的例子。 2023年,他参与过一个F1赛车宣传片,实拍加虚拟制作。 那时候,很多镜头可能要NG500多次。 一天光场地费,就是10万英镑。 赛车漂移过去,轮胎擦地,然后烟冒出来了,导演觉得,那个烟不好看,再来。 所有调度一切归位,然后再来一遍。 就这样,不断的Roll,不断的挑选。 直到导演觉得,这个第397次的烟最好,就用这个第397次的镜头。 所以,DiDi_OK说,创作,从来都不是生成多少次的事,也不是AI不AI的事,因为本质上,传统影视,也是抽来抽去的逻辑。

真正的创作,是那个不要。 为什么这个导演,要第397次呢?前面那396次,为什么都不要呢? 这个不要,才是审美,才是判断,才是经验,才是那个真正的。 创作。 只不过,在AI加持之下,抽卡的速度变得越来越快,质量越来越高,是以前的传统影视,远远不可企及的。 但是反常识的是,模型越来越强以后。 DiDi一点都没有更轻松,反而更痛苦了。 过去一颗8秒镜头,磨两三天就差不多了,因为你知道,模型就那样了,上限就在那,可以安慰自己,这不是自己的问题。 但现在,有了Seedance 2.5这种级别的模型,第三次就能给你一个特别牛逼的结果。 那说明,它能做。 这时候,压力就全部给到DiDi_OK的身上了。 为什么我调度不出来? 为什么没想到那个机位? 为什么还不够好?

以前两三天一个镜头