电视上开始播AI剧集了。你看到的画面清晰流畅,人物表情丰富,剧情有起有落。但你可能不知道——AI生成这集电视剧的第一步,不是「画」出一个画面,而是先在屏幕上撒满密密麻麻的雪花点,就像小时候电视没信号时那种「沙沙沙」的噪点。
老师有没有告诉你,AI拍的电视剧——是从一堆雪花点里「浮现」出来的
2026-07-28 · 🕐 约 8 分钟
由 丢笔哥 发布
AI生成视频不是「画」出来的——是先把画面彻底毁成噪点,再一层一层「猜」回来的。你看到的每一帧,都是一个猜谜游戏的结果。
你肯定觉得,AI拍电视剧,就是给电脑喂一堆素材,它帮你剪辑拼接一下。对吧?
:::story title="Sora的「穿帮」时刻"
2024年2月,OpenAI发布了Sora——第一个能生成一分钟连贯视频的AI模型。在官方演示视频里,一位女性走在东京街头,画面美得像电影。但仔细观察你会发现:她走了几十秒,路上的行人没有一个回头看她。不是AI忘了画,是AI不知道——当一个引人注目的人走在街上,路人会有什么反应。这种「物理世界正确但社交世界缺失」的穿帮,恰好暴露了AI视频最大的短板:它不懂人。
:::
从雪花点到画面:AI不是在画,是在猜
你可以理解为:AI生成视频的过程,像做一道反向的拼图题。正常的拼图是你把碎片拼成完整的图。AI是反过来——它先给你一张完整的图,然后加满噪声,把图彻底「毁掉」,再训练自己从噪声里「恢复」出原图。训练了一百万张图之后,你给它一张全是噪声的纯雪花屏,它也能「猜」出一张人脸来。
这个技术的学名叫「扩散模型」。名字很形象——就像一滴墨水滴进清水里,墨水会慢慢扩散开来。AI做的就是反扩散:从已经扩散开的混沌状态,反向追踪墨水是从哪里来的。
视频比图片多一个维度——时间。AI不是一帧一帧独立生成的,它生成的每一帧都要「参考」上一帧。就像你在纸上画火柴人动画——每一页都要跟上一页差不多,稍微动一点点。AI做的事情就是:在一团噪声里,同时「看出」这一帧的画面,和它跟上一帧的连贯关系。
为什么AI视频花了比AI图片多十倍的时间才「能用」
2022年,AI生成的图片已经可以以假乱真了。但AI视频一直到2024年下半年才开始真正「能看」。你可能会想:视频不就是很多张图片连起来吗,能有多难?
问题出在「一致性」。你可以理解为:AI每一帧都在独立地做猜谜游戏。第一帧猜出一张人脸,第二帧猜出同一张脸但眼睛位置偏了一毫米,第三帧嘴巴的角度又不对了。连起来看,脸就在「抖」。观众的眼睛对这种抖动极其敏感——你甚至说不上哪里不对,但一眼就知道「这是假的」。
解决这个问题的核心思路是「时空注意力」——这词很唬人,但你可以理解为:AI在生成第10帧的时候,不仅看第9帧,还回头看第1帧和第5帧。它在每一帧生成时都反复确认:「我画的这个人,眉毛在第1帧里是什么样来着?」就像你在画连环画时,不停翻回第一页对照。
一分钟视频,需要多少算力?
你可能觉得AI生成视频很快——毕竟现在很多工具号称「几分钟出一集」。但实际上,一秒钟的高质量AI视频(24帧),背后的计算量大到离谱。
用目前最先进的视频生成模型,生成一秒1080P视频,大约需要在一台顶级GPU上跑十几分钟。折算一下:一分钟的AI剧集,光「生成」这一步就需要几个小时的计算时间。而且这个过程中,AI要在内存里同时维护几百帧的「中间态」——就像你要同时在大脑里记住一部电影里所有角色的位置、表情、光影变化。
这也是为什么「电视开始播AI剧集」是个大新闻——它意味着算力成本和生成速度终于跨过了「能用」的门槛。但这个门槛不是AI自己跨的,是背后的GPU集群用真金白银堆出来的。你每看一分钟AI剧集,背后可能烧掉了几度电。
AI最不擅长的东西,恰好是电视剧最需要的
说了这么多AI能做到的,你得知道它做不到的——而那恰好是最关键的。
AI能生成连贯的画面,但它不知道「因果关系」。它知道「一个人端起杯子」后面通常是「喝了一口水」,但它不知道「为什么」要喝——是因为渴了,还是因为紧张,还是因为想拖延时间?
电视剧的每一帧都是有「动机」的。角色为什么在这个时刻说这句话?为什么镜头要从这个角度拍?这些选择里藏着编剧、导演和演员对「人」的理解。AI目前能做到的,是「形式上正确」——画面流畅、光影自然、不会有穿帮——但它还不理解「为什么要拍这个」。
你可以理解为:AI是一个技术完美的摄影师,能拍出任何你想要的画面。但它不知道哪一个画面「应该」出现在这一刻。那个决定,还是人类的事。
这对你意味着什么——不只是「电视换了个拍法」
AI剧集的意义不在「替代演员」或「省掉拍摄成本」。它真正的变化在于:降低了「把脑子里的画面变成屏幕上能看到的东西」的门槛。
以前,你脑子里有一个故事,想把它变成一部剧?你需要剧组、设备、演员、后期——至少几十个人和几百万资金。现在呢?一个人、一台电脑、一个AI工具,理论上就能做出一部能播的剧集。
这不是「AI抢了导演的饭碗」——这是「任何人都有可能当导演」。但这个变化也会带来一个问题:当制作成本趋近于零的时候,什么东西才算「值得看」?当任何人都能生成一部看起来很专业的剧集,真正稀缺的东西就不是「制作能力」了——是「判断力」和「品味」。你会发现自己突然被海量「看起来不错但看完什么都记不住」的内容包围了。
课后小测
- AI生成视频的核心技术「扩散模型」,最像以下哪种过程?
- [ ] 像打印机逐行扫描
- [✓] 像把墨水滴进清水再反向追踪
- [ ] 像照相机曝光成像
-
[ ] 像是拼图从边缘往中间拼
-
AI视频比AI图片「难做十倍」的根本原因是什么?
- [ ] 视频文件太大了
- [✓] 帧与帧之间需要保持一致性,否则画面会「抖」
- [ ] 没有人训练数据
-
[ ] 法律不让AI做视频
-
AI目前做电视剧最大的短板是什么?
- [ ] 画面不够清晰
- [✓] 不理解因果和动机——不知道「为什么」要拍这个画面
- [ ] 生成速度太慢
- [ ] 颜色不够鲜艳
AI视频生成 · 扩散模型 · AI剧集 · 生成式AI · 视频理解
关于丢笔哥
丢笔哥不是一个具体的人——它是一种态度。在信息爆炸的时代,用最直白的语言,把硬核知识讲透。覆盖金融证券、AI 前沿、Web3、东方智慧。
一支笔丢在桌上,一堂课就此开始。
📬 订阅丢笔哥 →📖 继续阅读
🔗 Web3📬 不想错过下一堂丢笔课?
每周一篇硬核科普,用最好玩的方式讲最硬核的知识。
不卖课、不荐股、不画饼。
💬 讨论区