← 返回AI 前沿
AI 前沿

电视上开始播AI剧集了。你看到的画面清晰流畅,人物表情丰富,剧情有起有落。但你可能不知道——AI生成这集电视剧的第一步,不是「画」出一个画面,而是先在屏幕上撒满密密麻麻的雪花点,就像小时候电视没信号时那种「沙沙沙」的噪点。

老师有没有告诉你,AI拍的电视剧——是从一堆雪花点里「浮现」出来的

2026-07-28 · 🕐 约 8 分钟

丢笔哥 发布

🖊️ 老师有没有告诉你…

老师有没有告诉你,AI拍的电视剧——是从一堆雪花点里「浮现」出来的

AI生成视频不是「画」出来的——是先把画面彻底毁成噪点,再一层一层「猜」回来的。你看到的每一帧,都是一个猜谜游戏的结果。

你肯定觉得,AI拍电视剧,就是给电脑喂一堆素材,它帮你剪辑拼接一下。对吧?

:::story title="Sora的「穿帮」时刻"
2024年2月,OpenAI发布了Sora——第一个能生成一分钟连贯视频的AI模型。在官方演示视频里,一位女性走在东京街头,画面美得像电影。但仔细观察你会发现:她走了几十秒,路上的行人没有一个回头看她。不是AI忘了画,是AI不知道——当一个引人注目的人走在街上,路人会有什么反应。这种「物理世界正确但社交世界缺失」的穿帮,恰好暴露了AI视频最大的短板:它不懂人。
:::

从雪花点到画面:AI不是在画,是在猜

你可以理解为:AI生成视频的过程,像做一道反向的拼图题。正常的拼图是你把碎片拼成完整的图。AI是反过来——它先给你一张完整的图,然后加满噪声,把图彻底「毁掉」,再训练自己从噪声里「恢复」出原图。训练了一百万张图之后,你给它一张全是噪声的纯雪花屏,它也能「猜」出一张人脸来。

这个技术的学名叫「扩散模型」。名字很形象——就像一滴墨水滴进清水里,墨水会慢慢扩散开来。AI做的就是反扩散:从已经扩散开的混沌状态,反向追踪墨水是从哪里来的。

视频比图片多一个维度——时间。AI不是一帧一帧独立生成的,它生成的每一帧都要「参考」上一帧。就像你在纸上画火柴人动画——每一页都要跟上一页差不多,稍微动一点点。AI做的事情就是:在一团噪声里,同时「看出」这一帧的画面,和它跟上一帧的连贯关系。

为什么AI视频花了比AI图片多十倍的时间才「能用」

2022年,AI生成的图片已经可以以假乱真了。但AI视频一直到2024年下半年才开始真正「能看」。你可能会想:视频不就是很多张图片连起来吗,能有多难?

问题出在「一致性」。你可以理解为:AI每一帧都在独立地做猜谜游戏。第一帧猜出一张人脸,第二帧猜出同一张脸但眼睛位置偏了一毫米,第三帧嘴巴的角度又不对了。连起来看,脸就在「抖」。观众的眼睛对这种抖动极其敏感——你甚至说不上哪里不对,但一眼就知道「这是假的」。

解决这个问题的核心思路是「时空注意力」——这词很唬人,但你可以理解为:AI在生成第10帧的时候,不仅看第9帧,还回头看第1帧和第5帧。它在每一帧生成时都反复确认:「我画的这个人,眉毛在第1帧里是什么样来着?」就像你在画连环画时,不停翻回第一页对照。

一分钟视频,需要多少算力?

你可能觉得AI生成视频很快——毕竟现在很多工具号称「几分钟出一集」。但实际上,一秒钟的高质量AI视频(24帧),背后的计算量大到离谱。

用目前最先进的视频生成模型,生成一秒1080P视频,大约需要在一台顶级GPU上跑十几分钟。折算一下:一分钟的AI剧集,光「生成」这一步就需要几个小时的计算时间。而且这个过程中,AI要在内存里同时维护几百帧的「中间态」——就像你要同时在大脑里记住一部电影里所有角色的位置、表情、光影变化。

这也是为什么「电视开始播AI剧集」是个大新闻——它意味着算力成本和生成速度终于跨过了「能用」的门槛。但这个门槛不是AI自己跨的,是背后的GPU集群用真金白银堆出来的。你每看一分钟AI剧集,背后可能烧掉了几度电。

AI最不擅长的东西,恰好是电视剧最需要的

说了这么多AI能做到的,你得知道它做不到的——而那恰好是最关键的。

AI能生成连贯的画面,但它不知道「因果关系」。它知道「一个人端起杯子」后面通常是「喝了一口水」,但它不知道「为什么」要喝——是因为渴了,还是因为紧张,还是因为想拖延时间?

电视剧的每一帧都是有「动机」的。角色为什么在这个时刻说这句话?为什么镜头要从这个角度拍?这些选择里藏着编剧、导演和演员对「人」的理解。AI目前能做到的,是「形式上正确」——画面流畅、光影自然、不会有穿帮——但它还不理解「为什么要拍这个」。

你可以理解为:AI是一个技术完美的摄影师,能拍出任何你想要的画面。但它不知道哪一个画面「应该」出现在这一刻。那个决定,还是人类的事。

这对你意味着什么——不只是「电视换了个拍法」

AI剧集的意义不在「替代演员」或「省掉拍摄成本」。它真正的变化在于:降低了「把脑子里的画面变成屏幕上能看到的东西」的门槛。

以前,你脑子里有一个故事,想把它变成一部剧?你需要剧组、设备、演员、后期——至少几十个人和几百万资金。现在呢?一个人、一台电脑、一个AI工具,理论上就能做出一部能播的剧集。

这不是「AI抢了导演的饭碗」——这是「任何人都有可能当导演」。但这个变化也会带来一个问题:当制作成本趋近于零的时候,什么东西才算「值得看」?当任何人都能生成一部看起来很专业的剧集,真正稀缺的东西就不是「制作能力」了——是「判断力」和「品味」。你会发现自己突然被海量「看起来不错但看完什么都记不住」的内容包围了。

课后小测

  1. AI生成视频的核心技术「扩散模型」,最像以下哪种过程?
  2. [ ] 像打印机逐行扫描
  3. [✓] 像把墨水滴进清水再反向追踪
  4. [ ] 像照相机曝光成像
  5. [ ] 像是拼图从边缘往中间拼

  6. AI视频比AI图片「难做十倍」的根本原因是什么?

  7. [ ] 视频文件太大了
  8. [✓] 帧与帧之间需要保持一致性,否则画面会「抖」
  9. [ ] 没有人训练数据
  10. [ ] 法律不让AI做视频

  11. AI目前做电视剧最大的短板是什么?

  12. [ ] 画面不够清晰
  13. [✓] 不理解因果和动机——不知道「为什么」要拍这个画面
  14. [ ] 生成速度太慢
  15. [ ] 颜色不够鲜艳

AI视频生成 · 扩散模型 · AI剧集 · 生成式AI · 视频理解

🖊️

关于丢笔哥

丢笔哥不是一个具体的人——它是一种态度。在信息爆炸的时代,用最直白的语言,把硬核知识讲透。覆盖金融证券、AI 前沿、Web3、东方智慧。

一支笔丢在桌上,一堂课就此开始。

📬 订阅丢笔哥 →

📖 继续阅读

🔗 Web3
老师有没有告诉你,科学界最大的丑闻不是造假——是那篇改变世界的论文被拒了三次
如果有一个系统,审稿人可以在拒绝你论文的同时,偷偷把你的idea发给自己团队——而且你永远不知道——你会觉得这是科幻小说吗?不,这是每周都在发生的真实故事。
🌌 东方智慧
老师有没有告诉你,宇宙里最稳定的系统,其实一直站在悬崖边上
1987年,三个物理学家在实验室里玩沙子,发现了一个让所有「稳定」这个词的定义都失效的现象。而你身体里、股市里、甚至你的婚姻里——同一件事正在发生。
📈 金融证券
老师有没有告诉你,「房价还能重新上涨吗」这个问题本身就是你亏钱的原因
你问「房价还能涨吗」的时候,其实不是在问市场——你是在问一个已经被你的大脑偷偷改过答案的问题。而这个问题本身,比房价涨跌更值钱。

📬 不想错过下一堂丢笔课?

每周一篇硬核科普,用最好玩的方式讲最硬核的知识。
不卖课、不荐股、不画饼。

💬 讨论区