DeepSeek一天处理8万亿个token。听起来像个天文数字,但你有没有想过——每一个token被处理的时候,背后都有一台真实的机器在烧真实的电。你每次跟AI聊天,都在给电网增加一个你根本没察觉到的负荷。
老师有没有告诉你,DeepSeek一天吞8万亿token——它吃掉的不是数据,是电
2026-08-03 · 🕐 约 6 分钟
由 丢笔哥 发布
你刷到这条新闻的时候,DeepSeek刚刚又吞掉了几千亿个token——而这过程中的耗电量,可能已经够你家开一个月的空调了。
8万亿,不是数字游戏
DeepSeek一天处理8万亿个token。你知道这个数字有多大吗?假设一个token平均是一个汉字,8万亿字——把全人类有史以来出版的所有书籍(大约1.3亿册)全部转换成文字,大概也就这个量级。而DeepSeek一天就「读」完了。但你有没有想过一个问题:这些token不是从天上掉下来的。每一个token被处理的时候,都有一颗GPU芯片在疯狂运转,一条内存通道在吞吐数据,一组散热风扇在嘶吼。AI不是吃数据的怪兽——它吃的是电。2026年,全球数据中心用电量已经超过整个日本的全国用电量,而AI训练和推理占了这个数字的一半以上。你每一次跟AI聊天,背后都有一台服务器在实实在在地烧煤或者烧铀。
为什么「读」和「算」要费电
你可能会想:不就是读文字吗?我手机看小说也不怎么费电啊。但AI的「读」和你的「读」完全是两码事。你看一个字,大脑里有一组已经训练好的神经元直接映射到语义——这是「检索」。AI「读」一个字,要做的是:把这个字变成一串768维的向量,然后跟它见过的所有其他字的向量做矩阵乘法,算出一个「注意力分数」,再把这个分数加权到上下文里——这是「计算」。一个token要经过几百亿次浮点运算。8万亿个token,就是8万亿乘以几百亿。这个数字大到什么程度?大到连DeepSeek自己都不敢把真实的电费账单贴出来——不是因为贵,是因为那个数字会吓到所有人。
GPU农场的真实面目
你可能在新闻里看过数据中心——一排排整齐的机柜,蓝光闪烁,看起来很科幻。但真相是:那里面不是服务器在安静地「思考」,是上万张显卡在全速运转,每一张都在70度以上的高温下工作。液冷系统24小时不停地把热量带走,冷却塔冒出的白烟在几公里外都能看到。一个中等规模的AI训练集群,一天的用电量大概相当于一个小型工厂一个月的用电量。而DeepSeek这样的全球级服务,背后可能是几十个这样的集群同时运转。更扎心的事实是:这些电,很大一部分来自化石能源。你问AI一个关于环保的问题,它回答你的时候,可能刚刚烧掉了一小勺煤。
Token经济学:为什么「免费」最贵
这就是有趣的地方了。DeepSeek对你是免费的。你随便问,随便聊,一分钱不收。但免费的东西,总得有人买单。谁来买单?一部分是投资人——他们赌的是未来。一部分是电网——电费账单最终会摊到每一个用电户头上。还有一部分是环境——碳排放没有计入任何人的账单。你每一次跟AI聊天产生的碳足迹,可能比你用搜索引擎搜索同样的问题高出几百倍。而搜索引擎是一个已经存在了二十多年、高度优化的成熟系统。AI聊天?它才两岁,还处在「先用最笨的办法跑起来再说」的阶段。这就像一个刚开始健身的人,动作还没学会,先把补剂吃到了职业选手的量。
效率革命正在路上,但没那么快
好消息是,AI行业已经意识到这个问题了。从大模型的「量化」到「蒸馏」,从专用推理芯片到更高效的注意力机制——过去一年,让AI做同样一件事的能耗已经降低了大约60%。但坏消息是,AI的使用量增长得更快。效率提升60%,使用量涨了200%——结果总能耗反而更高了。这叫「杰文斯悖论」:当某种资源的利用效率提高,人们反而会用它更多,最终总消耗不降反升。蒸汽机效率提高后,英国的煤用得更多而不是更少。AI也在走同一条路。你知道吗?你现在跟AI说一句话让它在后台算了三秒钟——那三秒钟消耗的能量,大概够你的手机亮一整天。
关于丢笔哥
丢笔哥不是一个具体的人——它是一种态度。在信息爆炸的时代,用最直白的语言,把硬核知识讲透。覆盖金融证券、AI 前沿、Web3、东方智慧。
一支笔丢在桌上,一堂课就此开始。
📬 订阅丢笔哥 →📖 继续阅读
🔗 Web3📬 不想错过下一堂丢笔课?
每周一篇硬核科普,用最好玩的方式讲最硬核的知识。
不卖课、不荐股、不画饼。
💬 讨论区