你有没有发现,过去一年发布的AI模型,名字越来越长、参数越来越多、跑分越来越高——但你能用它们做的事,和去年一模一样?这个问题的答案,藏在一个你绝对不会联想到的场景里:一筐螃蟹。
老师有没有告诉你,AI行业也有一筐螃蟹——而且它们把自己困在了一个所有人都假装看不见的桶里
2026-08-05 · 🕐 约 6 分钟
由 丢笔哥 发布
今天的热搜上有一个心理学名词:「螃蟹效应」——一筐螃蟹不需要盖子,因为只要有一只想爬出去,其他的就会把它拽回来。你肯定觉得这是在说职场里的人性。但我要告诉你一个反直觉的事实:全世界最聪明的一群人,正在用最聪明的方法,在一只桶里互相拽——而且他们自己完全不知道。
AI的「螃蟹桶」长什么样?它叫排行榜
全世界有几百个AI模型评测排行榜,最有名的一个叫MMLU——它是一套包含了57个学科的选择题试卷,从数学到法律到哲学。每家大模型公司发布新产品的时候,都会宣布自己在MMLU上的分数又提高了几个百分点。听起来很正常对吧?就像高考提分一样。但你仔细想:如果全世界的大学都只考同一套试卷,而且这套试卷的题目从2020年就没变过——那清华北大的高材生和一台会刷题的机器有什么区别?AI行业现在就困在这个逻辑里:所有公司都在优化同一套考题的分数。排行榜就是那个桶——它定义了「什么算聪明」。而「什么算聪明」这个定义一旦被人为缩窄到一套选择题,整个行业就自动进入了螃蟹模式:你提一分,我提一分,表面上看大家都在进步,实际上谁也没爬出桶。你还在做和去年一模一样的事——聊天、写摘要、翻译。
「参数多就是好」——这是AI界最大的抓握反射
螃蟹的抓握反射是「上方有物体→拉下来」。AI行业的抓握反射有三个版本。版本一:参数多就是好——从70亿到700亿到7000亿,数字越来越大。但你知道吗?就像一个足球队,前锋确实重要,但把十个梅西放在场上反而会输——因为他们全都在抢球。模型也一样,参数堆到一定程度以后,增加的每一层都在做同一件事:背诵更多「标准答案」。版本二:数据多就是好——从10TB到100TB到1PB,恨不得把整个互联网都喂进去。但互联网上的知识99%都是重复的、矛盾的、过时的。你以为你在喂它「知识」,其实你在喂它「噪音」。版本三:算力多就是好——GPU从1000块到10000块到100000块。但算力的边际收益正在断崖式下降:最新一代模型的训练成本翻了十倍,智力提升不到10%。三根手指一起抓,AI行业把自己死死按在了桶底。不是不想爬出去——是抓握反射不允许。
螃蟹桶的底层逻辑:所有人都在回答同一个问题
这就引出了一个更深的洞见:AI行业的问题不在于技术路线,而在于「问题」本身。当全世界最好的AI研究员都在努力回答同一个问题——「怎样才能在排行榜上再提一分」——的时候,就没有人在问:「这个排行榜到底在测什么?」实际上,MMLU之类的测试擅长衡量一种能力:从大量已知答案中找到最接近的匹配。这其实不是「理解」,这是「检索」。真正的智能——比如理解一句讽刺,从两件看起来没关联的事里找到隐藏的共同点,在信息不够的时候做出一个合理的跳跃——这些能力在选择题里根本测不出来。你以为你在看AI的智商,其实你在看一本词典的背诵成绩。而整个行业每年烧掉几百亿美元,就为了把词典背得更好一点。螃蟹们忙得不得了,桶纹丝不动。
爬出来的唯一方法:换一个桶
那么有没有不在桶里的AI?有。2024年诺贝尔化学奖颁给了AlphaFold——一个预测蛋白质结构的AI。它不参加任何排行榜,不在乎MMLU成绩,甚至不会跟你聊天。它只做一件事:解决一个以前人类要花几年才能解决的问题,现在几分钟。这才是从桶里爬出去的姿态:不是在一个已有的「更聪明」定义里卷到死,而是重新定义「什么叫有用」。同样的故事发生在天气预报领域、新材料发现领域、药物分子设计领域。这些AI的共同点是什么?一、它们不参加任何基准测试比赛。二、它们有明确的外部世界验证——不是选择题对答案,而是实验室里的真实结果。三、它们不是在「回答」问题,而是在「发现」新的问题。换桶的方法从来不是把钳子伸向旁边的螃蟹——是抬头看,桶外面还有一个世界,而且那个世界没有盖子。
关于丢笔哥
丢笔哥不是一个具体的人——它是一种态度。在信息爆炸的时代,用最直白的语言,把硬核知识讲透。覆盖金融证券、AI 前沿、Web3、东方智慧。
一支笔丢在桌上,一堂课就此开始。
📬 订阅丢笔哥 →📖 继续阅读
🔗 Web3📬 不想错过下一堂丢笔课?
每周一篇硬核科普,用最好玩的方式讲最硬核的知识。
不卖课、不荐股、不画饼。
💬 讨论区