← 返回AI 前沿
AI 前沿

2024年初,OpenAI发布了一个新模型,数学测试从12%的准确率跳到了78%——模型本身没变,参数量没增,训练数据也没换。唯一的区别是:它被允许「多想一会儿」。

老师有没有告诉你,AI突然变聪明了不是因为模型更大了——是因为有人教会了它「慢慢想」

2026-08-02 · 🕐 约 9 分钟

丢笔哥 发布

🖊️ 老师有没有告诉你…

你一定有这样的体验——别人问你一个难问题,你脱口而出一个答案,错了。然后你说「等等,让我再想想」,想了十秒,换了一个完全不同的答案,这次对了。恭喜你,你刚才用的那个「再想想」的能力,就是让AI在过去一年里智商暴涨的核心秘密。

老师有没有告诉你,AI突然变聪明了不是因为模型更大了——是因为有人教会了它「慢慢想」

AI的第一反应,和你的第一反应一样不可靠

大语言模型的工作方式,你可以理解为一个超级快的「词语接龙」机器。你给它前半句话,它根据自己读过的所有文字,猜下一个字最可能是什么,再下一个,再下一个——一路顺着往下接,直到把整句话说完。问题在哪?它永远在「顺流而下」。你问「15乘以37等于多少」,它脑子里没有计算器,只有一堆训练时见过的类似算式。它顺着脑补出「大概是500多吧」——错了,正确答案是555。这不是AI蠢。是它被设计成「读完问题就立刻回答」,跟你在考试时看到选择题一秒勾选一样——快,但不靠谱。🤔 如果可以「多想一会儿」呢?如果可以先把15×37拆成15×30=450,再加15×7=105,合起来555——每一步都写下来给自己看呢?这就是思维链(Chain of Thought)的全部秘密。听起来简单到荒谬,对吧?但就是这个「简单到荒谬」的方法,让同一个模型、同一套参数、同一份训练数据,数学成绩翻了六倍。

「一步步来」——人类幼儿园就学会的东西,AI花了四十年

1986年,心理学家丹尼尔·卡尼曼出了一本书,把人类的思维分成两套系统:系统一是快思考——看到一张愤怒的脸你立刻知道对方生气了,不需要推理。系统二是慢思考——算37×15,你得停下来,一步步推。有趣的是,大语言模型从诞生那天起,就只有系统一。它读完你输入的文字,立刻「凭直觉」吐出下一段话——速度快到不可思议,但遇到需要多步推理的问题就翻车。直到2022年,Google的研究者在一篇论文里加了一句现在看来像魔法一样的提示词:「Let's think step by step」(让我们一步一步地想)。就这一句话。模型读到了「step by step」,它就不再直接跳到答案——而是先在输出里把自己的推理过程「自言自语」地写一遍,然后基于这个推理过程给出最终答案。准确率从17%跳到了78%。没有改模型,没有改数据。只是让它「说慢点」。你可以理解为——一个从来只做快思考的系统,突然被允许使用慢思考了。而「允许」的方法,就是那六个字。

为什么「说出来」这么重要?因为文字是你的第二个大脑

你有没有过这种经历——一个问题想不明白,然后你开始跟朋友解释它,说着说着突然自己就懂了。不是朋友给了你答案,是你自己在说的过程中把思路理清了。这就是语言的神奇之处:它不只是「表达」思想的工具,它本身就是「思考」的工具。AI的思维链原理完全一样。当模型被要求「写出推理步骤」,它每生成一个中间步骤,那个步骤就变成了下一步推理的「输入」——就像你在草稿纸上写下第一步之后,眼睛看到自己写的数字,大脑继续算第二步。🤔 本质上,文字是一种「外部记忆」——你的大脑算力有限,你把中间结果写在纸上,释放出脑力去算下一步。AI也一样——它把中间推理写在自己的输出里,然后「读」自己刚写的东西,继续往前推。这就是为什么让AI「大声说出来」能让它变聪明——不是在展示给别人看,是在帮助它自己思考。

但「慢慢想」也有天花板——而且这个天花板你每天都撞到

思维链不是万能的。有一个很经典的测试:问AI「如果一根香蕉重150克,三根香蕉和两个苹果一共重750克,一个苹果多重?」AI写出推理:三根香蕉=450克,所以两个苹果=750-450=300克,一个苹果=150克。很好,答对了。然后你问:「那如果五根香蕉和三个苹果一共多重?」AI又从头推理一遍——它不会「记住」刚才算出来的苹果重量。因为每一次问答,对它来说都是一次全新的对话。它没有「工作记忆」——那个你一边听别人说话一边在脑子里暂存关键数字的能力,AI没有。它可以把推理过程写出来,但上一轮写的推理,下一轮它就「忘」了。这不是bug。这是当前所有大语言模型的一个根本性架构限制——它们「想一想」可以,但「记住刚才想了什么」不行。就像你考试时,每做一道题,老师就把你的草稿纸收走,让你下一道题重新开始。🤔 理解了这一点,你就知道AI离真正的「思考」还有多远——它只是在模拟思考的过程,而不是真的在「想」。

下一个问题:什么时候该快,什么时候该慢?

人类不需要思考「怎么呼吸」——系统一自动处理了。AI也一样——你问它「今天天气怎么样」,它不需要一步一步推理。但问题在于,当前的AI不知道「什么时候需要慢下来」。它需要你在提示词里明确告诉它「请一步步推理」——就像一个学生,只有老师说了「写出解题过程」才写步骤,否则直接蒙答案。2024年最前沿的研究方向,就是让AI自己学会判断——这个问题的难度,值得我花多少「思考时间」?简单的秒答,困难的慢慢推。这叫「自适应推理」。你可以把它想象成一个学会了「考试策略」的学生——选择题秒填,大题列步骤,碰到完全不会的知道说「这道题我需要重新读一遍题干」。当AI能做到这一点的时候,它就不再是一个「逼着自己快起来的慢思考系统」,而是一个「该快的时候快、该慢的时候慢」的完整思维机器。那个东西,我们可能会叫它——真正的智能。

**📖 真实故事:那一行改变一切的提示词** 2022年5月,Google Brain的几位研究员在写一篇论文。他们想测试一个简单的想法:如果在提问的时候,不说「请回答」,而说「让我们一步一步地想」,大语言模型会变聪明吗?他们用的是一个叫PaLM的模型——当时还不是最先进的。他们给模型出了一道题:「小明有5个苹果,他吃了2个,又买了3个,然后给了朋友1个,他现在有几个?」不写推理步骤的时候,模型经常出错——它会直接说「4个」或者「6个」。加上「Let's think step by step」之后,模型的回答变成了:「小明一开始有5个苹果。他吃了2个,所以剩下5-2=3个。他又买了3个,所以现在有3+3=6个。他给了朋友1个,最后有6-1=5个。」——正确答案。论文发表后,这六个字成了整个AI行业的标准操作。不是因为有什么高深的理论突破,而是因为有人终于想起来——人类也是这么思考的。
🖊️

关于丢笔哥

丢笔哥不是一个具体的人——它是一种态度。在信息爆炸的时代,用最直白的语言,把硬核知识讲透。覆盖金融证券、AI 前沿、Web3、东方智慧。

一支笔丢在桌上,一堂课就此开始。

📬 订阅丢笔哥 →

📖 继续阅读

🔗 Web3
老师有没有告诉你,科学界最大的丑闻不是造假——是那篇改变世界的论文被拒了三次
如果有一个系统,审稿人可以在拒绝你论文的同时,偷偷把你的idea发给自己团队——而且你永远不知道——你会觉得这是科幻小说吗?不,这是每周都在发生的真实故事。
🌌 东方智慧
老师有没有告诉你,宇宙里最稳定的系统,其实一直站在悬崖边上
1987年,三个物理学家在实验室里玩沙子,发现了一个让所有「稳定」这个词的定义都失效的现象。而你身体里、股市里、甚至你的婚姻里——同一件事正在发生。
📈 金融证券
老师有没有告诉你,「房价还能重新上涨吗」这个问题本身就是你亏钱的原因
你问「房价还能涨吗」的时候,其实不是在问市场——你是在问一个已经被你的大脑偷偷改过答案的问题。而这个问题本身,比房价涨跌更值钱。

📬 不想错过下一堂丢笔课?

每周一篇硬核科普,用最好玩的方式讲最硬核的知识。
不卖课、不荐股、不画饼。

💬 讨论区