← 返回AI 前沿
AI 前沿

老师有没有告诉你,AI 看懂一张图不是「看见了」——是它偷偷给你看不见的东西配了一句解释

2026-10-01 · 🕐 约 9 分钟

由 丢笔哥 发布

🖊️ 老师有没有告诉你…

老师有没有告诉你,AI 看懂一张图不是「看见了」——是它偷偷给你看不见的东西配了一句解释

「啪——老师把笔丢在桌上。」

今天我不讲代码,也不讲参数。我就问你一件事:你手机相册里输入「沙滩」两个字,照片唰地全出来了。你觉得,手机是「看见」沙滩了吗?

老师有没有告诉你——它没有看见任何东西。它做的事情,比「看见」要笨得多,也聪明得多。

一、先承认一个事实:AI 面前的世界,只有数字

我们得先把一个误会拆掉。你以为 AI 看到的是一张照片:有蓝天、有海浪、有个小孩在跑。

不是的。它看到的是一大堆数字。一张一千二百万像素的照片,在它眼里就是一亿多个数字,每个数字代表一个点的红绿蓝强弱。它不知道什么叫「蓝天」,它只知道第几行第几列那个点的蓝色数值偏高。

文字那边也一样。你打给它一个「海」字,它拿到的也不是「海」这个意思,是一个编号。字和它代表的东西,在 AI 这里从来没有直接连过。

所以第一个问题就来了:一边是一堆数字,一边是另一个编号,AI 凭什么知道它们说的是一件事?

这是 AI 发展史上最难、也最漂亮的一个问题。

二、2021 年,有人想了一个特别笨、又特别妙的办法

2021 年,一家研究机构做了一个方法,名字很长,核心思路却可以用一句话讲完:

不要教它「这是什么」,只要教它「谁和谁是一对」。

具体怎么做的?他们从互联网上收集了大约四亿组「图片 + 配文」。注意,不是请人一张一张去标注——是直接抓取网页上本来就写着的说明文字。四亿组,这个数字本身就很吓人:就算全世界的人排队看,一天看一张,也要一百多万年。

然后,他们让 AI 玩一个配对游戏。

一次给它看几张图和几句话,让它在里面找「哪句话配哪张图」。它一开始是乱猜,猜错就纠正,反复练。

关键在哪?关键在它猜错的时候,被迫做的事情。 它不光要知道「这张图和这句话是一对」,还必须在同一批里,把不配的那些也区分开。也就是说,它每一次都在被逼着回答:这张图,为什么和那几句话不像?

四亿组,每一组都在被问一次「像不像」——它练习的次数,比一个人一辈子看过的所有图加起来还多几万倍。

三、它到底学会了什么?——一套看不见的坐标

练到最后,它其实学会的是一件很朴素的事:

把图和字,翻译到同一个「坐标系」里去。

你可以理解为,它建了一张巨大的地图。地图上每一个点,代表一句话,或者一张图。如果一句话和一张图说的是一回事,它们就被放到地图上挨着的地方。如果说的完全不是一回事,就被放得远远的。

「图片」和「文字」原本是两套完全不通的语言,它做的事情相当于当了两套语言的翻译——不管你说哪一边,它都翻译到同一张地图上,然后比距离。

所以当你在相册里输入「沙滩」的时候,它做的事情其实是:把你输的这两个字,翻译成地图上的一个点,然后去照片堆里找,哪张照片翻译出来的点,离它最近。

最近的,就拿出来给你看。

它从头到尾没有「看见」任何东西。它只是在一张很大的地图上,量距离。

四、这件事为什么值得你警惕

现在说关键的。这个方法有一个天生的毛病,而且它跟你我每天都会踩。

它只学「什么和什么一起出现」,不学「为什么」。 四亿组图文的来源全是网络。而网上的图文是带偏见的。

有研究做过实验:让这类模型在大量网络图文上练完,再让它看图猜职业。结果——图里的人在厨房,它更容易猜成女性;在电脑前,更容易猜成男性。它没有「歧视」这个想法,它只是忠实地记录了一个事实:互联网上,写厨房照片的配文里,女性出现的比例更高。 它把这个「一起出现的规律」原样搬了过来。

这就是这个方法的两面。它是 AI 里第一个真正把「看图」和「说话」缝在一起的零件,是我们今天所有图片识别、搜图、以图搜图、以及生成图片背后都要用的地基。但它缝的方式,是从互联网的现有文本里学来的。

你给它什么世界,它就照抄什么世界的规律。

五、一个马上可以用的判断法

下次你用手机的识图功能,或者用 AI 描述一张图,你可以这样试:

第一,拿一张它一定没见过的东西。 比如你家里一个很偏门的小摆件、一个手写的字条、一张有本地特色的老照片。看得准不准,才是它真实水平。看得准的,多半是常见的、网上成千上万出现过的;看不准的,通常是稀有的、网上没人写过的。

第二,故意给它一张有歧义的图。 比如一个人背影站在厨房里。看它猜什么。它的答案会很诚实,因为那个答案不是它「想」出来的,是那张地图上最近的一个点。

第三,问它「你为什么这么判断」。 它通常给不出真正的理由——因为根本不存在一个理由,只有一个距离。

六、最反直觉的一点

你觉得 AI 能认图,是因为它像人一样,先看见了,然后理解了。

完全相反。它不是先理解再配对,是先配对了无数次,才「看起来像理解」。

这跟我们学外语很像——你小时候学「苹果」这个词,不是先理解苹果是什么,是妈妈指着苹果说了很多遍,你把那个声音和那个东西对上了。区别在于,AI 对了几亿次,而你只对了几千次。次数不同,但机制是同一个。🤔

理解了这一点,你就不会再迷信它「什么都看得懂」。它看懂的,永远是它被教过要配对的东西。没被配对过的,它一样是瞎的——只是它不会告诉你它瞎。

小测验

1. AI 是怎么学会把一张照片和一句话对上的?
① 它先学会认图再学认字 ② 它把图和字都变成坐标,看两点离得近不近 ③ 人工给每张图写好了标签 ④ 它天生就会

2. 判断 AI 学得好不好,不看它单认图或单认字准不准,看什么?
① 看模型有多大 ② 看它能不能把正确的图和人话配上对 ③ 看它跑得快不快 ④ 看它会不会说话

3. AI 说「这是一只猫」,它实际在做什么?
① 在描述它真实的感受 ② 在比谁离得近 ③ 在回忆见过的猫 ④ 在推理

答案:②、②、②。第一题,它的核心动作是翻译到同一个坐标系比距离;第二题,配对能力才是它真正的本事;第三题,它没有「感受」,只有「最近的那个点」。

「啪——老师把笔丢在桌上。」

记住这句话:AI 不是把图看懂了,是在一亿张图和几亿句话里,找到了离你最近的那一个配对。 明白这一点的人,不会高估它,也不会怕它——他会知道该在什么时候信它,什么时候自己再看一眼。

🧠 课后小测验

读完文章,测测你记住了多少?
点击选项,看看对不对

Q1.AI 是怎么学会把一张照片和一句话对上的?
Q2.判断 AI 学得好不好,不看它单认图或单认字准不准,看什么?
Q3.AI 说「这是一只猫」,它实际在做什么?
🖊️

关于丢笔哥

丢笔哥不是一个具体的人——它是一种态度。在信息爆炸的时代,用最直白的语言,把硬核知识讲透。覆盖金融证券、AI 前沿、Web3、东方智慧。

一支笔丢在桌上,一堂课就此开始。

📬 订阅丢笔哥 →

📖 继续阅读

📈 金融证券
老师有没有告诉你,央行「印钱」的时候——印钞机根本没开过
你脑中「央行印钱」的画面大概是这样:行长一拍桌子,「开机!」然后印刷厂的机器轰隆隆转起来,一车一车的钞票运出去。来,把这个画面从你脑子里删掉。真实的「印钱」,连一张纸都不需要。
📈 金融证券
老师有没有告诉你,银行给你算的每一笔账——用的都是「明天」的秤
01-道可道非常道-老子看透AI

📬 不想错过下一堂丢笔课?

每周一篇硬核科普,用最好玩的方式讲最硬核的知识。
不卖课、不荐股、不画饼。

💬 讨论区