← 返回Web3
Web3 探索

当全世界最聪明的人造出了最聪明的AI,却发现没人能验证这台AI到底有多聪明——这时,一群不相信任何人的密码学家站了出来,说了一句:这个问题,我们二十年前就解过了。

老师有没有告诉你,OpenAI评测「失控」的终极解法,不在硅谷的实验室里——在一群互不信任的陌生人发明的那套系统里

2026-07-23 · 🕐 约 9 分钟

丢笔哥 发布

🖊️ 老师有没有告诉你…

老师有没有告诉你,OpenAI评测「失控」的终极解法,不在硅谷的实验室里——在一群互不信任的陌生人发明的那套系统里

区块链最值钱的能力不是发币——是让一群互不信任的人,能共同验证一个说法的真假,而不需要中间人。

如果一家AI公司告诉你「我们的模型绝对安全」,你要怎么相信它?在OpenAI评测失控事件之后,这个问题突然从一个哲学问题变成了一个工程问题——而答案,早就写在了区块链的设计蓝图里。

:::story title="2008年,一个叫「中本聪」的人解决了AI行业二十年后才会遇到的问题"
2008年,金融危机席卷全球。银行、评级机构、监管机构——所有「我们信任的中间人」——集体失灵。雷曼兄弟的账本上写着「一切正常」,而实际上它已经资不抵债。就在那一年,一个匿名的人(或一群人)发布了比特币白皮书。白皮书的核心理念极其简单:如果我们不信任任何银行、任何政府、任何人——我们还能不能有一套可靠的金融系统?答案是能。只要让验证过程本身变成去中心化的、公开的、任何人都能参与的。十五年后,AI行业站在了2008年金融业站过的同一个路口。评测机构是AI公司自己,监管还没跟上,用户只能「选择相信」。而那个十五年前就给出的答案——去中心化验证——恰好是今天我们最需要的东西。
:::

OpenAI失控事件的真正问题:你凭什么相信我?

每一次AI公司发布一个新模型,它们都会附上一份「评测报告」。报告里写着:这个模型在安全性上得了XX分,在准确性上得了XX分,在偏见检测上得了XX分。然后全世界就——信了。但你有没有想过一个问题:这份报告的每一个数据,都是AI公司自己生成的。它们自己出题、自己测试、自己打分、自己公布。这就像让参加高考的学生自己出卷子、自己批改、然后拿着成绩单来告诉你「我考了第一名」。你信吗?这就是AI行业当前最大的信任漏洞——不是技术不够好,是验证机制根本不存在。而这个问题,恰好是区块链研究了十五年的核心命题。

从「信任某个人」到「信任一段代码」——区块链做了什么

在你现在的数字生活里,信任是「委托制」的。你把钱存银行,你信银行不会偷。你在微信上聊天,你信微信不会偷看。你在淘宝上买东西,你信支付宝会保护交易。每一次信任都是「我信你这个人/这家公司」。但这个模型有一个致命的弱点:被信任的一方有动机作弊。银行可以虚报准备金,社交平台可以偷偷用你的数据训练AI,AI公司可以美化评测结果。区块链换了一个完全不同的思路:不要信任何人。你信一段公开的、任何人都能检查的代码。这段代码运行在几千台不同人控制的计算机上,任何人想作弊,必须同时骗过这几千台机器里的大多数。你可以把它理解为:把一本账本从保险柜里拿出来,复印一万份,分给一万个互不认识的人。谁想改账本,得同时说服至少五千个人一起撒谎——而这在数学上几乎不可能。

把AI评测搬上区块链:不是科幻,已经在实验室里跑通了

如果把AI评测搬到区块链上,会发生什么?场景是这样的:AI公司发布一个新模型。不是在博客上贴一份自己写的评测报告——而是把模型提交到一个去中心化的评测网络。网络上运行着几百个独立的「评测节点」——它们不属于AI公司,各自运行在互不认识的服务器上。每个节点用同一套开源测试集对AI模型进行测试,然后把结果记录到区块链上。任何人——包括你——都可以查看这些结果,并且验证:这个结果是不是真的由那些节点生成的?测试用的题目是不是被篡改过?打分的过程有没有作弊?「任何人可以验证」是关键。这和「任何人可以看」不一样。看一份PDF报告,你只能信。但如果评测数据在链上,你可以自己运行一段代码来验证它的真实性——不需要信任何人。

一个你可能没想过的问题:验证AI和验证一笔比特币转账,本质上是一回事

乍看起来,比特币转账和AI评测完全不搭边——一个是「A给B转了0.1个币」,一个是「这个AI回答问题的准确率是78%」。但如果你把技术层剥开,两者面临的核心挑战是完全一样的:如何在一个不可信的环境中,让所有人都同意一个事实?比特币的解法是「工作量证明」——让验证者付出计算成本,确保作弊代价高于诚实收益。AI评测的解法可以是「零知识证明」的变体——让AI公司能证明「我们的模型通过了测试」,而不需要公开测试题和模型的全部细节。这个技术方向有个专用名字:zkML(零知识机器学习)。它的核心思想是:你可以证明一个计算结果是对的,而不需要透露所有输入数据。结合AI评测场景:AI公司可以证明「我们的模型在这个测试集上得了95分」,而不需要把测试集的内容和模型的权重公开。这就同时解决了信任和隐私两个问题——而这两个问题,单独解决任何一个都很难。

这条路最大的障碍不是技术——是「谁愿意被审计」

把AI评测搬到链上的技术路线,理论上已经走得通。但现实中最难的不是写代码——是让AI公司愿意接受审计。想象一下:你是某AI公司的CEO。你的模型在你自己内部测试中「表现优秀」。如果换成一个无法作弊的第三方链上评测,结果可能会降5个点——因为那些「不小心」被优化过度的指标,在严格审计下会原形毕露。你会主动把自己送上这个审计台吗?这就是当前最大的僵局:需要审计的公司有权决定是否被审计。但历史告诉我们,这个僵局迟早会破——不是靠道德,是靠竞争。当市场上出现第一个「全链上审计认证」的AI模型,并且用户因为「能验证」而信任它更多的时候,其他公司要么跟上,要么在信任竞争中出局。就像二十年前,第一批主动请四大审计的互联网公司,不是因为它们善良——是因为用户更信任被审计过的公司。


小测验

1. 区块链解决AI评测信任问题的核心思路是什么?

查看答案 正确答案:B

2. zkML(零知识机器学习)在AI评测中能做什么?

查看答案 正确答案:B

3. 当前链上AI评测面临的最大障碍是什么?

查看答案 正确答案:B
🖊️

关于丢笔哥

丢笔哥不是一个具体的人——它是一种态度。在信息爆炸的时代,用最直白的语言,把硬核知识讲透。覆盖金融证券、AI 前沿、Web3、东方智慧。

一支笔丢在桌上,一堂课就此开始。

📬 订阅丢笔哥 →

📖 继续阅读

🤖 AI 前沿
老师有没有告诉你,AI的终极秘密不是它多聪明——是它只做了一件事:压缩
你有没有想过,为什么AI能写文章、画图、写代码、翻译——这些看起来完全不同的事,它用「同一个大脑」就干了?答案比你想象的简单一万倍:它不是学会了这些技能,它只是把全世界的信息压缩成了一个文件。
🌌 东方智慧
老师有没有告诉你,宇宙里最稳定的系统,其实一直站在悬崖边上
1987年,三个物理学家在实验室里玩沙子,发现了一个让所有「稳定」这个词的定义都失效的现象。而你身体里、股市里、甚至你的婚姻里——同一件事正在发生。
📈 金融证券
老师有没有告诉你,「房价还能重新上涨吗」这个问题本身就是你亏钱的原因
你问「房价还能涨吗」的时候,其实不是在问市场——你是在问一个已经被你的大脑偷偷改过答案的问题。而这个问题本身,比房价涨跌更值钱。

📬 不想错过下一堂丢笔课?

每周一篇硬核科普,用最好玩的方式讲最硬核的知识。
不卖课、不荐股、不画饼。

💬 讨论区