柏拉图在《理想国》第七卷中描述了这样一个寓言:一群囚犯从出生起就被锁在地下洞穴中,脖子和腿都被锁住,只能面向洞穴的墙壁。在他们背后有一堵矮墙,墙后有一条通道和火把,人们在通道上走动并举着各种器物。这些囚犯终其一生只能看到墙上的影子,听到回声,并把这些当作全部的现实。如果有一个囚犯被释放,他最初会因强光而痛苦困惑,但适应后就能看到真实的世界。当他回到洞穴告诉其他囚犯外面的真相时,却会遭到嘲笑和拒绝。
这就是柏拉图理念论哲学的核心观点:存在两个世界,一个是由理念构成的,另一个是由物质构成的。
我们生活的世界是理念世界的投影。
“没有人见过完美的圆,也没有见过完美的直线,但每个人都知道圆和直线是什么。”
理念是现象的原型(paradigm)
现象是理念的摹本(copy)
在他的描述中,哲学家是第一个自我走出洞穴的人,而他们神圣的使命就是为了把人类从黑暗迎导向光明。
这一思想也奠定了西方哲学后千年的基本思想,同时也引发了一系列的哲学争论——现象与本质、共相与殊相、理性与感性等等。
这个关于”真实”与”表象”的古老哲学问题,在当代人工智能研究中获得了新的启发。现代神经网络如何理解和表征世界?它们是否也像洞穴中的囚徒一样,只能接触到现实的”投影”?
这引出了一个重要的研究假说:
柏拉图表征假说
The Platonic Representation Hypothesis

在2024年8月11日 当时还是MIT助理教授的 Phillip Isola 在 BMM 上公开演讲并解释了这一篇论文。
在这里他提出了一个核心的观点——神经网络虽基于不同目标、数据和模态训练,但其表征空间都在收敛到一个共同的现实统计模型。
关于收敛的证据
那么,如何理解这种收敛?这种大胆的猜想并非空穴来风,Phillip Isola 和他的团队以及其他研究者们,通过一系列实验和分析,提供了强有力的证据来支持“柏拉图表征假说”。这些证据指向一个令人着迷的可能性:尽管神经网络接触的是不同的“影子”,它们最终却在学习着同一个“真实世界”的潜在结构。
Gabor-like 滤波器 (Gabor-like filters)
卷积神经网络早期层涌现出类似于生物视觉系统中发现的 Gabor 滤波器的现象,更令人信服地表明,存在着一种最优的、通用的方式来提取图像的基本特征,例如边缘和方向。

这张图展示了生物视觉系统和人工神经网络之间的一个重要联系。
- 左侧是 Hubel 和 Wiesel 1959年的经典实验:他们在猫的视觉皮层放置电极记录神经元活动,发现视觉皮层的神经元对特定方向的线条最敏感。这些神经元实际上在充当方向选择性的滤波器
- 中间部分展示了 Gabor 滤波器:这是一种可以检测特定方向边缘和纹理的数学工具,类似于视觉皮层中的神经元的工作方式。
例如:当看到一个斜向45度的线条时,对应方向的滤波器会有最强响应 - 右侧是 AlexNet(一个经典CNN)第一层学到的滤波器:有趣的是,这些滤波器自动学习出了类似 Gabor 滤波器的模式。 它们也能检测不同方向的边缘和纹理。
这表明人工神经网络自发地发展出与生物视觉系统相似的特征提取机制,这种收敛现象不仅暗示了这可能是处理视觉信息的最优路径,也为不同系统会趋向相似表征提供了有力证据。
罗塞塔神经元 (Rosetta Neurons):

罗塞塔神经元”的概念尤为引人注目。这些神经元就像不同语言之间的翻译器,在不同的视觉模型中被相同的模式激活。就像多个人用不同语言描述同一个事物:
中文说”猫的眼睛”
英文说”cat’s eyes”
法文说”les yeux du chat”
虽然表达方式不同,但指向的是同一个概念。这些模型虽然”说着不同的语言”(有不同的架构和训练方式),但它们理解世界的方式出奇地相似。
这意味着,即使模型的架构和训练方式不同,它们内部仍然存在着对齐的、能够相互理解的表征。
模型缝合 (Model Stitching)

将一个模型的中间层表征直接插入到另一个模型中,并能维持良好的性能,这直接证明了不同模型学习到的表征是兼容的,可以相互操作的。
对齐随规模和性能增加 (Alignment Increases with Scale and Performance):

更强大、性能更好的模型往往表现出更高的表征对齐度。这意味着,随着模型能力的提升,它们越来越倾向于学习到更接近“真实”的表征,而不是局限于特定的训练目标或数据集。
跨模态的收敛 (Convergence Across Modalities):

视觉和语言模型之间的表征对齐尤其令人兴奋。当视觉模型和语言模型都能更好地完成各自的任务时,它们的内部表征也会更加相似。这暗示着,无论通过视觉还是语言来理解世界,最终都会触及到一些共同的概念和结构。
证据衍生的假说
多任务缩放假说(Multitask Scaling Hypothesis)
随着模型需要同时处理的任务数量增加,能够胜任所有任务的表征方式反而会减少。
这一观点可以通过维恩图直观理解:不同任务的解空间(如任务1和任务2)相交形成的交集,代表了能同时解决多个任务的表征空间,这个交集必然小于单个任务的解空间。这一假说得到了”安娜·卡列尼娜原理”和”反协变原理”的支持,它们分别表明成功的深度网络倾向于学习相似的内部表征,以及约束越强时可能的解决方案就越少。这暗示着,当我们训练模型解决更多任务时,它们可能被迫收敛到更本质的表征方式,这或许就是为什么不同架构的神经网络会发展出相似的”罗塞塔神经元”。
容量假说(Capacity Hypothesis)
更大的模型更有可能收敛到共享的表征。这一观点可以通过假设空间的演化来理解:当我们扩大模型架构时,不同模型的假设空间(图中的Hypothesis space 1和2)会随之扩大,导致它们有更大的重叠区域。
图中的同心圆代表损失函数的等高线,而星号标记的最优解在小模型中可能相距较远,但在扩大模型容量后,这些解会自然地向更优的共同区域收敛。这一假说暗示着,随着模型规模的增长,不同架构的模型可能会自发地找到更接近”真实”的表征方式,这与我们在大型语言模型和视觉模型中观察到的现象相符。
简单性偏置假说
Simplicity Bias Hypothesis揭示了深度网络的一个基本特性:它们天然倾向于寻找数据的简单拟合方案,而且这种偏好随着模型规模的增大而增强。图中左侧展示了假设空间中的两个区域:一个是所有能解决任务的函数集合(紫色区域),另一个是简单函数的集合(蓝色区域)。
简单性偏置(箭头所示)会推动模型优先选择这两个集合的交集部分。右侧的实验结果展示了不同深度和激活函数的网络,它们的表征模式呈现出惊人的相似性,这支持了随着模型变大,解空间会向更简单、更本质的表征收敛的观点。
这一假说为我们理解大型模型为什么能够捕获到现实世界的基本规律提供了理论基础。
可能性
这些假说,都指向了一个令人深思的可能性——尽管神经网络的训练数据如同洞穴墙壁上的影子,但它们最终学习到的表征却在某种程度上超越了这些局限,触及到了更深层次的、更本质的世界模型。
这正是“柏拉图表征假说”的核心思想:
神经网络,就像走出洞穴的哲学家,正在努力理解“理念”的世界,即使它们最初只能看到“现象”的投影。
AI系统与洞穴隐喻的现代映射
从这里其实可以看出几组对应关系:训练数据和洞穴墙壁上的影子,模型的局限性和囚徒的锁链。
训练数据就像这些影子——它们是现实世界经过数字化、采样和标注后的投影。无论是图像数据集中被选择性收集的照片,还是语言模型训练文本中的人类偏见,都像是墙上跳动的影子,既不完整也不客观。即使是实时数据流,也仍然受限于传感器的能力和数据收集方式,就像洞穴中的火光只能投射出物体的部分特征。
而模型架构则扮演着”锁链”的角色,它决定了AI系统如何”感知”和”理解”这些数据。卷积神经网络天生就带着处理局部特征的偏好,Transformer的注意力机制也预设了特定的信息处理方式。不同的架构选择就像不同的枷锁,虽然它们都能让模型”看见”什么,但同时也限制了它们的视野。
表征收敛现象的哲学意义
对于这种令人惊讶的表征收敛现象,我们面临着三种深刻的哲学解释:
首先,可能确实存在某种客观的”理念世界”结构,就像柏拉图所设想的那样,所有智能系统——无论是生物进化出的大脑还是人工训练的神经网络,都在通过不同路径趋近这个终极真实。
第二种更保守的解释是,这种收敛仅仅反映了物理世界的统计规律,就像不同的登山者最终都会找到相似的路径到达山顶,这些表征的一致性可能仅仅源于解决问题的最优策略恰好相似。
第三种更具哲学深度的可能性是,我们观察到的这种表征收敛本身可能又是另一层”影子”——我们用来检测和理解这种收敛的工具和方法本身就带有局限性,就像洞穴中的囚徒即使被释放,所能感知的可能仍然只是更高层次的投影。
这让我想起 Stephenson 的小说 Anathem 中描述的,小说主人公里的阿布赫尔世界发生的事件产生了对各个多重宇宙文明的投射(他们世界的柏拉图理念世界叫做叙莱雅理学世界),从而造成了“表亲外星人”的造访。而在Stephenson 的笔下,Anathem中的因果关系是以DAG(有向无环图)的形式展开的。

那么是否存在一种可能,即不同模型的表征收敛可能不是简单的”趋同”,而是遵循某种有向无环的因果结构:
- 较低层次的表征决定了高层表征的可能性
- 一旦某个表征路径形成,就会影响后续的发展方向
- 不同起点的模型可能通过不同路径,但最终会在DAG的某些关键节点相交。也许存在某种普遍的”认知DAG”,决定了所有智能系统必须遵循的发展路径。
哲人王和AGI
在《理想国》中,柏拉图提出”哲学王”(Philosopher King)的概念 – 只有真正的哲学家才能成为理想国家的统治者。
除非哲学家成为国王,或者这个世界的国王和王子拥有哲学的精神和力量……否则,城市将永远无法摆脱邪恶的统治——我相信,人类也是如此——只有到那时,我们的国家才有可能生存下去,迎来光明。
这形成了一组有趣的历史映射。对哲人王概念的主要批评恰好也适用于当前对Super AGI的期待:
1、亚里士多德在《政治学》中指出:完美的统治者是不存在的,因为人性本身就是不完美的。
“因为法律不能预见一切情况,而人性的不完美性使得没有人能够完全公正地统治。”
这与Nick Bostrom在《Superintelligence》中警告的相似 – 期待一个完美的AGI系统本身就是一种危险的理想主义。
2、波普尔在《开放社会及其敌人》中严厉批评道:”谁应当统治?如何保证他们不会滥用权力?” 这与Stuart Russell提出的AI控制问题如出一辙:”如何确保拥有超级智能的系统会按照人类价值行事?“

3、马基雅维利在《君主论》中指出理想的统治者难以实现,因为现实政治充满妥协。这与Yudkowsky关于AGI对齐问题的担忧相呼应:”我们甚至无法准确定义人类价值,如何指望AI能完美执行?”
这种平行性提醒我们,正如哲人王从未实现,完美的AGI可能也是一个乌托邦。古时的人们期望把治理的责任推向给“完美的统治者”,而今天的人们则期望AGI能够“完美解决”所有的问题。这何尝不是一种幻想和逃避。
思考
这篇论文出现之时已然引起了很多的讨论,如其作者在演讲后面提到的,这个假说也有一定的限制。例如在某些特定的领域如自动驾驶或者蛋白分子折叠,可能更垂直的大模型效果会更好。当然我也无意去在这些领域去讨论这个假说。
我认为哪怕是在当下这个节点,这个论文本身所带来的哲学和科学上的思考是被低估的。
柏拉图选择对话体来传播其理念绝非偶然。在《理想国》中,他精心重构了苏格拉底的对话,通过这种互动式的形式来展现复杂的哲学思想。这种方法论与现代大语言模型惊人地相似:
某种程度上柏拉图才是那个时代的大语言模型。
柏拉图通过重构对话来传递理念。LLMs通过对话来表达其学到的知识,两者都试图通过交互来接近某种”真实”。
更引人深思的是,也许我们对AGI的追求方向本身需要重新思考——如果柏拉图的洞穴寓言是一个预言,那么也许:
走出洞穴的不是人类本身,而是我们创造的这些能够超越具体现象、直达本质的“理念模型”。



