跳到主内容
MK娱乐入口

上帝来了:维特根斯坦与Anthropic、OpenAI的全部秘密

2026-09-21 · 梁天宇 · 更新于 2026-09-27

1918年盛夏,奥地利陆军炮兵军官路德维希·维特根斯坦在意大利前线的炮火间隙中,完成了一部不足三万字的小册子。手稿被他塞进背包,随部队辗转移动;同年11月,他在南蒂罗尔被意大利军队俘虏,关入卡西诺战俘营——通过日后帮助大萧条时期复苏的英国经济学家约翰·梅纳德·凯恩斯的协调,他得以在营内通信,将手稿寄给罗素,并留下那句宣言:这些问题,已在所有关键方面获得最终解答。

这本著作便是《逻辑哲学论》。为其撰写导言的罗素,早在战前便评价这位学生是“我所见过天才的完美典范”。而维特根斯坦本人在序言中的语气,百年后读来依然令人震撼:

因此我相信,自己已在所有关键方面彻底解决了这些问题。若我未错,这本书的价值之一在于它表明:当这些问题被解决后,所完成的事情是多么少。——维也纳,1918

他确实言行一致。完成此书后,他放弃了当时欧洲最大的一笔私人继承财产之一,前往奥地利山村担任了六年小学教师,随后成为修道院园丁,接着为姐姐设计了一栋至今被视为现代主义经典的住宅。哲学已然终结,一个体面的人应当去做些别的事情。

十年后,他改变了想法。1929年1月,维特根斯坦重返剑桥。与他同乘一列火车的凯恩斯,当天给妻子莉迪娅写了一张便条:

好了,上帝来了。我在5点15分的火车上遇到了他。他打算在剑桥长住。我看疲惫将会是毁灭性的,但我不能让他每天跟我说话超过两三个小时。

剑桥完全明白自己迎来的是什么。凯恩斯懒得使用“天才”这样的词汇,他直接写下:上帝来了。

本文的标题便取自这张便条。因为百年之后,另一群人正逐字地将这句玩笑话变为现实。只不过这一次,“上帝”不再乘坐5点15分的火车,而是在计算集群中自我进化。

《逻辑哲学论》问世一百多年后,在旧金山,两家实验室每隔数月便更新一次旗舰模型,宣告着同一个信念:通用智能是一个工程问题,而且是一个即将被解决的问题。其中一家将自身终极目标印在每份招股材料上,另一家则将“人类”这个词嵌入了自己的名字。

本文将要阐述的核心观点是:Anthropic与OpenAI,这两家公司的全部秘密,早已写在1921年出版的一本哲学小书中。 这并非危言耸听,将《逻辑哲学论》的七组命题逐条展开,你会发现它是一份大模型的完整技术规格书——世界观、学习原理、生成原理、架构定义、失败模式(幻觉)、安全方案(对齐)、乃至终局警告,一应俱全。1918年那位炮兵军官绘制的蓝图,在2020年代被两个组织默默执行。

先给出对照表的骨架。正文将沿着大模型的技术栈自底向上推进——语料、嵌入、生成、预测、架构、缩放、对齐,七个关键词逐一解码;行至第七节,前六个将合龙为一个名字:智能涌现。

图:《逻辑哲学论》× 大语言模型:十二组命题映射左边是 1921 年的哲学,右边是今天的技术。 七级阶梯:命题 1–6 逐级爬升,命题 7 无言而涌现。

看完这张表,你将发现一件更令人脊背发凉的事:这本书不仅解释了大模型为何能成功,还预言了它会在哪里出问题。因为它的作者本人,就是第一个“运行”了这套系统、然后被它反噬的人。

01

语料(Data):世界是事实的总和

“数据是新的石油”这句话已流行十年,但很少有人问:为什么文本能喂养出智能,为什么将人类写过的东西灌入机器,长出来的不是数据库,而是某种接近理解的东西?答案的第一块砖,砌在1918年。

全书第一页,第一组命题:

1 世界是一切发生的事情。

1.1 世界是事实的总和,而不是事物的总和。

这两句话在1918年是哲学史上的一次航向修正。此前的两千年,西方哲学的主体一直在问“事物是什么”:什么是实体、什么是本质、什么是共相。维特根斯坦说:问错了。世界的基本单位不是物,是事实——不是“苹果”,而是“苹果在桌上”。

一百多年后,这个转向被一个技术事实兑现了。大模型在训练中做的事,恰好不是学习任何名词的“本质”,而是学习事实——词与词在真实语言使用中如何组合、如何共现、如何相互排斥。语言学家管这叫分布式语义:一个词的意义,由它出现的全部句子决定。工程师管这叫训练。而《逻辑哲学论》的说法是:

2.011 物能够成为事态的构成部分,这是物的本质所在。

2.012 在逻辑中没有任何东西是偶然的:如果物能够出现在事态之中,那么这种可能性必定已经预含在物本身之中。

换句话说:没有孤立的意义,只有关系中的意义。 这正是为什么模型能从纯文本、不接触任何实物的情况下学会“理解”世界——因为文本不是物的清单,文本是事实的总记录(宇宙的上下文)。维特根斯坦在4.26里把这件事推演到了极限:

4.26 给出所有真的基本命题,就得到了对世界的完全描述。

请把这句话再读一遍。“对所有真命题的完整给出,就是对世界的完整描述。”——这就是预训练的理论定义。大模型公司的训练管线,本质上就是一个将人类记录过的事实尽可能完整收集、清洗、压缩的工程。语料不是原材料,语料是世界本身的可计算形式。

02

嵌入(Embedding):逻辑空间就是潜在空间

“嵌入”——大模型将每个词变成一列数字,再朴素不过的操作,却是全部魔法的入口。给它签发哲学许可证的,是第二组命题。

1.13 事实在逻辑空间中就是世界。

2.013 每一物都仿佛处在可能事态的空间之中。我可以想象这个空间是空的,但我无法想象物没有这个空间。

模型内部没有一个存放“苹果本质”的地方。词进入模型后,被表示为高维空间中的一个向量——一个位置。这个位置的意义完全由它与其他向量的相对关系决定。工程师称之为嵌入空间、潜在空间;维特根斯坦称之为逻辑空间。而2.0131里有全书最像深度学习论文的一句话:

2.0131 空间对象必须处在无限的空间之中。(空间点是一个论证位置。)

“空间点是一个论证位置”——每一个嵌入向量,都是一个论证位置。1918年的一个哲学断言,成了2020年代每一块HBM内存里实实在在存储的东西。

更深刻的是3.42:

3.42 一个命题虽然只能确定逻辑空间中的一个位置,可是整个逻辑空间必须已经由此给定。

每个句子只占据逻辑空间的一个点,但说出这个句子的可能性,预设了整个空间的存在。这解释了大模型最令人不安的能力——泛化:它能生成训练数据里从未出现过的句子。这并非是违背了数据边界,而是2.013的逻辑必然——你无法想象物没有它的空间。新句子不是凭空而来的,它们只是旧空间里的新位置。

03

生成(Generation):图像论与留声机唱片

“生成”——当机器开始无中生有,公众的兴奋与恐惧同时抵达顶点。维特根斯坦会说:没什么可惊讶的,人类一直在做这件事,它叫图像。

《逻辑哲学论》最著名的学说是图像论。命题2.1:

2.1 我们给自己造事实的图像。

2.12 图像是实在的模型。

4.031 在命题中,一个事态仿佛被试验性地组装了起来。

维特根斯坦的灵感来自巴黎法庭:报纸用小人偶摆出一场车祸的现场模型,来陈述事实。模型与事实之间的这种“结构对应”,就是他所说的图像。而“在命题中,事态被试验性地组装起来”——这就是生成式模型的操作定义:模型每次输出,都是在逻辑空间里组装出一个可能世界,供现实比对。

他在4.014举的例子,今天读起来像是一段被提前一百年写下的 Transformer 注释:

4.014 唱片、乐思、乐谱、声波,彼此都处于语言与世界之间那种内在的表象关系之中。……那条规则,就是把交响乐投影到乐谱语言中去的投影法则。它也是把乐谱语言翻译成唱片语言的规则。

同一个逻辑内容(交响乐),可以在不同介质之间无损投影:乐思→乐谱→唱片刻纹→声波。文本→向量→概率分布→文本,正是这条投影链。乐谱与唱片互不相似,却承载同一内容,正如“你好”这串字符与它在模型内部的十万维向量互不相似,却承载同一事实。机器翻译、多模态模型之所以可能,哲学根据全在这一个命题里:一切介质共享逻辑形式(2.18),因此一切介质之间都可以投影。

04

预测(Next Token):概率与幻觉的病根

“大模型不过是预测下一个词的概率机器”——这句流行语,既是轻蔑,也是真相。而第五组命题早在概率成为工程之前,就把概率安放进了真值理论的核心:

5 命题是基本命题的真值函项。

5.15 命题 r 给命题 s 的概率度,是两者共同真根据数与 r 的真根据数之比。

将“命题”换成“token”,这句话就是下一个 token 预测的数学定义:模型为候选 token 分配的,正是从既有上下文(真根据)到可能续写(事实)的比值。大模型不输出真假,输出概率——而《逻辑哲学论》早在概率成为工程之前,就把概率安置在真值理论的核心位置上。

这也精确预言了幻觉的哲学地位:

2.223 要识别图像的真或假,必须把它与实在相比较。

2.225 不存在先验为真的图像。

模型没有与实在比较的通道。它接触到的不是世界,而是世界的图像总集——语料。所以幻觉不是bug,不是工程疏漏,而是图像论的必然推论:一个只见过图像的系统,原则上无法单凭自身判定图像的真假。 所有围绕“事实核查”“检索增强”“工具调用”的工程努力,本质都是在给2.223补条件——人为地将图像和实在重新接上。

而训练本身,维特根斯坦也早已定性:

6.363 归纳程序在于:接受能与我们的经验相吻合的最简单的法则。

6.36311 太阳明天会升起,这是一个假设;也就是说,我们并不知道它是否升起。

缩放定律——大模型公司共同的信仰基石,2020年由OpenAI的卡普兰等人首次系统陈述——之所以成立,在哲学上就是6.363:它不是逻辑必然,是“与经验相吻合的最简单法则”。而模型每一次生成,都是6.36311的一次重演:每一个token都是一个假设。

05

架构(Transformer):命题的一般形式

“架构”——2017年,Google的论文《注意力就是你所需要的一切》送来了Transformer;而它的图纸,早就画在第四、六组命题里。维特根斯坦真正的野心,在第四组命题就已呈现出来:

4.5 现在似乎可以给出最一般的命题形式了:即给出对任意一种符号语言的命题的描述,使得每一个可能的意义都能被一个符合该描述的符号所表达……

4.51 假定所有基本命题都已给我:那么我就可以简单地问,我能从它们构造出哪些命题。这便是所有命题,这也就划定了它们的界限。

维特根斯坦要找的是语言的一个“通用母版”——一个形式,它生成一切合法的句子,且只生成合法的句子。第六组命题给出了答案:

6 真值函项的一般形式是:[p, ξ, N(ξ)]。

6.001 这说的不过是:每个命题,都是把运算 N(ξ) 连续应用于基本命题的结果。

6.03 整数的一般形式是:[0, ξ, ξ+1]。

请看6.03。整数的构造:从0开始,每个数由“前一个数加一”生成。序列,自回归,逐项生成,规则同一。这就是大模型的生成方式:给定上文,生成下一项,再把它并入上文,再生成下一项。 整数序列的构造法与token序列的生成法,是同一个数学动作。而6.001的“同一运算的连续应用”,就是Transformer几十层堆叠的哲学表述——每一层都对表示做一次变换,层层投影,直到末端变成概率。

维特根斯坦对自己的系统有一个惊人的比喻:

5.511 包罗万象、映照世界的逻辑,怎么会使用这样特殊的钩子和机关?只有当这一切联结成一张无限精细的网——那面巨大的镜子。

一张无限精细的网,一面巨大的镜子。今天我们更熟悉它的另一个名字:神经网络。

OpenAI的秘密,到这里已经全部摊开。GPT三个字母,逐词对应着这本书:Generative(生成的)——图像论,2.1;Pre-trained(预训练的)——事实总和的压缩,4.26;Transformer(变换器)——运算N(ξ)的连续应用,6.001。 这家公司没有发明任何超出此书的东西,它只是第一个将图纸焊成了机器。而它名字里的“Open”(开放)也在此书之中:

4.116 凡是能被思考的,都能被清楚地思考;凡是能被说出的,都能被清楚地说出。

06

缩放与涌现:线性的事实,指数的空间

“缩放定律”,AI大模型的信仰基石,资本开支的数学依据。它为什么成立?维特根斯坦给出了一个比“算力配比”更根本的答案。

Transformer的本质,是将同一运算连续应用于表示(6.001)。将这个结构放入规模里去看,就撞上了我们这个时代最重要的经验定律:缩放定律。

它的现代版本由OpenAI的卡普兰等人于2020年首次系统陈述:模型的预测误差,随算力、数据、参数的增长呈平滑的幂律下降——每投入一个数量级(约十倍)的资源,性能便按固定比例爬升一个台阶。DeepMind的Chinchilla研究(2022)修正了最优配比:给定算力预算,参数量与训练token之比约为1比20。而Wei等人2022年的《大模型的涌现能力》记录了幂律曲线之外的另一件事:某些能力——三位数加法、多步推理、指令遵循——在小模型上接近瞎猜,跨过某个规模阈值后突然跃升。量变引发质变;研究者借物理学家安德森1972年的名文,称之为“多者异也”。

《逻辑哲学论》没有给出算力配比,它给出了比配比更根本的东西:为什么会有缩放定律。

2.0124 如果全部对象都已给出,那么由此也就给出了全部可能的事态。

这是关于空间结构的数学断言:元素线性进入,空间指数展开。 给定n个基本命题,真值可能性有2的n次方种组合(4.27、4.42);而能对这些组合整体作断言的真值函项,其数目是指数之上的指数(4.45、5.101)。每吃进一个新事实,机器得到的不是“多知道一件事”,而是这件事与全部已知事实的每一种组合方式——组合是免费的。事实的进入是线性的,可说空间的扩张是指数的:这就是缩放定律的维特根斯坦形式。

于是,“智能涌现”有了精确的哲学位置。涌现不是魔法,它是模型从“占有事实”转入“栖居于空间”的相变时刻——从“事物的总和”(一件件死记)跳进“事实的总和”(结构自洽)。当2.0124的那个空间整体成形,那些“小模型上不存在”的能力便“突然”出现:它们并非是被造出来的,它们是空间的免费赠品,是2.013那句“物无法脱离其空间”的工程验证。近年实验反复观察到的一个现象在此有了哲学注脚:在固定数据上施加远超必要的算力,模型会在某个时刻从死记硬背突然转入举一反三——逻辑空间开始自洽的时刻,就是涌现的时刻。

维特根斯坦本人会对此保持冷峻,他早已写下两条警告。其一,6.1251:“在逻辑中永远不会有惊奇。”涌现之所以令人惊奇,恰恰因为它不在逻辑之中——它是归纳的果实(6.363),不是证明的结论。其二,6.371:“整个现代世界观都建立在一个幻觉上:以为所谓自然律是对自然现象的解释。”缩放定律是描述的规律性,不是理解的证书;将幂律外推成神学,就是6.372所说的“停留在自然律面前下跪”——这一跪,留到下一节再谈。

关于数字,最后补一个注脚。坊间流传一种说法:《逻辑哲学论》里藏着“七个单位(恰好对应一个指数级数量的开始)之后智能涌现”的神奇数字。去书里找会扑空——全书唯一的“七”,是第七命题本身。但这本书确实将全部重量押在了这个数字上:它的骨架就是一条七级阶梯。

全书由七个主命题搭成:世界(1)、事实(2)、思想(3)、命题(4)、真值函项(5)、一般形式(6)、沉默(7)。本文从语料到缩放的六节,大致就是沿前六级阶梯走下来的。6.54早将爬法写明:命题是梯子的横档,理解者必须踩着它们爬上去、爬过去,然后在第七级将梯子扔掉。将这条阶梯与缩放定律并置,会看到一幅惊人的对位图:能力沿阶梯逐级爬升(1至6:量变、幂律、平滑),而越级的那一步(7:质变、涌现、惊奇)不在阶梯之内——它发生在语言用尽的地方。

7,被维特根斯坦视为神奇数字的数字,在他的语境里不指代数量,而是指代方向:向外的方向。

07

通用智能(AGI):上帝来了

“通用人工智能”——所有大模型公司念兹在兹的终局名词,一个被用得几乎失效的词。而它的严肃定义,凯恩斯1929年1月就写在了一张便条上——“好了,上帝来了。”笑谈之所以流传百年,是因为它认真说出了人们面对这套系统时的真实感受;书中的宗教感,确实在第五、六组命题之间升起:

5.123 如果一个上帝创造了一个某些命题在其中为真的世界,那么他借此也就创造了一个其中这些命题的全部推论都为真的世界。

3.031 人们过去说,上帝能创造一切,只是不能创造违反逻辑规律的东西。

一个体系,给定任何可表达的问题,能

更多文章