深度AI

AI要真正理解世界,光靠大语言模型够吗?

·24 分钟阅读·— 次阅读

Science 25 June 2026:

AI要真正理解世界,光靠大语言模型够吗?

在纽约市一家初创公司的办公室里,一个人工智能程序正在即时“梦出”一个世界。

我在一款视频游戏里移动:穿过房间,遇到其他角色。每一帧画面,都是新泽西一个数据中心实时生成的。

但这个挑战并不是为人类设计的。

我停下来,一个自主AI智能体接管了我的操作。

General Intuition 的联合创始人 Adam Jelley 说:

“这是一个AI,在另一个AI的脑海里玩游戏。”

General Intuition 押注的正是这种系统:AI智能体在模拟世界中行动,并通过行动来学习。他们认为,这类系统最终可能超过大型语言模型,也就是 ChatGPT、Claude、Gemini、Grok 这类聊天机器人的核心模型。

过去大约十年,整个AI行业几乎默认一件事:大语言模型越大越好。

这个判断来自一篇被大量引用的2020年论文。那篇论文发现,只要增加模型规模、训练数据,或者训练模型所用的算力,模型性能就会提高。

这项研究的负责人 Jared Kaplan 是约翰斯·霍普金斯大学的理论物理学家。他说:

“我们当时非常惊讶。”

这种趋势表现得异常稳定。所谓“缩放定律”似乎在好几个数量级上都成立。它给AI行业传递了一个清晰信号:

不惜代价地做大。

那篇论文发表之后,各家公司也真的这么做了。

它们每年花费数千亿美元,建设巨大的AI模型。这些模型拥有数千亿甚至数万亿个可调参数,用从互联网上抓取来的数万亿词语和图像进行训练。

据估计,OpenAI 最新的 GPT 模型,规模已经是其2020年最大模型的好几倍,训练数据也多了一个数量级。

最近,企业又加上了另一种“放大杠杆”:测试时算力。

也就是说,让模型在回答之前“想得更久”。这样,即使不一定训练更大的模型、不一定使用更多数据,也能提升表现。

效果的确很惊人。

大语言模型可以通过律师资格考试和医生执照考试。它们可以在国际数学奥林匹克竞赛中匹敌顶尖高中生。它们写出的诗,有许多读者认为比人类作品更美。顶尖程序员现在也常常用它们写大部分代码。

Kaplan 后来联合创办了 Anthropic,现在是这家公司的首席科学官。他仍然认为,大语言模型还有很大空间可以继续发展。

从经验上看,模型表现确实一直跟随他在2020年描绘出的缩放定律。

Kaplan 说:

“你可以把它看成一种自我实现的预言。”

在可预见的未来,他认为:

“如果你看不到清晰的缩放定律,那说明你哪里做错了。”

但也有一些研究人员认为,大语言模型继续扩大规模,正在遇到实际限制。

Kaplan 的论文描述的是一种幂律关系:每获得一点提升,都需要不成比例地投入更多资源。

与此同时,企业可抓取的训练数据正在枯竭。一项2024年的研究估计,未来几年内,高质量的公共文本数据就会被耗尽。

算力方面,芯片和算法效率确实在提升,但速度还不够快。正在建设中的数据中心,每一个都可能消耗数吉瓦电力,给电网带来压力。

还有一些担忧更加根本。

大语言模型,即使是那些被训练来“推理”、或者能同时处理图像和文本的变体,本质上仍然主要是预测序列中的下一个 token。这个 token 可以是一小段文字,也可以是一小块图像数据。

它们先从庞大的数据集中学习统计模式,然后再经过微调,生成更有用、更可靠的答案。

但大语言模型并没有亲身经验它们所描述的世界。

它们无法测试一个假设,也无法主动探索一个环境。它们对因果关系的学习是间接的。

这种能力足以生成流畅解释,或者看上去合理的计划。但当任务成败取决于理解现实世界中行动后果时,它就可能不够用。

比如,当被问到怎样把常见物体堆叠起来时,模型有时会出错。这显示出它们缺乏常识。

这些短板一旦进入现实世界,后果就很重要。

你不会信任一个大语言模型去当儿童心理治疗师,或者警察。

Google DeepMind 的研究科学家 Jane Wang 说:

“大语言模型确实越来越好,但你不能只是继续往里塞更多数据,然后指望它神奇地变好。”

OpenAI 首席科学家 Jakub Pachocki 说:

“我确实认为,文本智能还有很多空间。但很明显,人类不是只用文字来推理的。”

现在,许多研究人员都相信,类人AI,或者说通用人工智能 AGI,要实现的东西不能只是掌握语言和图像。

它还需要能够理解空间、因果关系,以及行动的后果。尤其是如果AI未来要控制人形机器人、操作工厂、探索其他星球,这一点就更重要。

很少有人比AI先驱 Yann LeCun 更强烈地表达过这种观点。

他说:

“我开玩笑说,我们今天拥有的最聪明系统,还没有一只家猫聪明。”

一只猫当然不能像大语言模型那样写代码,但它能凭自己的机灵劲活下去。

LeCun 认为,单纯扩大大语言模型就能得到 AGI 的想法是:

“完全胡扯。”

他说:

“这就像说你要通过不断放大飞机,最后进入轨道一样。硅谷现在流行一种非常强大的幻觉,认为事情就是这样。”

LeCun 离开了 Meta 的高层职位,联合创办了一家实验室。现在,越来越多实验室和初创公司都在开发所谓“世界模型”。

世界模型,就是建立“世界如何运作”的表征系统。智能体可以在这些模型中行动、学习或规划。

这些研究者最终希望,更接近人类心智学习方式的AI,能获得惊人的新能力。


人类和大语言模型的差距,不只是数量问题

人类和大语言模型之间的差距,并不仅仅是量的差别。

在2024年的一项研究中,研究人员用纽约市出租车行驶路线的方向序列训练大语言模型。模型能够可靠地生成新路线,看上去似乎已经把这些方向转化成了准确的城市地图。

但当研究人员深入模型内部,查看它的内部表征时,他们发现的不是一张清晰的城市网格,而是一团纠缠街道组成的混乱结构。

普林斯顿大学认知科学家 Brenden Lake 说,大语言模型:

“非常异类,非常不像人类。”

Lake 曾经用幼儿头戴摄像机拍下的数百小时视频来训练AI,观察它们能从这些输入中学到什么。

相比大语言模型,儿童习得语言所需的数据少得惊人:他们接触的是数百万个词,而不是数万亿个词。

更重要的是,儿童在学会语言之前,已经花了一两年时间探索世界:触摸物体,在空间中移动,观察世界如何回应自己的行动。

而大语言模型是从语言开始的。

Lake 说,AI 的发展顺序:

“完全反过来了。”

他认为,这种差异很重要。

在人类身上,先天的好奇心和实验欲望会推动我们灵活组合简单概念,并把它们应用到新情境中。

比如,一个孩子学会了蹦跳,就能蹦跳到门口再回来,也可以一边唱歌一边蹦跳。

Lake 说,大语言模型当然也能即兴发挥:

“但它是一种令人沮丧的混合体:既有智能,又有奇怪的失败。”

他说,大语言模型受到限制,是因为它们没有身体。

它们需要像孩子一样学习。

“要像人类那样理解一个词,AI需要把这个词扎根到现实世界的物体之中。”

一些实验室和AI公司正在认真采纳 Lake 的建议。

它们试图建立不那么像聊天机器人、而更像具身智能体的通用AI系统。也就是说,这些AI通过经验、互动和实验来学习。

研究人员主要沿着两条路径推进这个目标。

第一种路径,是让智能体先在模拟世界中通过试错学习,然后再把学到的东西带到现实世界。

第二种路径,是建立一种智能体随身携带的预测性世界,让它们能够在内部提前测试自己的行动。

你可以把这两种方法分别理解为:离线世界模型和在线世界模型。

前者支持反射式行动,后者支持深思熟虑式行动。


DeepMind、英伟达和机器人

沿着第一条路径,Google DeepMind 的研究人员开发了 Genie。

Genie 是一系列世界模型,可以根据提示词或视频生成可导航的3D环境,几乎像是按需创造一个电子游戏世界。

这些环境可以作为智能体的训练场和测试场。

比如 Google 的 SIMA,也就是 Scalable Instructable Multiworld Agent,它基于 Gemini 模型。通过在各种不同世界中训练,SIMA 可以在陌生世界中执行指令。例如,探索一个场景,识别奇怪物体,并尝试猜测它们由什么材料构成。

Google DeepMind 研究主管 Shlomi Fruchter 说,这种智能体的用途不会止步于游戏。

比如,它未来可能成为一种AI科学家,能在不断变化的科学实验室环境中工作。

他说,如果一个AI智能体无法执行物理任务:

“那它在影响力方面就非常有限。”

AI芯片制造商英伟达,已经在把这个思路推进到物理世界。

英伟达先让智能体在模拟环境中训练,然后把它们部署到机器人中。这些机器人未来可能在仓库和工厂中工作。那里的成功不仅依赖抽象推理,也依赖在不可预测环境中的协调运动。

英伟达的 GR00T 智能体可以接收摄像头画面和语言指令,然后为机器人生成行动。

在虚拟演示中,由 GR00T 引导的机器人可以把一个土豆放进微波炉,然后关上门。

这对人类来说是微不足道的小事,但对机器人来说,需要协调和规划。

英伟达的一个世界模型 DreamZero,会尝试预测某个行动发生之后,世界将如何变化。

德克萨斯大学奥斯汀分校计算机科学家 Yuke Zhu 参与开发了英伟达这些系统。他说,这能帮助机器人适应陌生环境和新任务。

不过,虽然大语言模型已经能解数学奥赛题、写软件,世界模型智能体仍然在努力学会抓住咖啡杯、在玩具世界中导航。

问题之一在于,物理世界远比语言复杂。

General Intuition 联合创始人 Pim de Witte 说,文本把现实的四个维度压缩成了一维。

真实环境是嘈杂的、连续的、动态的。机器人必须处理不断变化的光线、移动的物体,以及自己行动造成的后果。

de Witte 还指出,另一个问题是:世界模型需要能反映这种复杂性的数据。

这些数据包括行动和结果的例子,比如机器人操控物体,或者人类在电子游戏空间中导航。

与文本相比,这些例子数量少,而且成本高。

研究人员正在利用 YouTube 视频中大量的被动数据,但观看不等于亲身行动。

他们仍然需要更多来自具身互动的数据。

在通往 AGI 的竞赛中,廉价但单薄的文本数据,可能会给大语言模型带来优势。


LeCun 押注更稀缺、更丰富的世界数据

LeCun 则押注于更丰富、但更稀缺的世界数据。

他曾是 Meta 的首席AI科学家。但当 Meta 开始从机器人转向大语言模型时,他变得不安分起来。

LeCun 说,他意识到:

“我基本上一打响指,就能筹到10亿美元。”

于是他真的这么做了。

今年3月,他带着略高于10亿美元的资金,推出了 Advanced Machine Intelligence Labs,简称 AMI Labs。

AMI Labs 采用的是世界模型中的“在线”路线。

它的系统试图以预测的方式理解物理世界,也就是把一个世界模型随身带着走。

AMI 的核心技术是一组叫作 JEPA 的算法,全称是 Joint-Embedding Predictive Architecture,联合嵌入预测架构。

许多世界模型会预测视频帧中的每一个像素,而 JEPA 不一样。它试图预测未来状态的抽象表征。

比如开车时,你关心的是红绿灯现在是红灯还是绿灯,而不是灯光具体长什么样。

LeCun 认为,智能系统需要围绕这些高层属性进行推理,同时过滤掉无关细节。

为了让智能体具备想象未来结果的能力,研究人员首先用数千小时 YouTube 视频训练 JEPA 模型,让它们学习场景如何随时间变化。

然后,他们把模型适配到机器人任务上,教它们预测物体和机械臂会如何响应特定动作。

目标不只是反射式行为,而是规划。

如果给定一个想要达到的未来状态,比如让机械臂抓住一个咖啡杯,使用 JEPA 的智能体就可以在内部世界中模拟可能的行动序列,然后选择其中一个。

LeCun 认为,这种任务超出了大语言模型的能力。

他说:

“你无法通过预测离散 token 来建模这种行为。所以你不可能用大语言模型来做这些事。”

LeCun 设想,JEPA 系统可以首先应用在工业机器人控制中,比如电厂、航空航天和医疗行业。

但他说:

“最终目标,是建立通用智能系统。”


Anthropic 仍然押注大语言模型

在 Anthropic,研究人员基本上避免显式开发世界模型。

Kaplan 说,这部分是商业决策:公司更专注于对编码、写作和办公室工作有用的AI系统,而不是机器人。

但这也反映了更深层的信念:

今天的大语言模型,还远没有耗尽潜力。

Kaplan 认为,随着大语言模型继续扩大,它们常常会发展出意想不到的新能力。这种现象被称为“涌现”。

过去几年,大语言模型获得了一些小模型不具备的能力:做算术、多步骤推理、写出可运行的软件。

这些技能并不是被明确编程进去的。很多情况下,研究人员也无法预测它们会在什么时候出现。

在 Kaplan 看来,这些意外表明,智能也许会从足够大的大语言模型中自然涌现出来,而不一定需要根本性的新架构。

他反对把大语言模型说成只是与现实脱节的“统计鹦鹉”。

他认为,大语言模型已经包含了关于世界的内部表征。只是这种表征是从文本和图像模式中间接建立起来的。

否则,它们根本不可能提供行车路线。

Kaplan 说:

“有些人认为,没有身体就无法训练出 AGI。我个人对此非常怀疑。”

de Witte 承认,足够大的大语言模型也许会发展出隐性的世界模型。

但他说:

“问题是,代价是什么?”

在 General Intuition 的纽约办公室里,Jelley 用手在桌面上模仿擦拭动作。

他说,一个聊天机器人可以描述怎样擦干净一张桌子。

但要知道该用多大压力,或者当面包屑四处散开时该怎样调整动作,仅靠文字就很难学会。

他说:

“这有点像‘一张图片胜过千言万语’这个观点,也就是为什么你需要世界模型。”


世界模型和语言模型,可能不是二选一

世界模型路线是否比扩大大语言模型更有希望达到类人智能,目前还没有定论。

而且,这两条路线的进展也未必互相排斥。

de Witte 说,世界模型和语言模型可以结合。

一个大语言模型可以在处理空间任务时调用世界模型;一个世界模型也可以在处理语言任务时调用大语言模型。

比如,在 LeCun 的实验中,一个 JEPA 模型和一个大语言模型配合之后,就能回答视频中人物接下来可能做什么的问题。

更有意思的是,de Witte 说,世界模型也许最终会把语言建模为世界的一部分。

也就是说,它可以通过视觉和音频输入来感知文字和语音,就像人类在阅读、写作和交谈时那样。

在我离开 General Intuition 时,Jelley 递给我一张贴纸,上面印着公司的标志。

这个标志像一个倒过来的 A。

他说,它看起来像数学符号“∀”,意思是“对于所有”。

它也暗示着公司更大的目标。

他说:

“如果你眯起眼睛看,也能从里面看出 G-I。”

Matthew Hutson 是纽约市的一名科学记者。

相关文章

甲骨文埃里森:AI泡沫的压力表

80岁再登世界首富,随后财富蒸发2000亿美元。 他把1300亿美元债务、OpenAI和自己的晚年全押在了AI上。 如果AI真有泡沫,甲骨文可能是最先显示压力的那只仪表。 80岁首富的另一面:一座岛,一个中国女人,至少四个孩子 在夏威夷,埃里森几乎拥有整座拉奈岛。140平方英里的岛上,从47英里的海岸线,到加油站、电影院、两家四季酒店,再到新建的员工住宅,大量资产都属于他。当地约3000名居...

2026/8/17 · 18 分钟

《New Scientist》陶哲轩专访:AI最可怕的,不是抢走工作,而是重新定义你的工作

《New Scientist》陶哲轩专访:AI最可怕的,不是抢走工作,而是重新定义你的工作 -AI正以每周几个的速度攻克数学难题 -数学家已暂时失去了对叙事的控制 -如果一个行业说不清自己的价值,别人就会替它定义 AI已经闯进数学界 数学家大概是世界上最习惯“慢”的一群人。一个问题悬而未决几十年甚至几百年,一个人花几年时间只研究一道题,在这个行业里都很正常。 但2026年,节奏突然变了。 一...

2026/8/13 · 17 分钟

世界最顶尖的数字取证专家如何鉴别视频/声音/图片造假

哈尼·法里德是全球最顶尖的数字取证专家之一,研究照片、视频、声音造假二十多年。 一天早上,法里德收到一段疯传视频。画面显示,一枚美国制造的导弹击中伊朗一所小学,造成大量儿童死亡。媒体和各种组织都在问他:这是真的,还是 AI 做的?法里德的第一反应是怀疑,因为他最近已经看过太多“看起来很真”的 AI 视频:假的轰炸、假的坠机、假的大火、假的处决。它们已经不是过去那种一眼假的东西, 但法里德不说...

2026/6/14 · 11 分钟