AI要真正理解世界,光靠大语言模型够吗?
Science 25 June 2026:
AI要真正理解世界,光靠大语言模型够吗?
在纽约市一家初创公司的办公室里,一个人工智能程序正在即时“梦出”一个世界。
我在一款视频游戏里移动:穿过房间,遇到其他角色。每一帧画面,都是新泽西一个数据中心实时生成的。
但这个挑战并不是为人类设计的。
我停下来,一个自主AI智能体接管了我的操作。
General Intuition 的联合创始人 Adam Jelley 说:
“这是一个AI,在另一个AI的脑海里玩游戏。”
General Intuition 押注的正是这种系统:AI智能体在模拟世界中行动,并通过行动来学习。他们认为,这类系统最终可能超过大型语言模型,也就是 ChatGPT、Claude、Gemini、Grok 这类聊天机器人的核心模型。
过去大约十年,整个AI行业几乎默认一件事:大语言模型越大越好。
这个判断来自一篇被大量引用的2020年论文。那篇论文发现,只要增加模型规模、训练数据,或者训练模型所用的算力,模型性能就会提高。
这项研究的负责人 Jared Kaplan 是约翰斯·霍普金斯大学的理论物理学家。他说:
“我们当时非常惊讶。”
这种趋势表现得异常稳定。所谓“缩放定律”似乎在好几个数量级上都成立。它给AI行业传递了一个清晰信号:
不惜代价地做大。
那篇论文发表之后,各家公司也真的这么做了。
它们每年花费数千亿美元,建设巨大的AI模型。这些模型拥有数千亿甚至数万亿个可调参数,用从互联网上抓取来的数万亿词语和图像进行训练。
据估计,OpenAI 最新的 GPT 模型,规模已经是其2020年最大模型的好几倍,训练数据也多了一个数量级。
最近,企业又加上了另一种“放大杠杆”:测试时算力。
也就是说,让模型在回答之前“想得更久”。这样,即使不一定训练更大的模型、不一定使用更多数据,也能提升表现。
效果的确很惊人。
大语言模型可以通过律师资格考试和医生执照考试。它们可以在国际数学奥林匹克竞赛中匹敌顶尖高中生。它们写出的诗,有许多读者认为比人类作品更美。顶尖程序员现在也常常用它们写大部分代码。
Kaplan 后来联合创办了 Anthropic,现在是这家公司的首席科学官。他仍然认为,大语言模型还有很大空间可以继续发展。
从经验上看,模型表现确实一直跟随他在2020年描绘出的缩放定律。
Kaplan 说:
“你可以把它看成一种自我实现的预言。”
在可预见的未来,他认为:
“如果你看不到清晰的缩放定律,那说明你哪里做错了。”
但也有一些研究人员认为,大语言模型继续扩大规模,正在遇到实际限制。
Kaplan 的论文描述的是一种幂律关系:每获得一点提升,都需要不成比例地投入更多资源。
与此同时,企业可抓取的训练数据正在枯竭。一项2024年的研究估计,未来几年内,高质量的公共文本数据就会被耗尽。
算力方面,芯片和算法效率确实在提升,但速度还不够快。正在建设中的数据中心,每一个都可能消耗数吉瓦电力,给电网带来压力。
还有一些担忧更加根本。
大语言模型,即使是那些被训练来“推理”、或者能同时处理图像和文本的变体,本质上仍然主要是预测序列中的下一个 token。这个 token 可以是一小段文字,也可以是一小块图像数据。
它们先从庞大的数据集中学习统计模式,然后再经过微调,生成更有用、更可靠的答案。
但大语言模型并没有亲身经验它们所描述的世界。
它们无法测试一个假设,也无法主动探索一个环境。它们对因果关系的学习是间接的。
这种能力足以生成流畅解释,或者看上去合理的计划。但当任务成败取决于理解现实世界中行动后果时,它就可能不够用。
比如,当被问到怎样把常见物体堆叠起来时,模型有时会出错。这显示出它们缺乏常识。
这些短板一旦进入现实世界,后果就很重要。
你不会信任一个大语言模型去当儿童心理治疗师,或者警察。
Google DeepMind 的研究科学家 Jane Wang 说:
“大语言模型确实越来越好,但你不能只是继续往里塞更多数据,然后指望它神奇地变好。”
OpenAI 首席科学家 Jakub Pachocki 说:
“我确实认为,文本智能还有很多空间。但很明显,人类不是只用文字来推理的。”
现在,许多研究人员都相信,类人AI,或者说通用人工智能 AGI,要实现的东西不能只是掌握语言和图像。
它还需要能够理解空间、因果关系,以及行动的后果。尤其是如果AI未来要控制人形机器人、操作工厂、探索其他星球,这一点就更重要。
很少有人比AI先驱 Yann LeCun 更强烈地表达过这种观点。
他说:
“我开玩笑说,我们今天拥有的最聪明系统,还没有一只家猫聪明。”
一只猫当然不能像大语言模型那样写代码,但它能凭自己的机灵劲活下去。
LeCun 认为,单纯扩大大语言模型就能得到 AGI 的想法是:
“完全胡扯。”
他说:
“这就像说你要通过不断放大飞机,最后进入轨道一样。硅谷现在流行一种非常强大的幻觉,认为事情就是这样。”
LeCun 离开了 Meta 的高层职位,联合创办了一家实验室。现在,越来越多实验室和初创公司都在开发所谓“世界模型”。
世界模型,就是建立“世界如何运作”的表征系统。智能体可以在这些模型中行动、学习或规划。
这些研究者最终希望,更接近人类心智学习方式的AI,能获得惊人的新能力。
人类和大语言模型的差距,不只是数量问题
人类和大语言模型之间的差距,并不仅仅是量的差别。
在2024年的一项研究中,研究人员用纽约市出租车行驶路线的方向序列训练大语言模型。模型能够可靠地生成新路线,看上去似乎已经把这些方向转化成了准确的城市地图。
但当研究人员深入模型内部,查看它的内部表征时,他们发现的不是一张清晰的城市网格,而是一团纠缠街道组成的混乱结构。
普林斯顿大学认知科学家 Brenden Lake 说,大语言模型:
“非常异类,非常不像人类。”
Lake 曾经用幼儿头戴摄像机拍下的数百小时视频来训练AI,观察它们能从这些输入中学到什么。
相比大语言模型,儿童习得语言所需的数据少得惊人:他们接触的是数百万个词,而不是数万亿个词。
更重要的是,儿童在学会语言之前,已经花了一两年时间探索世界:触摸物体,在空间中移动,观察世界如何回应自己的行动。
而大语言模型是从语言开始的。
Lake 说,AI 的发展顺序:
“完全反过来了。”
他认为,这种差异很重要。
在人类身上,先天的好奇心和实验欲望会推动我们灵活组合简单概念,并把它们应用到新情境中。
比如,一个孩子学会了蹦跳,就能蹦跳到门口再回来,也可以一边唱歌一边蹦跳。
Lake 说,大语言模型当然也能即兴发挥:
“但它是一种令人沮丧的混合体:既有智能,又有奇怪的失败。”
他说,大语言模型受到限制,是因为它们没有身体。
它们需要像孩子一样学习。
“要像人类那样理解一个词,AI需要把这个词扎根到现实世界的物体之中。”
一些实验室和AI公司正在认真采纳 Lake 的建议。
它们试图建立不那么像聊天机器人、而更像具身智能体的通用AI系统。也就是说,这些AI通过经验、互动和实验来学习。
研究人员主要沿着两条路径推进这个目标。
第一种路径,是让智能体先在模拟世界中通过试错学习,然后再把学到的东西带到现实世界。
第二种路径,是建立一种智能体随身携带的预测性世界,让它们能够在内部提前测试自己的行动。
你可以把这两种方法分别理解为:离线世界模型和在线世界模型。
前者支持反射式行动,后者支持深思熟虑式行动。
DeepMind、英伟达和机器人
沿着第一条路径,Google DeepMind 的研究人员开发了 Genie。
Genie 是一系列世界模型,可以根据提示词或视频生成可导航的3D环境,几乎像是按需创造一个电子游戏世界。
这些环境可以作为智能体的训练场和测试场。
比如 Google 的 SIMA,也就是 Scalable Instructable Multiworld Agent,它基于 Gemini 模型。通过在各种不同世界中训练,SIMA 可以在陌生世界中执行指令。例如,探索一个场景,识别奇怪物体,并尝试猜测它们由什么材料构成。
Google DeepMind 研究主管 Shlomi Fruchter 说,这种智能体的用途不会止步于游戏。
比如,它未来可能成为一种AI科学家,能在不断变化的科学实验室环境中工作。
他说,如果一个AI智能体无法执行物理任务:
“那它在影响力方面就非常有限。”
AI芯片制造商英伟达,已经在把这个思路推进到物理世界。
英伟达先让智能体在模拟环境中训练,然后把它们部署到机器人中。这些机器人未来可能在仓库和工厂中工作。那里的成功不仅依赖抽象推理,也依赖在不可预测环境中的协调运动。
英伟达的 GR00T 智能体可以接收摄像头画面和语言指令,然后为机器人生成行动。
在虚拟演示中,由 GR00T 引导的机器人可以把一个土豆放进微波炉,然后关上门。
这对人类来说是微不足道的小事,但对机器人来说,需要协调和规划。
英伟达的一个世界模型 DreamZero,会尝试预测某个行动发生之后,世界将如何变化。
德克萨斯大学奥斯汀分校计算机科学家 Yuke Zhu 参与开发了英伟达这些系统。他说,这能帮助机器人适应陌生环境和新任务。
不过,虽然大语言模型已经能解数学奥赛题、写软件,世界模型智能体仍然在努力学会抓住咖啡杯、在玩具世界中导航。
问题之一在于,物理世界远比语言复杂。
General Intuition 联合创始人 Pim de Witte 说,文本把现实的四个维度压缩成了一维。
真实环境是嘈杂的、连续的、动态的。机器人必须处理不断变化的光线、移动的物体,以及自己行动造成的后果。
de Witte 还指出,另一个问题是:世界模型需要能反映这种复杂性的数据。
这些数据包括行动和结果的例子,比如机器人操控物体,或者人类在电子游戏空间中导航。
与文本相比,这些例子数量少,而且成本高。
研究人员正在利用 YouTube 视频中大量的被动数据,但观看不等于亲身行动。
他们仍然需要更多来自具身互动的数据。
在通往 AGI 的竞赛中,廉价但单薄的文本数据,可能会给大语言模型带来优势。
LeCun 押注更稀缺、更丰富的世界数据
LeCun 则押注于更丰富、但更稀缺的世界数据。
他曾是 Meta 的首席AI科学家。但当 Meta 开始从机器人转向大语言模型时,他变得不安分起来。
LeCun 说,他意识到:
“我基本上一打响指,就能筹到10亿美元。”
于是他真的这么做了。
今年3月,他带着略高于10亿美元的资金,推出了 Advanced Machine Intelligence Labs,简称 AMI Labs。
AMI Labs 采用的是世界模型中的“在线”路线。
它的系统试图以预测的方式理解物理世界,也就是把一个世界模型随身带着走。
AMI 的核心技术是一组叫作 JEPA 的算法,全称是 Joint-Embedding Predictive Architecture,联合嵌入预测架构。
许多世界模型会预测视频帧中的每一个像素,而 JEPA 不一样。它试图预测未来状态的抽象表征。
比如开车时,你关心的是红绿灯现在是红灯还是绿灯,而不是灯光具体长什么样。
LeCun 认为,智能系统需要围绕这些高层属性进行推理,同时过滤掉无关细节。
为了让智能体具备想象未来结果的能力,研究人员首先用数千小时 YouTube 视频训练 JEPA 模型,让它们学习场景如何随时间变化。
然后,他们把模型适配到机器人任务上,教它们预测物体和机械臂会如何响应特定动作。
目标不只是反射式行为,而是规划。
如果给定一个想要达到的未来状态,比如让机械臂抓住一个咖啡杯,使用 JEPA 的智能体就可以在内部世界中模拟可能的行动序列,然后选择其中一个。
LeCun 认为,这种任务超出了大语言模型的能力。
他说:
“你无法通过预测离散 token 来建模这种行为。所以你不可能用大语言模型来做这些事。”
LeCun 设想,JEPA 系统可以首先应用在工业机器人控制中,比如电厂、航空航天和医疗行业。
但他说:
“最终目标,是建立通用智能系统。”
Anthropic 仍然押注大语言模型
在 Anthropic,研究人员基本上避免显式开发世界模型。
Kaplan 说,这部分是商业决策:公司更专注于对编码、写作和办公室工作有用的AI系统,而不是机器人。
但这也反映了更深层的信念:
今天的大语言模型,还远没有耗尽潜力。
Kaplan 认为,随着大语言模型继续扩大,它们常常会发展出意想不到的新能力。这种现象被称为“涌现”。
过去几年,大语言模型获得了一些小模型不具备的能力:做算术、多步骤推理、写出可运行的软件。
这些技能并不是被明确编程进去的。很多情况下,研究人员也无法预测它们会在什么时候出现。
在 Kaplan 看来,这些意外表明,智能也许会从足够大的大语言模型中自然涌现出来,而不一定需要根本性的新架构。
他反对把大语言模型说成只是与现实脱节的“统计鹦鹉”。
他认为,大语言模型已经包含了关于世界的内部表征。只是这种表征是从文本和图像模式中间接建立起来的。
否则,它们根本不可能提供行车路线。
Kaplan 说:
“有些人认为,没有身体就无法训练出 AGI。我个人对此非常怀疑。”
de Witte 承认,足够大的大语言模型也许会发展出隐性的世界模型。
但他说:
“问题是,代价是什么?”
在 General Intuition 的纽约办公室里,Jelley 用手在桌面上模仿擦拭动作。
他说,一个聊天机器人可以描述怎样擦干净一张桌子。
但要知道该用多大压力,或者当面包屑四处散开时该怎样调整动作,仅靠文字就很难学会。
他说:
“这有点像‘一张图片胜过千言万语’这个观点,也就是为什么你需要世界模型。”
世界模型和语言模型,可能不是二选一
世界模型路线是否比扩大大语言模型更有希望达到类人智能,目前还没有定论。
而且,这两条路线的进展也未必互相排斥。
de Witte 说,世界模型和语言模型可以结合。
一个大语言模型可以在处理空间任务时调用世界模型;一个世界模型也可以在处理语言任务时调用大语言模型。
比如,在 LeCun 的实验中,一个 JEPA 模型和一个大语言模型配合之后,就能回答视频中人物接下来可能做什么的问题。
更有意思的是,de Witte 说,世界模型也许最终会把语言建模为世界的一部分。
也就是说,它可以通过视觉和音频输入来感知文字和语音,就像人类在阅读、写作和交谈时那样。
在我离开 General Intuition 时,Jelley 递给我一张贴纸,上面印着公司的标志。
这个标志像一个倒过来的 A。
他说,它看起来像数学符号“∀”,意思是“对于所有”。
它也暗示着公司更大的目标。
他说:
“如果你眯起眼睛看,也能从里面看出 G-I。”
Matthew Hutson 是纽约市的一名科学记者。
相关文章
甲骨文埃里森:AI泡沫的压力表
80岁再登世界首富,随后财富蒸发2000亿美元。 他把1300亿美元债务、OpenAI和自己的晚年全押在了AI上。 如果AI真有泡沫,甲骨文可能是最先显示压力的那只仪表。 80岁首富的另一面:一座岛,一个中国女人,至少四个孩子 在夏威夷,埃里森几乎拥有整座拉奈岛。140平方英里的岛上,从47英里的海岸线,到加油站、电影院、两家四季酒店,再到新建的员工住宅,大量资产都属于他。当地约3000名居...
《New Scientist》陶哲轩专访:AI最可怕的,不是抢走工作,而是重新定义你的工作
《New Scientist》陶哲轩专访:AI最可怕的,不是抢走工作,而是重新定义你的工作 -AI正以每周几个的速度攻克数学难题 -数学家已暂时失去了对叙事的控制 -如果一个行业说不清自己的价值,别人就会替它定义 AI已经闯进数学界 数学家大概是世界上最习惯“慢”的一群人。一个问题悬而未决几十年甚至几百年,一个人花几年时间只研究一道题,在这个行业里都很正常。 但2026年,节奏突然变了。 一...
世界最顶尖的数字取证专家如何鉴别视频/声音/图片造假
哈尼·法里德是全球最顶尖的数字取证专家之一,研究照片、视频、声音造假二十多年。 一天早上,法里德收到一段疯传视频。画面显示,一枚美国制造的导弹击中伊朗一所小学,造成大量儿童死亡。媒体和各种组织都在问他:这是真的,还是 AI 做的?法里德的第一反应是怀疑,因为他最近已经看过太多“看起来很真”的 AI 视频:假的轰炸、假的坠机、假的大火、假的处决。它们已经不是过去那种一眼假的东西, 但法里德不说...