【Sutton 批判大模型路线】

说起强化学习之父 Rich Sutton,AI 圈几乎没人陌生。他写下的《苦涩的教训》,至今仍被很多人视为理解 AI 发展的重要框架,即从长期看,能够随着计算规模扩展的通用方法,往往会战胜依赖大量人工知识设计的方案。然而,最近接受红杉资本访谈时,Sutton 却把矛头对准了今天最主流的大模型路线。在他看来,LLM 虽是一次伟大的科学突破,却也可能成为《苦涩的教训》的反面案例。

【大模型的局限】

原因在于,今天的大模型虽摆脱了大量人工规则,却重新被“人类已经知道的东西”限制住了。互联网数据有限,合成数据背后依然需要人来决定什么值得生成。更关键的是,模型不具备人类那样的持续学习能力。一个司机开 10 年车会形成大量直觉,但今天的大模型大部分学习集中在预训练和后训练阶段,上线后核心权重基本被冻结。在 Sutton 看来,今天的大模型行业可能已陷入“局部最优”,继续堆 GPU、做 Scaling 性能还能上涨,所以头部实验室难转向新路线。

【Oak Lab 的出发点】

这也是 Sutton 和学生 Khurram Javed 创办 Oak Lab 的出发点。Oak 想重新做一种能从自身经验中持续学习的 AI Agent,模型上线后还能更新对世界的理解,提炼新规律并调整自己。如果持续学习路线走通,被重写的可能是“训练—冻结—上线”的整套基础模型范式,不能持续学习是大模型最大的问题。

【Sutton 对大模型的矛盾态度】

Sutton 对大模型的态度很有意思。他不否认 LLM 的成功,认为大型语言模型是“惊人的科学突破”。过去语言被认为是符号主义 AI 最后的堡垒之一,神经网络靠规模化训练学会了复杂语言能力,这符合《苦涩的教训》的观点,即少往机器里手工塞人类规则,多寻找随计算规模扩展的学习方法。过去几十年 AI 历史证明,人类精心设计的规则短期好用,长期却输给更通用、能吃下更多计算的方法,AlphaGo、深度学习、大语言模型都是如此。LLM 把互联网“喝”进去增加计算量,能力快速上升,所以是《苦涩的教训》最成功的案例之一。但大模型同时可能成为反面案例,因为它虽摆脱大量人工规则,却被互联网这种“人类知识”限制。互联网只是人类已记录的知识,现实世界远比其复杂,真实世界信息量远超互联网存储的一切。这意味着只靠训练前准备数据会撞墙。而且大模型学习和工作被人为切成两个阶段,训练时疯狂学习,上线后权重基本冻结,它通过 Context 临时获新信息、通过 Memory 记偏好,但这和真正的学习还差得远,真正的学习是系统经历事情后本身发生变化,而现在的大模型更像刚毕业被冻结的大脑,工作靠翻毕业笔记。这也是 Sutton 对当前 LLM 最核心的质疑:为什么模型形成新概念、修改内部结构的能力只能在训练阶段?上线后为什么不能继续改变权重?

【合成数据的问题】

互联网高质量数据有限,热门答案是合成数据。理论上算力足够数据可无限生成,但 Sutton 评价这是“大错误”,甚至可能成下一条“苦涩的教训”。因为合成数据虽摆脱真实数据限制,背后仍藏人类瓶颈,谁决定生成什么数据、判断问题重要性、定义奖励,最后还是人。只要合成数据需人类决定生成内容,其扩展速度就受人类知识限制。Sutton 背后的理论是 Big World Hypothesis,即大世界假说,现实世界太大,智能体不可能提前掌握一切,如无人机飞行会遇到模拟器里没有的细节,这些不可能全写进训练集。所以他认为智能体面对的世界永远比自身复杂,唯一可行方法是边走边学,这颠覆了 AI 行业过去把模型训练得接近“全知”的假设,他想做的 AI 更注重出生后进化。

【持续学习的难题】

既然持续学习符合直觉,为什么 OpenAI、Anthropic 等公司不让模型每天更新权重?因为这样模型可能被学废,这也是 Continual Learning 研究多年未解决的灾难性遗忘(Catastrophic Forgetting)问题。比如告诉模型公司内部项目改名,它更新权重可能影响其他能力。所以很多模型把新信息塞进 Context、RAG 或 Memory,不轻易改底层权重。Cursor 产品做了持续更新,但方式是先收集大量用户数据攒成 Batch 再统一训练,这对公共模型有用,对个人智能体就不合适,若只想教自己的 AI 助手新习惯,没必要等大量用户数据一起训练,且自己希望它学的东西可能和别人无关。所以 Oak 想解决底层算法问题,让模型用单条经验更新自己且不破坏旧知识,Sutton 给出的方向是 Step - size Optimization,即不同知识“可塑性”不同,权重有不同学习速度,像人的大脑,不会因看到特殊情况就推翻旧认知,若规律变化大脑能慢慢调整。还有 Continual Backprop 方法,传统神经网络训练久了内部结构会固化,Sutton 想让训练多年的神经网络有可塑性,Oak 认为未来训练基础模型应把这种能力训练进去,模型从第一天开始同时学知识和学习知识的方法,即 Meta - learning,真正的持续学习模型可能需从底层重新训练。

【Oak Lab 的终极目标】

如果 Oak 只是解决“模型记忆”,没那么值得关注。其真正野心大的地方是 Sutton 想把持续学习和自主形成抽象能力连起来。今天 AI 会做数学、下棋,但这些任务的“世界规则”人类已提前告诉它,现实世界不是围棋,智能体在开放环境要知道什么值得预测等。顶尖运动员和科学家会建立概念体系和提出新抽象,Sutton 认为当前 AI 最缺失“先学世界模型再规划”的能力。Oak Lab 的终极目标是打造一个从微小感知到宏大计划都能统一组织知识的 AI 系统,它要持续训练不失控、修正自己不混乱、吸收新经验且保持长期知识连贯,即想要的不是更会回答问题的模型,而是能长期自洽并变好的心智。这条路不轻松,要跨过一系列未解决问题,研究团队要容忍性能不如现有产品。对大公司来说,“先退一步、再换范式”的选择不容易,但这也许正是 Sutton 想提醒行业的。大语言模型已证明规模化学习的力量,会继续是重要技术基础,但把语言能力等同于完整智能、训练结束等同于学习完成,可能让行业错过关键东西。在 Sutton 的设想里,未来不是单一全知全能模型统治所有任务,而是有许多因经历不同而成长的“心智”,它们在不同环境学习不同知识,彼此无法穷尽地替代,这更接近真实世界:世界大,系统学不完;智能是遇到新问题能继续长出新理解。而 Oak Lab 要下注的正是这件事。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐