在人工智能领域,大模型的能力获取主要依赖预训练和后训练阶段,一旦部署上线,其参数便基本固定,难以通过持续学习适应环境变化。这种“静态”模式虽然能处理大量信息,却无法像人类一样从新经验中积累长期能力。如何突破这一局限,让AI具备持续学习的能力,已成为行业亟待解决的核心问题。
强化学习领域先驱、2024年图灵奖得主Rich Sutton近日在红杉资本播客《Training Data》中指出,当前大模型虽在语言处理上取得突破,但仅覆盖了智能的有限部分。真正的智能系统不应止步于部署时的状态,而需具备从真实经验中实时更新认知的能力。他强调,依赖外部知识库或上下文调整的“伪学习”无法替代模型内部知识结构的持续进化。
Sutton的批评直指现有技术的深层矛盾。例如,AI助手可通过用户反馈优化回答,甚至通过记忆功能模拟“个性化”服务,但这些改进仅限于当前交互场景。一旦对话结束或模型参数未更新,所有“学习”成果便会消失。这种模式与人类通过经验积累知识的机制存在本质差异,导致AI难以应对动态环境中的复杂挑战。
持续学习的技术障碍远比想象中复杂。Khurram Javed等人在《Nature》发表的研究揭示,深度学习模型在连续学习新任务时,会因“可塑性损失”逐渐丧失吸收新知识的能力。传统解决方案通过混合大量数据训练来缓解这一问题,但随着历史数据规模膨胀,计算和存储成本呈指数级增长,实际可行性大幅降低。
合成数据曾被视为破局关键,但Sutton对此提出尖锐质疑。他认为,模拟环境虽能扩展数据规模,却无法复现现实的复杂性。以自动驾驶为例,即便车辆在虚拟环境中行驶数十亿公里,其决策系统仍可能因忽略真实路况中的微妙变量而失效。真正的进步应来自模型直接从驾驶经验中自主修正环境模型,而非依赖工程师手动调整参数。
这种观点与Sutton在2019年提出的“苦涩的教训”一脉相承。他指出,过度依赖专家知识或人工标注数据的系统,终将被能从数据中自主发现规律的通用方法超越。AlphaGo Zero的自我对弈模式和大语言模型的大规模文本学习虽部分验证了这一理论,但Sutton认为,现有模型仍受限于人类数据供给能力,未能实现真正的自主进化。
为突破这一瓶颈,Sutton与Khurram Javed创立了AI初创公司Oak Lab,并提出以经验学习、时间抽象和规划为核心的OaK架构。该架构通过“步长优化”技术,为不同参数设置差异化更新速度,使稳定知识得以保留,同时加速新内容的学习。其“生成与检验”机制则通过持续引入随机初始化的神经单元,并检验其对模型性能的贡献,从而动态优化网络结构。
基于上述技术,Oak Lab开发了“持续反向传播”算法,并在《Nature》发表相关成果。该算法通过在训练过程中动态添加新单元,使模型在积累知识的同时学习如何自我更新,从而减少新知识吸收对原有能力的破坏。不过,这一方法需从头训练新模型,无法直接应用于现有静态大模型。
Oak Lab的终极目标远不止于持续学习。Sutton团队计划构建覆盖从微观感知到宏观决策的全谱系知识系统,使模型能自主生成高层抽象并进行规划推理。为实现这一愿景,公司设定了极具挑战性的技术指标:在五到十年内开发出万亿参数规模、功耗仅20瓦的持续学习心智模型——这一能耗水平与人类大脑相当,意味着智能提升将依赖算法效率的飞跃而非单纯算力堆砌。
按照摩尔定律推算,若计算效率每18个月提升一倍,十年可实现两个数量级的进步。Sutton认为,当前2000瓦级的系统有望通过算法优化降至目标能耗。但这一模型不会追求“全能”,而是通过同一架构衍生出多个智能体,各自基于不同环境和经历形成独特知识体系。
面对技术实现的复杂性,Oak Lab选择稳健的扩张策略。Khurram Javed表示,公司初期将聚焦核心团队建设,确保成员对研究方向形成高度共识,再逐步扩展至数个专业化小组。这种“小而精”的模式旨在维持研究效率,避免因规模扩张导致方向分散。








