科技·商业·财经

AI开始改进“改进自己的方法”,RSI进入平方时代

   时间:2026-09-14 16:50 作者:量子位

允中 发自 凹非寺

让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为:

递归自我改进(Recursive Self-Improvement,RSI)。

但几乎所有RSI系统都是同一套结构:一个固定不变的改进程序,反复作用于模型。并往往只从Harness、Data或Model RSI的单一视角切入。

为了回应这一难题,CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校发布metaRSI-v1。

这是全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,能够改进“自我改进的过程”。

RSI由此进入“平方时代”。

△论文首页

在没有任何外部教师模型参与下,metaRSI-v1使得一个仅30亿激活参数的小模型,在四项基准上平均自我提升10.9分;并且让GPT-5.6、Claude Opus 5等六款前沿旗舰模型,平均提升7.3分。

更重要的是数字背后, metaRSI-v1是一套试图统一整个RSI领域的架构语言:包括一个内核、两条编排轴、三个算子、整个元RSI层,以及五大定律。

△metaRSI-v1概览

首次被统一的Loop Kernel范式

Loop Kernel是metaRSI-v1首次提出的自我改进统一形式。

它第一次把“进步如何发生”抽象成一条与对象无关的闭环:消费反馈得到的学习信号,在Data、Harness、Model上提出改动,交由验证器裁决,并将结果回流为下一轮信号。

Data、Harness、Model从此开始能够被统一成同一Kernel的不同实例化算子,可组合、可统一调度,自我改进由此第一次拥有了统一、可复用的底层骨架。

△Loop Kernel范式

改进空间:Data-RSI、Harness-RSI、Model-RSI

沿用同一个Loop Kernel,自我改进在三个空间上展开,分别由Data-RSI、Harness-RSI、Model-RSI三个算子承担并协同完成。

Data-RSI:从自身运行轨迹提取学习信号,经校验用于合成数据交由下游消费,标定并放大模型正向能力与负向能力边界。

Harness-RSI:利用学习反馈信号,在Harness拆分出的System Prompt、Skill、MCP、Tools、Memory五个可插拔槽位上生成改进,做加法与减法。

Model-RSI:更新模型自身的参数与结构,把反复验证有效的行为内化进模型。

纵横之间:让改进自己找到最优路径

横轴(horizontal orchestration)编排算子的应用顺序:RSI² Agent在每个决策点根据信号反馈选定下一个算子,再把该算子有机衔接编排送入RSI Loop Kernel执行。

纵轴(vertical optimization)优化算子的内部策略:RSI² Agent向目标算子专属的RSI² Sub-Agent下发指令,后者根据学习信号与环境反馈等改写算子本身的RSI规则,优化RSI系统本身。

递归之上的递归:三层改进与“元层”的诞生

整套架构由四个Agent协调运作,并且均能被人类专家局部替换形成human-in-the-loop系统。

metaRSI² Agent:学习如何进行合适的纵横优化,优化RSI² Agent的策略学习。

RSI² Agent:在每个决策点选择进行横轴(指定下一个算子)或纵轴(向Sub-Agent下发策略改写指令)优化。

RSI² Sub-Agent:在纵向优化中,接受来自RSI² Agent的执行指令,对算子内部的RSI策略进行调整。

Transition Agent:负责衔接横向编排中上游算子的产物与下一个算子对产物的消费。

四个Agent对应形成三个RSI优化Level:算子改进目标系统,双轴编排改进算子用法,元层改进双轴编排策略本身。

实验:小模型与前沿模型均实现自我进化

实验沿两条路线展开:

小模型路线使用可训练的开源模型,Data、Harness、Model三个算子全部启用;

前沿模型路线面向Claude Opus 5,GPT-5.6 sol,Kimi K3等顶级模型,这类模型参数巨大或为闭源模型,仅启用Data与Harness算子。

路线一:小模型的自我改进

目标模型为Qwen3.5-35B-A3B(35B总参、3B激活),在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项基准上评测。

△metaRSI让Qwen3.5-35B-A3B实现自进化

metaRSI-v1平均提升10.9分,SWE-bench Pro解决率接近翻倍,meta层为RSI带来更高的天花板,连续自进化的累计增益提升显著。

△“改进改进者”,metaRSI让小模型累计自进化增益扩大

路线二:前沿模型的自我改进

多款前沿模型在Terminal-Bench 2.1上平均提升7.3分,说明metaRSI范式对前沿模型同样成立,旗舰模型同样留有可观的自我改进空间。

△六款前沿模型的自我改进

五条定律:为“机器如何进步”立法

metaRSI梳理出两条互补的改进路线:Harness-RSI保持权重不变,让自我改进覆盖任何可通过接口调用的模型;Model-RSI通过训练把能力内化进模型。

且metaRSI首次重新定义了Data-RSI,作为模型的能力边界探测与放大器,通过对执行轨迹与外界反馈learning-signal的联合分析得到经过验证的经验并scale为可复用的数据,并标定这些经验能够支撑到哪里,框定模型能力的正、负边界。

Data-RSI的产物同时供给Harness-RSI与Model-RSI消费,两条路线的改动结果又能够流回Data-RSI,重新标定能力边界、驱动下一轮,能力由此逐轮披露、累积。

在这一过程中,Harness不仅能做加法还能做减法:Data-RSI放大暴露的问题经Model-RSI内化之后,原本吸纳在Harness中的知识会变成冗余,Harness-RSI系统在回放校验下将其删除,能力留下,成本退场。

在此之上,metaRSI提炼出五条定律。

定律一:验证决定自我改进的前沿。

一个领域能不能形成自改进闭环,取决于该领域任务能否被检验,是否有合适的verifier。

定律二:自我认知会过期,重新发现能力边界是速率瓶颈,RSI改变agent能力,其原本旧的系统描述随即失效。

定律三:能力与载体无关但成本与载体有关。

例如同一项能力放在Harness里每次推理都要重付成本,内化进Model只需付一次,成熟循环能够持续把能力迁移到更便宜的载体。

定律四:可信度由不可写面度量。

在闭环内部,真正能力变强和放宽成功标准会得到完全相同的分数,而且这种偏差从内部无法察觉、也无法靠统计纠正。

定律五:循环不凭空创造能力,一切增益本质上都是外部信息熵的输入或能力的激发。

自改进只能重新组织、放大并固化模型已经具备的潜力。因此每次提升都要分清两部分:哪些是把已有能力放大出来的,哪些是真正从外部新引入的。

环环相扣,终成文明:让每个科学领域都拥有进化闭环

人类历史每一次的跃迁,都源于“生产答案的方式被重新发明”。

metaRSI要在AI时代把这件事再做一遍。

它背后的CosmosMind团队,是一支由清华/北大/斯坦福等海内外名校硕博、头部大厂基模核心组研究员、著名产业方领军人物组成的小而精的团队,长期从事大规模模型训练/RSI/智能体/科学计算等工作,在顶会顶刊上发表过诸多有影响力的论文。

这一次,他们没有选择再做一个更大的模型,而是把全部精力押在了“改进改进本身”这件事上。

团队同步了开源RSI-Harness,这是一个能自我学习、自我迭代的Harness,并可以在使用中为不同科学领域与工程实践沉淀出可移植的Harness Genome。

Cosmosmind已经把目光投向了闭环触碰物理世界:可编程仪器、自动化实验室成为执行器和验证器,仿真、台架实验、真实仪器可以像三级火箭一样逐级推进,把不可逆的昂贵操作放到最后——第一个在物理世界关上的进化循环,很可能不会出现在开放环境里,而会出现在自动化实验室中。

研究者面对的不再是一堆待验证的猜测。人类只需负责定义问题与价值判断,而机器负责让“从假设到验证”的循环,以过去无法想象的速度开始转动。

相信在metaRSI的后时代,AI将会从解题工具走向文明级的进化引擎。

 
 
更多>同类内容
全站最新
热门内容