自我改进进入平方时代:MetaRSI 首次把 RSI 作用于 RSI 自身
CosmosMind 联合斯坦福/伯克利/MIT/清华/北大发布 MetaRSI-v1:首次把递归自我改进作用于 RSI 自身,30B 激活小模型四项基准平均提升 10.9 分,并开源 RSI-Harness。

综述
过去两年,AI 领域最激动人心的叙事之一,是让模型自己改进自己:自己生成训练数据、自己改写提示词、自己修复代码。这条路线叫递归自我改进(Recursive Self-Improvement,RSI)。
但一个少有人追问的问题是:这些系统里,「改进系统的那套程序」本身,进化了吗?答案是没有。从 STaR、Self-Refine 到 STOP、Darwin Gödel Machine、AFlow,几乎所有 RSI 系统都遵循同一个结构——一套固定的改进程序反复作用于模型。模型在变强,但「让模型变强的方式」始终固定,被困在一阶自我改进里。
近日 CosmosMind 联合斯坦福、伯克利、MIT、清华、北大等十多个高校研究者发布技术报告 MetaRSI-v1,提出首个统一 Model-RSI、Data-RSI、Harness-RSI 的元递归自我改进架构,把递归自我改进作用于 RSI 自身。论文标题干脆写成 RSI²——自我改进,进入「平方时代」。

专业分析
Loop Kernel:第一次给「进步如何发生」一个统一骨架
MetaRSI-v1 首次把自我改进抽象成一条与对象无关的闭环:消费反馈得到学习信号,在 Data、Harness、Model 上提出改动,交由验证器裁决,再把结果回流成下一轮信号。Data、Harness、Model 从此不再是三套割裂的流程,而是同一个 Kernel 的不同算子实例——可组合、可调度,自我改进第一次有了统一、可复用的底层骨架。

三种算子,两个改进的「可写面」
沿用同一个 Loop Kernel,自我改进落在三个可写面上。Data-RSI 从自身运行轨迹提取学习信号,经校验合成数据,同时标定模型能力的正、负边界——MetaRSI 把它重新定义为「能力边界探测器与放大器」。Harness-RSI 在 System Prompt、Skill、MCP、Tools、Memory 五个可插拔槽位上做加法和减法。Model-RSI 更新参数与结构,把反复验证有效的行为内化进模型。
值得注意的设计是 Harness 的「减法」:Data-RSI 放大暴露的问题经 Model-RSI 内化后,原本吸纳在 Harness 里的知识会变成冗余,被回放校验后删除——能力留下,成本退场。这暗合一个朴素判断:同一项能力放 Harness 里每次推理都要重付成本,内化进模型只需付一次。
五条定律:进步的单位是循环
报告提炼了五条定律,信息密度极高:验证决定自我改进的前沿(没有 verifier 就没有闭环);自我认知会过期、重新发现能力边界是速率瓶颈;能力与载体无关但成本与载体有关;可信度由「不可写面」度量(内部无法察觉放水与真变强的区别);循环不凭空创造能力,一切增益都是外部信息熵的输入或已有潜力的激发。
最后这条尤其克制——自改进只能重新组织、放大并固化模型已具备的潜力。所以每次提升都要分清:哪些是放大出来的,哪些是真正从外部引入的。
关联信息与影响
MetaRSI 与今天的国产 Agent-Native 路线(如 NeoHorse 用 Harness 执行轨迹训练模型)其实指向同一件事:Harness 与 Model 的边界正在流动。NeoHorse 把「路由与执行经验」单轮注入模型权重;MetaRSI 则给出一个让这个注入过程自身也能被改进的闭环框架——一个偏工程验证,一个偏架构语言,互为注脚。
值得单独观察的是 RSI 的开源节奏。MetaRSI 同步开源了 RSI-Harness(能自我学习、自我迭代的 Harness)并搭建 Genome 开放社区,希望每个科学领域沉淀自己的脚手架。当一个领域只需准备三样东西——能跑出结果的任务族、一套判断对错的验证器、一份粗糙的初始脚手架——新闭环的启动成本会被压得非常低。
未来展望
MetaRSI 并不要求一个领域一步到位跑完整条 Loop。科学研究和工程实践本身就是流水线:提出假设、设计实验、执行、解读,每个环节都有清晰的输入输出。先在一个环节跑通小循环,产物自然成为下游起点;足够多的小循环衔接起来,就织成覆盖整个领域的大循环。
可以预见的演进方向有两个:一是闭环里 Agent 分工的进一步细化(Transition / RSI² / RSI² Sub / MetaRSI² 四层 Agent 已显雏形);二是验证器本身的可靠性——五条定律里「可信度由不可写面度量」那条,决定了这套架构的天花板不在改进速度,而在如何对抗闭环内部的自欺。
信号强度
- 研究者:一套可复用的 RSI 统一语言,过去散落的 STaR/Self-Refine/Gödel Machine 等路线第一次可以放在同一框架里比较。
- 开发者:RSI-Harness 开源,等于拿到一个会自己迭代自己 Prompt/Skill/Tools 的起点;「能力放 Harness 还是放模型」从此变成可计算的成本问题。
- Agent 工具链玩家:MCP、Skill、Memory 等槽位被明确为可写面,Harness 的「可改进性」成为产品竞争力。
- 大模型厂商:闭源旗舰同样适用 Data/Harness-RSI(不碰权重),意味着「模型之外的自我改进」也会卷起来。
- 普通用户:短期内最实在的信号是——能自我迭代的本地/工具链 Agent 会先出现,旗舰模型自身升级则仍是厂商节奏。
信息局限说明:本文依据 CosmosMind MetaRSI-v1 技术报告与机器之心报道整理;实验数据与架构细节以论文原文为准,四层 Agent 分工与五条定律为报告自述,尚未经独立复现。项目主页 github.com/CosmosMind-ai/RSI-Harness。
全球首个统一 Model-RSI / Data-RSI / Harness-RSI 的元递归自我改进架构,自我改进进入「平方时代」;无外部教师,小模型与六款前沿旗舰均实现自进化。
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。
原始报道:https://www.cosmosmind.ai/research/metarsi-v1.pdf(机器之心)

