深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

自我改进进入平方时代:MetaRSI 首次把 RSI 作用于 RSI 自身

2026-09-09·机器之心·模型推理RSI递归自我改进元递归Harness自我进化开源
▮ SIGNAL SUMMARY · 摘要快读

CosmosMind 联合斯坦福/伯克利/MIT/清华/北大发布 MetaRSI-v1:首次把递归自我改进作用于 RSI 自身,30B 激活小模型四项基准平均提升 10.9 分,并开源 RSI-Harness。

自我改进进入平方时代:MetaRSI 首次把 RSI 作用于 RSI 自身

综述

过去两年,AI 领域最激动人心的叙事之一,是让模型自己改进自己:自己生成训练数据、自己改写提示词、自己修复代码。这条路线叫递归自我改进(Recursive Self-Improvement,RSI)。

但一个少有人追问的问题是:这些系统里,「改进系统的那套程序」本身,进化了吗?答案是没有。从 STaR、Self-Refine 到 STOP、Darwin Gödel Machine、AFlow,几乎所有 RSI 系统都遵循同一个结构——一套固定的改进程序反复作用于模型。模型在变强,但「让模型变强的方式」始终固定,被困在一阶自我改进里。

近日 CosmosMind 联合斯坦福、伯克利、MIT、清华、北大等十多个高校研究者发布技术报告 MetaRSI-v1,提出首个统一 Model-RSI、Data-RSI、Harness-RSI 的元递归自我改进架构,把递归自我改进作用于 RSI 自身。论文标题干脆写成 RSI²——自我改进,进入「平方时代」。

一个半透明的发光环圈住层层嵌套的自我镜像,外圈的程序试图改进内圈的程序,层层向上,画面安静有秩序感
在没有外部教师参与的情况下,MetaRSI-v1 让小模型在四项基准上平均自我提升 10.9 分,并让 GPT-5.6、Claude Opus 5 等六款前沿模型平均提升 7.3 分。

专业分析

Loop Kernel:第一次给「进步如何发生」一个统一骨架

MetaRSI-v1 首次把自我改进抽象成一条与对象无关的闭环:消费反馈得到学习信号,在 Data、Harness、Model 上提出改动,交由验证器裁决,再把结果回流成下一轮信号。Data、Harness、Model 从此不再是三套割裂的流程,而是同一个 Kernel 的不同算子实例——可组合、可调度,自我改进第一次有了统一、可复用的底层骨架。

一台发光的环形流水线机器,三个插件槽位分别标注数据的清洗、工具的记忆与模型的小修,环形轨道周而复始
进步被抽象为一条闭环:学习信号 → 对 Data/Harness/Model 提改动 → 验证器裁决 → 回流为下一轮信号。

三种算子,两个改进的「可写面」

沿用同一个 Loop Kernel,自我改进落在三个可写面上。Data-RSI 从自身运行轨迹提取学习信号,经校验合成数据,同时标定模型能力的正、负边界——MetaRSI 把它重新定义为「能力边界探测器与放大器」。Harness-RSI 在 System Prompt、Skill、MCP、Tools、Memory 五个可插拔槽位上做加法和减法。Model-RSI 更新参数与结构,把反复验证有效的行为内化进模型。

值得注意的设计是 Harness 的「减法」:Data-RSI 放大暴露的问题经 Model-RSI 内化后,原本吸纳在 Harness 里的知识会变成冗余,被回放校验后删除——能力留下,成本退场。这暗合一个朴素判断:同一项能力放 Harness 里每次推理都要重付成本,内化进模型只需付一次。

五条定律:进步的单位是循环

报告提炼了五条定律,信息密度极高:验证决定自我改进的前沿(没有 verifier 就没有闭环);自我认知会过期、重新发现能力边界是速率瓶颈;能力与载体无关但成本与载体有关;可信度由「不可写面」度量(内部无法察觉放水与真变强的区别);循环不凭空创造能力,一切增益都是外部信息熵的输入或已有潜力的激发。

最后这条尤其克制——自改进只能重新组织、放大并固化模型已具备的潜力。所以每次提升都要分清:哪些是放大出来的,哪些是真正从外部引入的。

关联信息与影响

MetaRSI 与今天的国产 Agent-Native 路线(如 NeoHorse 用 Harness 执行轨迹训练模型)其实指向同一件事:Harness 与 Model 的边界正在流动。NeoHorse 把「路由与执行经验」单轮注入模型权重;MetaRSI 则给出一个让这个注入过程自身也能被改进的闭环框架——一个偏工程验证,一个偏架构语言,互为注脚。

值得单独观察的是 RSI 的开源节奏。MetaRSI 同步开源了 RSI-Harness(能自我学习、自我迭代的 Harness)并搭建 Genome 开放社区,希望每个科学领域沉淀自己的脚手架。当一个领域只需准备三样东西——能跑出结果的任务族、一套判断对错的验证器、一份粗糙的初始脚手架——新闭环的启动成本会被压得非常低。

未来展望

MetaRSI 并不要求一个领域一步到位跑完整条 Loop。科学研究和工程实践本身就是流水线:提出假设、设计实验、执行、解读,每个环节都有清晰的输入输出。先在一个环节跑通小循环,产物自然成为下游起点;足够多的小循环衔接起来,就织成覆盖整个领域的大循环。

可以预见的演进方向有两个:一是闭环里 Agent 分工的进一步细化(Transition / RSI² / RSI² Sub / MetaRSI² 四层 Agent 已显雏形);二是验证器本身的可靠性——五条定律里「可信度由不可写面度量」那条,决定了这套架构的天花板不在改进速度,而在如何对抗闭环内部的自欺。

信号强度

信息局限说明:本文依据 CosmosMind MetaRSI-v1 技术报告与机器之心报道整理;实验数据与架构细节以论文原文为准,四层 Agent 分工与五条定律为报告自述,尚未经独立复现。项目主页 github.com/CosmosMind-ai/RSI-Harness。

SIGNAL FILE · 情报档案

全球首个统一 Model-RSI / Data-RSI / Harness-RSI 的元递归自我改进架构,自我改进进入「平方时代」;无外部教师,小模型与六款前沿旗舰均实现自进化。

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://www.cosmosmind.ai/research/metarsi-v1.pdf(机器之心)

RELATED SIGNALS · 关联信号