机器人不能停下来等模型:SmoothRL 把「异步执行」这笔账算清楚了
星尘智能发布 SmoothRL:机器人在异步执行中做在线强化学习,只对真正执行的动作更新策略。投掷成功率 39%→94%,给笔戴帽 8%→83%。异步时代的 RL 账,第一次有人算明白了。

真实机器人没有暂停键。这是机器人公司踩过无数坑之后才认下来的事实:模型越来越大、推理越来越慢,但机械臂不能每隔几百毫秒停下来等下一段动作算完——尤其投掷这类高动态任务,一次停顿就能让积累的速度归零。于是「异步推理」成了部署常态:手上做 A,模型已经在后台算 B。可异步执行给在线强化学习出了道新题:模型「计划过」的动作,和机器人「真正做过」的动作,对不上了。
综述
星尘智能(Astribot)基座模型团队发布的 SmoothRL,全称是「异步执行期间的在线强化学习」,解决的正是上面那道题:大模型异步推理成为常态后,在线 RL 到底该从哪些动作里学。
核心机制是把一段 action chunk 按执行状态切成三块:已提交区域(上一轮推理已定、无法再改)、执行区域(本轮真正会执行的)、丢弃区域(模型生成过但会被下一轮推理替换、根本不落地)。SmoothRL 的原则只有一条:机器人真正执行了什么,就只对什么做强化学习——梯度只穿过执行区域。
训练侧同样较真:rollout 里直接跑异步推理,让模型计算与机器人执行并行发生,replay buffer 记录的就是真实时间关系下的轨迹。团队把这一原则概括为「Reinforce in Deployment」——不是先在理想同步世界里练好再换异步部署,而是从训练第一天就面对真实执行动态。
实现上以微调后的 π0.5 为基础策略,沿用 RLT 骨架,用轻量 TD3 式 actor-critic 在原始动作空间做残差修正。星尘 S1 机器人 30Hz 执行、5Hz 推理请求(每 200ms 一个新 chunk),基础策略每次预测 32 帧。
专业分析
SmoothRL 的贡献,是给异步 RL 补上了一本「明细账」。传统在线 RL 默认模型生成什么、机器人就执行什么;异步执行打破了这个对应——整段 chunk 里,有些动作来不及改、有些真正做了、有些根本没发生。如果不分青红皂白整段拿来优化,就会出现「没做过的动作被记功、来不及改的动作被背锅」的错账。把 chunk 切成三区、只让梯度穿过执行区,等于把「功劳」和「锅」只记在真正落地的那部分动作头上。
这个设计有双重意义。第一重是优化目标与真实经验对齐:模型学的,就是机器人实际经历的过程,因果不串位。第二重是训练-部署同构:既然生产环境必然是异步的,就别在同步的理想化环境里自欺欺人——rollout 里就并行,学到的策略才扛得住真机的时间压力。
结果也印证了方向:动态投掷成功率从基础策略的 39% 提到 94%,给笔戴帽 8%→83%(允许误差约 5mm),快递开箱 30%→90%(1mm 刀片插 2-3mm 缝)。更值得玩味的是细节——开箱的学习曲线并非一路上升:150 个 episode 时一度从 30% 跌到 20% 再爬回。真实在线探索本来就不是单调变好,肯把这种「丑」曲线写出来,说明团队对方法有底气。
顺带一提平滑性:在线 RL 后一次自主投掷中,末端执行器加速度 RMS 降 52%、急动度降 47%——不只是更准,而且更顺。
关联信息与影响
SmoothRL 踩中的,是机器人基础模型从「会不会」走向「稳不稳」的转型期。过去几年行业在解决能力宽度:用更多数据、更强模型让机器人会更多技能;而真实部署后的新问题往往不是完全不会,而是差几毫米、差半拍、换一个物体位置就不稳定。SmoothRL 代表的「部署中持续学习」,与 OpenWAM 这类世界-行动模型预训练恰好构成互补:一个负责把能力做大,一个负责在真实环境里把能力磨准。
对行业还有个隐性启示:当动作序列预测(action chunk)成为 VLA 的主流输出形态,异步执行就是绕不开的物理现实。谁先解决「异步下的学习信号怎么算」,谁就拿到机器人持续进化的钥匙——这比单点成功率更有战略价值。
影响也有另一面:在线 RL 需要真实机器人持续产出数据,意味着「部署即训练」会放大对硬件与运维的要求,小团队要跟进的成本并不低。
未来展望
短期,最值得关注的是方法向更多任务与本体迁移的表现——双臂、移动操作、多机协作场景里,三区切分是否依然干净、残差修正是否够用。
中期,SmoothRL 的账本思路大概率会被收编进主流机器人学习框架:动作 chunk 的「提交/执行/丢弃」语义会变成异步 RL 的标准抽象,replay buffer 的时间结构也会被重新设计。
长期,如果「Reinforce in Deployment」成为默认范式,机器人公司会重新思考产品形态:卖出去的每一台机器人都是数据采集器,也是持续进化的个体——届时「模型在云端统一升级」的叙事,会被「每台机器在自己的经验里变强」部分替代。
信号强度
大模型厂商:机器人基础模型的价值从「参数大」转向「能在部署中持续修正」,模型更新机制的设计权重上升。
研究者:获得异步在线 RL 的清晰范式与真实数据验证,三区切分、训练-部署同构都是可复用的实验设计。
开发者:机器人软件栈需要同时管理推理异步与 RL 数据回路,实时系统的复杂度会上一个台阶——这也是新的工程岗位机会。
内容创作者:机器人演示视频会越来越多地展示「越用越顺」的过程,而不是出厂即巅峰;自动化叙事会从「能力」转向「成长」。
关联产业链:伺服、传感器与边缘推理硬件是隐性受益方——异步执行对实时算力与低延迟链路的依赖,会推高机器人的单机硬件价值。
机器人世界有一句老话:快就是慢,慢就是快。SmoothRL 想证明的是另一句:让机器人在奔跑中学习,比让它停下来想清楚再跑,更接近真实世界的玩法。
harness/SmoothRL(AI 情报库 2026-09-05 收录)
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。


