机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思

机器人前瞻7月28日报道,近日,英伟达高级研究科学家Jim Fan与斯坦福大学教授李飞飞团队及其合作者,发布新作《RoboTTT:机器人策略的上下文扩展》,推出了机器人模型与训练方案RoboTTT

当前的机器人基座模型大多只能处理单步或短历史的视觉运动上下文,而ROBOTTT可以将视觉运动上下文扩展至8K个时间步,比现有的先进策略高出三个数量级,且不会增加推理延迟。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ 论文封面(图源:《RoboTTT:机器人策略的上下文扩展》)

在此上下文长度下,RoboTTT赋予了机器人基于人类演示视频的单样本上下文内模仿基于自身历史数据的实时策略优化面对外部干扰时的高鲁棒性、在多阶段、长时序任务中展现出更强的闭环控制性能的全新能力

与此同时,该方案结合了序列动作强制与截断时间反向传播技术。

这意味着,在高难度的真实机器人操作任务中,ROBOTTT比单步上下文基线模型的整体性能提升了87%。它还完整实现了一个耗时5分钟、包含10个阶段的装配任务,而所有基线模型均未成功。在8K时间步下训练的ROBOTTT,比1K时间步训练的同模型性能高出62%

这表明上下文长度可以作为机器人基座模型的一个全新扩展维度。

一、模型学会了从上下文视频中蒸馏学习

目前大多数先进的机器人基座模型,都仅在单步或短历史视觉运动上下文下工作。相比之下,上下文长度早已成为大语言模型的重要扩展维度。这就引出一个问题:要如何构建能够从任意长上下文中学习并加以利用的视觉运动策略?

而此次李飞飞团队推出的机器人模型和训练方案RoboTTT,其核心逻辑是,将测试时训练机制融入到视觉-语言-动作(VLA)等机器人基座模型中。

RoboTTT本质上是一个序列模型。它的循环状态由“快权重”组成。与推理阶段冻结的“慢权重”不同,快权重在训练和推理阶段都会通过梯度下降进行实时更新。它将历史轨迹信息压缩进权重空间,并在长上下文条件引导下进行精准检索。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ RoboTTT的模型架构、训练和推理(图源:《RoboTTT:机器人策略的上下文扩展》)

1、模型架构

ROBOTTT由一个视觉-语言模型(VLM)主干和一个带有TTT层的扩散Transformer(DiT)动作头组成。团队在自注意力层和交叉注意力层之后添加TTT层。这样,注意力层处理单个时间步内的信息,而TTT层就可处理跨时间步的信息。

为了提高计算效率,模型不会将VLM Token直接传过TTT层,而是使用较少数量的寄存器Token(Register Tokens)来跨时间传递视语言信息。

为了保留预训练VLA模型的知识,ROBOTTT将基座模型权重初始化,并采用了可学习的门控机制,TTT输出经Tanh Gating后再加入注意力输出。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

通过这种方式,ROBOTTT学会了动态调整TTT层的贡献,同时不会破坏预训练模型的计算逻辑。

2、序列训练

该团队在机器人轨迹序列上训练ROBOTTT,使快权重在每个训练序列内更新,从而同时学习到合适的快权重初始化值及其更新动态。

在序列训练中,该方案结合了序列动作强制与截断时间反向传播技术。

在训练中,ROBOTTT使用Flow-Matching目标进行动作训练。

序列动作强制为序列中的每个动作块独立采样噪声水平,如果不这样做,训练会变得不稳定。因为在整个序列中共享同一个噪声水平,会导致整条序列要么过于简单,要么过于艰难,难以有效学习。

此外,因为在长序列上进行全反向传播(BPTT)需要存储每个时间步的激活值,显存会随序列长度线性增长。因此该方案采用截断时间反向传播(TBPTT),即输入序列被划分为多个分段,梯度仅在每个分段内部流动。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

关键在于,快权重会在分段边界处跨段传递。因此TTT会在整条序列上持续进行,但它们的梯度会在分段边界处切断。GPU显存占用因此由分段长度决定,而非总序列长度。这使得在固定显存预算下训练任意长度的上下文成为可能。

3、从上下文中高效学习

通过在特定时间步屏蔽Flow-Matching损失,这些时间步仅充当纯上下文。它们只更新快权重,而不提供模仿目标。这种灵活性使ROBOTTT 能够从异质上下文中学习,例如人类演示视频或机器人自身的非最优Rollout数据。

从上下文视频演示中模仿:

将人类演示视频序列与同一任务的机器人轨迹成对组合后发现,人类视频序列仅更新快权重,动作损失则在以更新后的快权重为条件的机器人轨迹上计算。

在此类成对数据上训练后,模型学会了从上下文视频中提取任务信息。测试时,只需以未见任务配置的单条人类视频为条件,即可实现单样本模仿。

DAgger蒸馏:

每当机器人犯错时,人类操作员就会介入并给出纠正动作。标准的DAgger会在人类纠正数据上进行微调,并丢弃机器人做错的动作。然而,恰恰是这些做错的动作,揭示了人类的纠正动作针对的是哪种错误。

ROBOTTT巧妙地同时利用了这两者,在序列训练期间,人类执行的纠正动作和机器人本身的非最优动作,这一整个交互历史都会用于更新快权重,并且Flow-Matching损失仅在人类纠正动作上计算。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

这种将失败作为上下文,纠正作为目标的非对称性,正是将人类“从失败到纠正”的映射逻辑蒸馏进快权重的核心机制。模型学会了针对失败做出纠正,而不只是模仿纠正动作。

在测试时,模型可以在线执行此类纠正,无需人类干预。它做出的纠正随后会进入历史动作,并被吸收进快权重中,就像训练期间吸收人类纠正一样。

二、上下文越长,性能越强

研究团队将RoboTTT与GR00T N1.7(51)、GR00T N1.7 Hist.、GDN三种基线方法,在模型车装配、电路板组装和齿轮机器人装配,这三个需要双臂协同与灵巧操作的长时序装配任务上进行了对比评估。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ 模型车装配(图源:《RoboTTT:机器人策略的上下文扩展》)

所有方法均在相同的任务数据上进行训练。其中序列模型采用1K时步的上下文长度,非序列模型则在匹配的计算预算下进行训练。每种控制方法均在不同的构型下进行20次测试。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

实验后得出了结论:

1、RoboTTT在长时程任务中的表现持续优于基线方法。ROBOTTT平均任务完成得分达到79%,比单步上下文基线高87%,比最佳基线GDN高41%。在耗时长达5分钟的齿轮机器人装配任务中,ROBOTTT是唯一实现完整成功的模型。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ 齿轮机器人装配(图源:《RoboTTT:机器人策略的上下文扩展》)

2、预训练上下文越长,闭环性能越好。如下图所示,当预训练上下文长度从128扩展到8K时间步时,ROBOTTT的闭环性能呈现出持续稳步上升的趋势。从1K时间步开始,它就超越了所有短上下文基线,且没有任何饱和迹象。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

3、单样本模仿与抗干扰在电路板装配任务中,ROBOTTT只能基于上下文中的人类视频完成单样本模仿。

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

▲ 电路板组装(图源:《RoboTTT:机器人策略的上下文扩展》)

结果显示,ROBOTTT仅凭一条人类演示视频,在10次新配置装配中成功了6次。GDN没有取得完全成功,任务完成分数为33%。在外部干扰测试中,ROBOTTT展现出了在线恢复与重新尝试能力。

结语:向更长时序、更自适应的具身智能迈进

ROBOTTT证明了上下文长度可以作为机器人基座模型的一个全新扩展维度研究团队将视觉运动上下文从主流方案的数十步扩展至8K个时间步,比现有先进策略高出三个数量级,且不增加推理延迟。这一突破带来的性能提升是显著的。

上下文的长度赋予了机器人前所未有的能力,基于单条人类演示视频完成单样本模仿、从自身错误历史中在线学习并自我纠正、在外部干扰下保持高鲁棒性执行长时序任务。RoboTTT为未来开发具备更长时序记忆、更强自适应能力的具身智能,奠定了坚实的技术基础与扩展路径。