Representation → Dynamics → Control

RepWAM从语义视觉表示,到可迁移的动作

World Action Modeling with Representation Visual-Action Tokenizers

论文版本:2606.13674v2重点:RepViTok / 潜动作 / WAM阅读原论文 ↗

不只把视频压成“能还原画面”的 token:先让视觉 latent 保留语义,再把相邻视觉状态的变化压成低维潜动作,最后在两类表示上学习预测与控制。

96 维每个视觉 latent token
4 维每个潜动作 token
两步先学视觉,再学潜动作 tokenizer
01

核心问题:世界模型需要怎样的表示?

传统 WAM 常继承视频生成模型的 tokenizer。作者认为,这种表示存在两个缺口:

  • 视觉侧:像素重建主要约束外观保真,不直接要求 latent 保留对操作重要的物体语义、空间关系与交互线索。
  • 动作侧:视觉 latent 与机器人电机指令属于不同表示,模型需要学习跨越两者的差异。

RepWAM 的关键组件是 RepViTok(representation visual-action tokenizer)。它不是单一编码器,而是顺序训练的视觉与潜动作两部分。

核心主张:让动作被定义为“语义视觉状态如何变化”,而不只是在预训练时直接预测某一种机器人的关节或末端坐标。

“同一语义空间”不等于视觉与动作逐元素对齐。z 与 ℓ 维度不同;它们通过状态转换任务建立联系。

02

视觉 tokenizer:因果 ViT 自编码器

时空切块与压缩

  • 第一帧:切为 16 × 16 的二维 patches。
  • 后续帧:切为 4 × 16 × 16 的 tubelets,即每组覆盖 4 帧。
  • 同一 latent 时间步内空间注意力全连接,时间上使用因果 mask,不读取未来组。
T′ = 1 + (T − 1) / 4 ; z ∈ ℝT′ × L × 96

这里 T 是原始帧数,T′ 是压缩后的时间步数,L 是每个时间步的空间 token 数。后续的“latent 帧”来自四帧一组的时空压缩,并不等于一张原始图像。

形状示例 · 由切块方式推导17 帧、256 × 256 视频 → 5 个 latent 时间步 × 256 个空间 tokens × 96 维。此例假定尺寸可被切块大小整除,不涉及补齐策略。

它是连续 tokenizer,不是离散码本

正文没有描述 VQ codebook、最近邻量化或离散 token ID;给出的目标也没有 KL 正则。按方法描述,应理解为连续视频自编码器,而非默认套用标准 KL-VAE 或 VQ-VAE。论文表格把它与其他 VAE 比较,不足以证明它采用相同的概率或量化机制。

03

PE 对齐:把语义监督加到 latent 上

同一视频走学生和老师两条路径。Perception Encoder(PE)冻结;学生 Encoder 和线性对齐头可训练。

学生路径 · 可训练

视频 o → Encoder → z

z → 线性投影 Walign → 学生特征

另一路 z → Decoder → 重建视频 ô

老师路径 · 冻结

同一视频 o → PE → G(o)

G(o) → 时间平均池化 → 目标特征

对齐梯度不更新 PE

学生特征与目标特征之间计算 L2 损失
ℒalign = ‖ Walign z − avg(G(o)) ‖²2原文式 (2)

Walign 将 96 维学生 token 映射到老师特征维度。下游 WAM 使用的仍是 z,不是经过对齐头扩维后的特征。

重建与语义共同约束

ℒrec = λ1 ‖o − ô‖1 + λperc ℒperc + λgan ℒgan
ℒvis = ℒrec + λalign ℒalign原文式 (1)–(2)

权重为 λ1 = 1、λperc = 1、λgan = 0.1、λalign = 1。Encoder 必须同时让 z 能够重建画面、能够通过线性映射预测老师特征。

实现边界正文只明确了时间平均池化,没有完整说明窗口、首帧处理、空间网格匹配、PE 型号及取用层。不能把“按每四帧逐 patch 平均”当作已核实实现;线性投影也只能直接解释通道匹配,不能自动解决空间 token 数不一致。

PE 本身是什么?

PE 是一个预训练视觉编码器家族,不是像素自编码器。其 Core 以大规模图文对比学习为基础,再用视频—文本对继续训练;视频分支逐帧编码后平均帧级 embedding。PE 论文发现通用特征常在中间层,并进一步提供面向语言与空间任务的不同后训练版本。

RepWAM 未明确采用 PE Core、Language 还是 Spatial,因此不能直接声称其老师包含 PE Spatial 的 SAM 蒸馏。PE 自身的全局视频平均也不能直接解释 RepViTok 的具体对齐网格。

04

潜动作 tokenizer:把“变化”压成 4 维

视觉 tokenizer 训练完成后被冻结。随后训练一个逆动力学模型 IDM 和一个前向动力学模型 FDM,两者都是 4 层 MLP,hidden size 256。

先编码变化,再验证变化是否有用

ℓt = qφ(zt, zt+1) ∈ ℝ4
(Kt, δt) = fψ(zt, ℓt)
ẑt+1 = Kt zt + δt原文式 (3)
变量形状作用
ztL × 96当前语义视觉状态
ℓt4由前后状态提取的连续变化瓶颈
KtL × L沿空间 token 维度搬运、组合现有内容
δtL × 96补充搬运无法解释的变化

以杯子向右移动为例,Kt zt 可以把描述杯子的内容组合到新位置;δt 补充遮挡变化、新出现内容等无法仅靠搬运解释的部分。这是语义 token 空间的软搬运,不是普通二维光流,也不要求一一对应的位移。

ℓ 不是“左、右、抓、放”等预定义类别,也不是末端位姿或夹爪命令。4 维瓶颈旨在限制下一状态内容直接泄漏,但不能从维度限制本身推出“保证只编码动作”。

正向预测 + 反向重建

ℒfwd = Σt ‖ẑt+1 − zt+1‖²2
ℒcons = Σt ‖ẑt − zt‖²2原文式 (4)

反向项通过把输入状态对换成 (zt+1, zt),重新运行 LAT 来获得预测。它不是显式要求正反向 K 互为逆矩阵,也不是把同一个 ℓ 自动取负。

可迁移性的来源:这里监督的是视觉状态变化,而不是某种机器人的电机坐标;它为后续控制适配提供中间表示,但并不自动等价于跨机器人可直接执行的动作。

05

世界动作模型:在 z 与 ℓ 上联合生成

训练好 tokenizer 后,RepWAM 使用语言指令、初始视觉状态和过去上下文,预测未来视觉 tokens 与潜动作 tokens。基本单位是短时窗内的 visual-action chunk。

ut:t+k = [zt:t+k, ℓt:t+k−1]原文式 (5)
  • chunk 之间:block-causal mask 允许读取过去,不允许看未来 chunk。
  • 视觉与动作分支:共享注意力权重,使用各自的 FFN。
  • 语言:冻结的 PLM text encoder 提取条件,通过 cross-attention 注入。
  • 生成骨干:论文称为 1.3B / 5B 两档,从头训练,不继承 WAN 视频生成骨干权重。

Flow matching 目标

xα = (1 − α) ε + αu ; ε ∼ 𝒩(0, I)
v* = u − ε
ℒFM = 𝔼[‖Fvθ − v*v‖² + λa ‖Faθ − v*a‖²]原文式 (6)–(7),省略条件参数

模型学习从噪声走向真实 visual-action chunk 的速度场。上标 v / a 分别表示视觉与潜动作部分,λa = 1。α 是生成过程的插值时间,不是视频帧时间 t。

不要混淆两种“对齐”

机制发生在哪里解决什么
latent 回归 PE 特征视觉 tokenizer 训练让压缩表示更有语义
视觉 / 动作读取文本条件世界动作模型的注意力层让未来预测服从语言指令

本文写的是 PLM 文本编码器,不是 T5。通用视频生成中“T5 编码文字、VAE 编码视频、DiT 做条件融合”的解释可以帮助理解,但不应替代本文的具体配置。

06

训练路线:不要把几个阶段混为一谈

  1. 训练视觉 tokenizer

    RepViTok 训练数据为 Panda-70M;视觉部分同时优化重建和 PE 对齐。

  2. 冻结视觉 tokenizer,训练 LAT

    从相邻视觉 latent 中提取潜动作,用正向预测与反向重建学习状态转换;此步骤不需要真实电机动作标签。

  3. 世界动作模型预训练

    在 AgiBot 上使用约 100G visual-action latent tokens;动作部分由 LAT 产生,联合建模未来 z 与 ℓ。

  4. 机器人控制适配

    使用 AgiBot、RoboMIND、RoboCOIN、InternA1 混合真实机器人语料,约 300G tokens,轨迹提供与视频对应的连续电机命令。

  5. 下游任务微调与闭环评估

    真实机器人主实验每项任务使用 50 条 demonstrations,微调 500 步;每项任务评估 10 次 rollout。

“Two Stages”潜动作消融指的是先做视觉—潜动作预训练,再适配真实机器人动作,不要与 tokenizer 内部“先视觉、后 LAT”的训练顺序混淆。正文对控制适配具体如何更换输出接口、如何处理维度与时间对齐,说明不够完整。
实施配置摘要 · 原文 §4.1
项目配置
世界模型 expert30 层;hidden 1536 / 3072
动作 expert同为 30 层;hidden 768;论文称约增加 350M 参数
优化Muon,峰值学习率 0.01,BF16
chunk size训练在 [1, 4] 采样;推理设为 2
硬件与序列上限1.3B:64 张 H20 / 200K tokens;5B:128 张 H20 / 160K tokens
07

实验:什么得到支持,什么还没有?

证据 A:更换视觉 tokenizer,控制表现提高

原文表 3 · 固定 1.3B WAM,RoboTwin 2.0,50 任务平均成功率
视觉 tokenizerEasyHard
WAN2.2 VAE78.0%76.0%
RepViTok86.6%83.1%
绝对提升+8.6 个百分点+7.1 个百分点

说明视觉 latent 的设计对下游控制有实质影响;但两种 tokenizer 的架构与训练方式也有差异,不能将全部提升仅归因于某一个对齐损失项。

证据 B:先潜动作预训练、再控制适配更有效

原文表 4 · 1.3B 消融设置,低 gFVD / 高 OLS 更好
方案Seen gFVD ↓Unseen OLS ↑PickFruit
无潜动作预训练61.0114.1530%
Joint Pred:额外头联合预测94.2515.2220%
Two Stages:预训练 → 适配48.2316.9850%

Joint Pred 是论文特定的“世界模型 expert 增加潜动作预测头”基线;其失败不能外推为所有视觉—动作联合生成都不好。正式 RepWAM 本身也联合生成两类 tokens。

整体结果:有竞争力,但并非所有基准最好

原文表 1 · RoboTwin 2.0,50 任务平均成功率
模型EasyHard
π₀.₅82.7%76.8%
Motus88.7%87.0%
Lingbot-VA92.9%91.6%
RepWAM-1.3B86.6%83.1%
RepWAM-5B89.3%88.4%
原文图 2 及 §4.2 · Franka 双臂,每任务 10 次 rollout
模型抓水果放盘抽屉与积木试管插架
π₀.₅10%50%10%
Lingbot-VA50%70%40%
RepWAM-1.3B60%50%30%
RepWAM-5B60%80%60%
主实验与消融不是同一训练设置,不能把 PickFruit 的 30%、50%、60% 当成同一实验的重复结果。真实主实验每任务只有 10 次尝试:10 个百分点就是一次成功,统计不确定性不可忽略。

补充观察:重建质量总体有竞争力,但不是所有指标都超过 WAN2.2 VAE;视频 CFG 消融中,本文模型在所测设置下以 scale = 1.0 的平均成功率最高。这支持在该设置下省去额外无条件分支,而非证明所有任务都不需要 CFG。

08

与 GE-Act 2.0 CoAE:同源思路,不同范围

CoAE 与 RepViTok 的视觉部分属于同类方法:可重建自编码器 + 冻结视觉老师的特征对齐。二者都希望 latent 不只保留外观,还保留对下游有用的表示。

维度RepViTokCoAE
视觉主体因果 ViT 视频自编码器DC-AE 布局,逐帧 2D 编码
压缩方式16 × 16 空间块;后续 4 帧一组高宽各缩小 64 倍;不做时间编码压缩
视觉通道96512;256 × 384 每帧为 24 tokens
老师Perception EncoderSigLIP 2、V-JEPA 2.1、DINOv3
对齐线性投影 + L2多个对齐头 + 余弦损失
显式潜动作有:4 维 ℓ,IDM + FDMCoAE 本身没有对应模块

GE-Act 2.0 的下游 IDM 根据视觉状态及本体信息,预测真实机器人动作;RepViTok 的 LAT 内部 IDM 则从视觉状态对提取潜动作。名字都叫 IDM,不代表训练标签和输出含义相同。

CoAE 的控制导向主要来自训练领域、老师选择与下游验证;其给出的 autoencoder 目标没有直接加入机器人动作误差。动作恢复 probe 是冻结编码器后的评估,不是 CoAE 的训练损失。

准确对应:CoAE ≈ RepViTok 的视觉 tokenizer,而不是整个 RepViTok。CoAE 更强调极短空间序列;RepViTok 额外显式编码状态转换。
09

阅读边界:区分事实、解释与假设

  • 明确给出:切块方式、latent 维度、视觉对齐目标、LAT 状态转换形式、分阶段训练、主要实验结果。
  • 可以解释但不应过度承诺:小瓶颈倾向于编码变化、语义老师有助于控制、视觉转换潜动作具有迁移潜力。
  • 尚缺少完整细节:PE 型号与层、特征空间匹配、LAT 的具体张量组织、K 的参数化约束、控制适配接口。
  • 尚不足以独立归因:4 维选择、搬运项、残差项、反向损失各自带来多少提升,正文没有充分逐项拆开。
  • 不应当作已完成:将 WAM 预训练扩展到大规模通用互联网、尤其第一人称人类视频,是作者提出的未来方向;tokenizer 已用 Panda-70M 不代表 WAM 已完成该扩展。

快速辨析

ℓ 是不是可以直接发送给机器人?

不是。它是从视觉变化学出的连续潜动作,需要真实机器人轨迹做控制适配。4 维不等于四个电机自由度。

是不是 PE、视觉 tokenizer 和 WAM 一起端到端训练?

不是一个从头到尾同时优化的流程。PE 是冻结老师;视觉 tokenizer 先训练;LAT 训练时视觉 tokenizer 冻结;随后再进行 WAM 预训练和控制适配。

只要语义对齐,就能保证懂物理和动作吗?

不能。PE 特征回归没有直接监督电机控制、因果物理或精确动作。LAT 和 WAM 承担额外的状态转换、时序预测与动作学习任务。

作者为什么不用“只预测未来画面”就结束?

本文希望同时构建视觉状态与其转换表示:z 描述世界,ℓ 描述变化,再通过机器人监督转到可执行动作。潜动作是桥梁,而不是额外生成一段漂亮视频。

最值得带走的两件事:
① 让可重建的视觉 latent 能读出预训练语义。
② 让低维潜动作必须解释视觉状态转换。

RepWAM 的核心不是换一个 tokenizer 的名字,而是把表示如何服务于预测与控制放到模型设计的中心。实验支持这一方向,但不等于已经证明通用、完美解耦或无需适配的机器人动作表示。

10

原文与参考

  1. RepWAM: World Action Modeling with Representation Visual-Action Tokenizers
    本文主要来源。§3.2:视觉 / 潜动作 tokenizer;§3.3:WAM;§4.1:训练配置;表 1–4 与 §4.2:结果。
  2. Perception Encoder: The best visual embeddings are not at the output of the network
    仅用于解释 PE 背景。§2:Core;§4–5:语言与空间后训练。不能据此补全 RepWAM 未给出的 teacher 配置。
  3. GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
    补充对照。§3.2:CoAE;§3.4:下游 IDM;附录 B:架构与联合训练说明。

整理说明:这是基于论文与讨论制作的中文阅读笔记,不是作者官方文档。示意图为概念重绘;公式采用可离线阅读的文本数学排版。形状示例与直觉解释已与原文明确事实区分。