RepWAM从语义视觉表示,到可迁移的动作
World Action Modeling with Representation Visual-Action Tokenizers
不只把视频压成“能还原画面”的 token:先让视觉 latent 保留语义,再把相邻视觉状态的变化压成低维潜动作,最后在两类表示上学习预测与控制。
核心问题:世界模型需要怎样的表示?
传统 WAM 常继承视频生成模型的 tokenizer。作者认为,这种表示存在两个缺口:
- 视觉侧:像素重建主要约束外观保真,不直接要求 latent 保留对操作重要的物体语义、空间关系与交互线索。
- 动作侧:视觉 latent 与机器人电机指令属于不同表示,模型需要学习跨越两者的差异。
RepWAM 的关键组件是 RepViTok(representation visual-action tokenizer)。它不是单一编码器,而是顺序训练的视觉与潜动作两部分。
“同一语义空间”不等于视觉与动作逐元素对齐。z 与 ℓ 维度不同;它们通过状态转换任务建立联系。
视觉 tokenizer:因果 ViT 自编码器
时空切块与压缩
- 第一帧:切为 16 × 16 的二维 patches。
- 后续帧:切为 4 × 16 × 16 的 tubelets,即每组覆盖 4 帧。
- 同一 latent 时间步内空间注意力全连接,时间上使用因果 mask,不读取未来组。
这里 T 是原始帧数,T′ 是压缩后的时间步数,L 是每个时间步的空间 token 数。后续的“latent 帧”来自四帧一组的时空压缩,并不等于一张原始图像。
它是连续 tokenizer,不是离散码本
正文没有描述 VQ codebook、最近邻量化或离散 token ID;给出的目标也没有 KL 正则。按方法描述,应理解为连续视频自编码器,而非默认套用标准 KL-VAE 或 VQ-VAE。论文表格把它与其他 VAE 比较,不足以证明它采用相同的概率或量化机制。
PE 对齐:把语义监督加到 latent 上
同一视频走学生和老师两条路径。Perception Encoder(PE)冻结;学生 Encoder 和线性对齐头可训练。
视频 o → Encoder → z
z → 线性投影 Walign → 学生特征
另一路 z → Decoder → 重建视频 ô
同一视频 o → PE → G(o)
G(o) → 时间平均池化 → 目标特征
对齐梯度不更新 PE
Walign 将 96 维学生 token 映射到老师特征维度。下游 WAM 使用的仍是 z,不是经过对齐头扩维后的特征。
重建与语义共同约束
ℒvis = ℒrec + λalign ℒalign原文式 (1)–(2)
权重为 λ1 = 1、λperc = 1、λgan = 0.1、λalign = 1。Encoder 必须同时让 z 能够重建画面、能够通过线性映射预测老师特征。
PE 本身是什么?
PE 是一个预训练视觉编码器家族,不是像素自编码器。其 Core 以大规模图文对比学习为基础,再用视频—文本对继续训练;视频分支逐帧编码后平均帧级 embedding。PE 论文发现通用特征常在中间层,并进一步提供面向语言与空间任务的不同后训练版本。
RepWAM 未明确采用 PE Core、Language 还是 Spatial,因此不能直接声称其老师包含 PE Spatial 的 SAM 蒸馏。PE 自身的全局视频平均也不能直接解释 RepViTok 的具体对齐网格。
潜动作 tokenizer:把“变化”压成 4 维
视觉 tokenizer 训练完成后被冻结。随后训练一个逆动力学模型 IDM 和一个前向动力学模型 FDM,两者都是 4 层 MLP,hidden size 256。
先编码变化,再验证变化是否有用
(Kt, δt) = fψ(zt, ℓt)
ẑt+1 = Kt zt + δt原文式 (3)
| 变量 | 形状 | 作用 |
|---|---|---|
| zt | L × 96 | 当前语义视觉状态 |
| ℓt | 4 | 由前后状态提取的连续变化瓶颈 |
| Kt | L × L | 沿空间 token 维度搬运、组合现有内容 |
| δt | L × 96 | 补充搬运无法解释的变化 |
以杯子向右移动为例,Kt zt 可以把描述杯子的内容组合到新位置;δt 补充遮挡变化、新出现内容等无法仅靠搬运解释的部分。这是语义 token 空间的软搬运,不是普通二维光流,也不要求一一对应的位移。
正向预测 + 反向重建
ℒcons = Σt ‖ẑt − zt‖²2原文式 (4)
反向项通过把输入状态对换成 (zt+1, zt),重新运行 LAT 来获得预测。它不是显式要求正反向 K 互为逆矩阵,也不是把同一个 ℓ 自动取负。
可迁移性的来源:这里监督的是视觉状态变化,而不是某种机器人的电机坐标;它为后续控制适配提供中间表示,但并不自动等价于跨机器人可直接执行的动作。
世界动作模型:在 z 与 ℓ 上联合生成
训练好 tokenizer 后,RepWAM 使用语言指令、初始视觉状态和过去上下文,预测未来视觉 tokens 与潜动作 tokens。基本单位是短时窗内的 visual-action chunk。
- chunk 之间:block-causal mask 允许读取过去,不允许看未来 chunk。
- 视觉与动作分支:共享注意力权重,使用各自的 FFN。
- 语言:冻结的 PLM text encoder 提取条件,通过 cross-attention 注入。
- 生成骨干:论文称为 1.3B / 5B 两档,从头训练,不继承 WAN 视频生成骨干权重。
Flow matching 目标
v* = u − ε
ℒFM = 𝔼[‖Fvθ − v*v‖² + λa ‖Faθ − v*a‖²]原文式 (6)–(7),省略条件参数
模型学习从噪声走向真实 visual-action chunk 的速度场。上标 v / a 分别表示视觉与潜动作部分,λa = 1。α 是生成过程的插值时间,不是视频帧时间 t。
不要混淆两种“对齐”
| 机制 | 发生在哪里 | 解决什么 |
|---|---|---|
| latent 回归 PE 特征 | 视觉 tokenizer 训练 | 让压缩表示更有语义 |
| 视觉 / 动作读取文本条件 | 世界动作模型的注意力层 | 让未来预测服从语言指令 |
本文写的是 PLM 文本编码器,不是 T5。通用视频生成中“T5 编码文字、VAE 编码视频、DiT 做条件融合”的解释可以帮助理解,但不应替代本文的具体配置。
训练路线:不要把几个阶段混为一谈
- 训练视觉 tokenizer
RepViTok 训练数据为 Panda-70M;视觉部分同时优化重建和 PE 对齐。
- 冻结视觉 tokenizer,训练 LAT
从相邻视觉 latent 中提取潜动作,用正向预测与反向重建学习状态转换;此步骤不需要真实电机动作标签。
- 世界动作模型预训练
在 AgiBot 上使用约 100G visual-action latent tokens;动作部分由 LAT 产生,联合建模未来 z 与 ℓ。
- 机器人控制适配
使用 AgiBot、RoboMIND、RoboCOIN、InternA1 混合真实机器人语料,约 300G tokens,轨迹提供与视频对应的连续电机命令。
- 下游任务微调与闭环评估
真实机器人主实验每项任务使用 50 条 demonstrations,微调 500 步;每项任务评估 10 次 rollout。
| 项目 | 配置 |
|---|---|
| 世界模型 expert | 30 层;hidden 1536 / 3072 |
| 动作 expert | 同为 30 层;hidden 768;论文称约增加 350M 参数 |
| 优化 | Muon,峰值学习率 0.01,BF16 |
| chunk size | 训练在 [1, 4] 采样;推理设为 2 |
| 硬件与序列上限 | 1.3B:64 张 H20 / 200K tokens;5B:128 张 H20 / 160K tokens |
实验:什么得到支持,什么还没有?
证据 A:更换视觉 tokenizer,控制表现提高
| 视觉 tokenizer | Easy | Hard |
|---|---|---|
| WAN2.2 VAE | 78.0% | 76.0% |
| RepViTok | 86.6% | 83.1% |
| 绝对提升 | +8.6 个百分点 | +7.1 个百分点 |
说明视觉 latent 的设计对下游控制有实质影响;但两种 tokenizer 的架构与训练方式也有差异,不能将全部提升仅归因于某一个对齐损失项。
证据 B:先潜动作预训练、再控制适配更有效
| 方案 | Seen gFVD ↓ | Unseen OLS ↑ | PickFruit |
|---|---|---|---|
| 无潜动作预训练 | 61.01 | 14.15 | 30% |
| Joint Pred:额外头联合预测 | 94.25 | 15.22 | 20% |
| Two Stages:预训练 → 适配 | 48.23 | 16.98 | 50% |
Joint Pred 是论文特定的“世界模型 expert 增加潜动作预测头”基线;其失败不能外推为所有视觉—动作联合生成都不好。正式 RepWAM 本身也联合生成两类 tokens。
整体结果:有竞争力,但并非所有基准最好
| 模型 | Easy | Hard |
|---|---|---|
| π₀.₅ | 82.7% | 76.8% |
| Motus | 88.7% | 87.0% |
| Lingbot-VA | 92.9% | 91.6% |
| RepWAM-1.3B | 86.6% | 83.1% |
| RepWAM-5B | 89.3% | 88.4% |
| 模型 | 抓水果放盘 | 抽屉与积木 | 试管插架 |
|---|---|---|---|
| π₀.₅ | 10% | 50% | 10% |
| Lingbot-VA | 50% | 70% | 40% |
| RepWAM-1.3B | 60% | 50% | 30% |
| RepWAM-5B | 60% | 80% | 60% |
补充观察:重建质量总体有竞争力,但不是所有指标都超过 WAN2.2 VAE;视频 CFG 消融中,本文模型在所测设置下以 scale = 1.0 的平均成功率最高。这支持在该设置下省去额外无条件分支,而非证明所有任务都不需要 CFG。
与 GE-Act 2.0 CoAE:同源思路,不同范围
CoAE 与 RepViTok 的视觉部分属于同类方法:可重建自编码器 + 冻结视觉老师的特征对齐。二者都希望 latent 不只保留外观,还保留对下游有用的表示。
| 维度 | RepViTok | CoAE |
|---|---|---|
| 视觉主体 | 因果 ViT 视频自编码器 | DC-AE 布局,逐帧 2D 编码 |
| 压缩方式 | 16 × 16 空间块;后续 4 帧一组 | 高宽各缩小 64 倍;不做时间编码压缩 |
| 视觉通道 | 96 | 512;256 × 384 每帧为 24 tokens |
| 老师 | Perception Encoder | SigLIP 2、V-JEPA 2.1、DINOv3 |
| 对齐 | 线性投影 + L2 | 多个对齐头 + 余弦损失 |
| 显式潜动作 | 有:4 维 ℓ,IDM + FDM | CoAE 本身没有对应模块 |
GE-Act 2.0 的下游 IDM 根据视觉状态及本体信息,预测真实机器人动作;RepViTok 的 LAT 内部 IDM 则从视觉状态对提取潜动作。名字都叫 IDM,不代表训练标签和输出含义相同。
CoAE 的控制导向主要来自训练领域、老师选择与下游验证;其给出的 autoencoder 目标没有直接加入机器人动作误差。动作恢复 probe 是冻结编码器后的评估,不是 CoAE 的训练损失。
阅读边界:区分事实、解释与假设
- 明确给出:切块方式、latent 维度、视觉对齐目标、LAT 状态转换形式、分阶段训练、主要实验结果。
- 可以解释但不应过度承诺:小瓶颈倾向于编码变化、语义老师有助于控制、视觉转换潜动作具有迁移潜力。
- 尚缺少完整细节:PE 型号与层、特征空间匹配、LAT 的具体张量组织、K 的参数化约束、控制适配接口。
- 尚不足以独立归因:4 维选择、搬运项、残差项、反向损失各自带来多少提升,正文没有充分逐项拆开。
- 不应当作已完成:将 WAM 预训练扩展到大规模通用互联网、尤其第一人称人类视频,是作者提出的未来方向;tokenizer 已用 Panda-70M 不代表 WAM 已完成该扩展。
快速辨析
ℓ 是不是可以直接发送给机器人?
不是。它是从视觉变化学出的连续潜动作,需要真实机器人轨迹做控制适配。4 维不等于四个电机自由度。
是不是 PE、视觉 tokenizer 和 WAM 一起端到端训练?
不是一个从头到尾同时优化的流程。PE 是冻结老师;视觉 tokenizer 先训练;LAT 训练时视觉 tokenizer 冻结;随后再进行 WAM 预训练和控制适配。
只要语义对齐,就能保证懂物理和动作吗?
不能。PE 特征回归没有直接监督电机控制、因果物理或精确动作。LAT 和 WAM 承担额外的状态转换、时序预测与动作学习任务。
作者为什么不用“只预测未来画面”就结束?
本文希望同时构建视觉状态与其转换表示:z 描述世界,ℓ 描述变化,再通过机器人监督转到可执行动作。潜动作是桥梁,而不是额外生成一段漂亮视频。
最值得带走的两件事:
① 让可重建的视觉 latent 能读出预训练语义。
② 让低维潜动作必须解释视觉状态转换。
RepWAM 的核心不是换一个 tokenizer 的名字,而是把表示如何服务于预测与控制放到模型设计的中心。实验支持这一方向,但不等于已经证明通用、完美解耦或无需适配的机器人动作表示。
原文与参考
- RepWAM: World Action Modeling with Representation Visual-Action Tokenizers
本文主要来源。§3.2:视觉 / 潜动作 tokenizer;§3.3:WAM;§4.1:训练配置;表 1–4 与 §4.2:结果。 - Perception Encoder: The best visual embeddings are not at the output of the network
仅用于解释 PE 背景。§2:Core;§4–5:语言与空间后训练。不能据此补全 RepWAM 未给出的 teacher 配置。 - GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
补充对照。§3.2:CoAE;§3.4:下游 IDM;附录 B:架构与联合训练说明。
整理说明:这是基于论文与讨论制作的中文阅读笔记,不是作者官方文档。示意图为概念重绘;公式采用可离线阅读的文本数学排版。形状示例与直觉解释已与原文明确事实区分。