What Matters for Latent Actions in Robot Learning
Authors
Xizhou Bu1, Qingda Hu1, Lei Zhou8, Lingfeng Zhang2, Yingbo Tang8, Zihao Liu4, Xinyi Tao3, Zhiqiang Ma6, Qingqiu Huang5, Chufeng Tang7, Hongbo Wang1, Jing Zhang5, Jiayi Ma5, Hangjun Ye8, Wei Li1, Xiaoshuai Hao8
Equal Contribution    Corresponding Author
1 Fudan University     2 Tsinghua University     3 Sichuan University     4 Shenzhen University of Advanced Technology     5 Wuhan University
6 Suzhou Evans Intelligent Technology Co., Ltd.     7 Morphi Intelligence Technology Co., Ltd.     8 Xiaomi EV
Highlight

Abstract

Latent Action Models (LAMs) have emerged as a promising paradigm for enabling robot learning to leverage large-scale unlabeled videos through latent actions that serve as compact surrogates for physical actions. Despite rapid progress, research on LAM remains highly fragmented, with existing methods evaluating different design choices in isolation under inconsistent experimental settings, making it difficult to identify the factors that truly determine downstream robotic manipulation performance. In this work, we present the first comprehensive empirical study of latent action learning for robotic manipulation. We unify representative LAM methods within a common autoencoding framework and systematically investigate 41 LAM design choices across three dimensions, including latent action modeling paradigms, learning objectives and regularization methods, and latent action integration strategies. We further examine four proxy metrics for evaluating latent action quality and assess their ability to reliably predict downstream robotic manipulation performance. Extensive experiments on three widely used benchmarks provide strong empirical evidence that fine-tuning vision-language model (VLM) backbones with latent actions provides a stronger initialization for downstream policy learning, with further validation on real-world robot manipulation tasks.

Key Contributions
1

Latent Action Modeling Paradigms

We show that the original LAPO method remains a remarkably strong baseline when trained directly on raw data, while simple semantic feature differencing using off-the-shelf visual encoders is also sufficient to yield competitive latent action representations.

2

Learning Objectives and Physical Action Prediction

We identify effective hyperparameter settings for different regularization methods, showing that properly tuned methods achieve comparable downstream performance. We further evaluate five latent action integration strategies and derive practical guidelines for effectively incorporating latent actions into physical action prediction.

3

Latent Action Dimensionality and Normalization

We show that a latent action dimensionality of 32 consistently achieves the best overall performance across both 7-DoF single-arm and 14-DoF dual-arm robot platforms. Additional latent action normalization is unnecessary when appropriate pretraining regularization is applied.

4

Proxy Metrics for Latent Action Quality

We find that FDM reconstruction metrics provide more reliable proxy measures of latent action quality than metrics derived from additionally trained probes. These proxy metrics are more suitable for coarse-grained model selection than for fine-grained ranking and are insufficient for reliably identifying the best-performing model.

5

Scaling Laws of Latent Action Pretraining

We demonstrate through both simulation and real-world experiments that fine-tuning VLM backbones with latent actions provides stronger initialization for downstream policy learning. Scaling up latent action pretraining consistently improves downstream robotic manipulation performance across diverse benchmarks.