SYNTOLOGY HomeExplorerAtlasCodeMethodologyAboutDevelopersFeedPricing
Paper · 2504.11054 · ICLR · 2025

Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation Models

Alessandro Lazaric, Matteo Pirotta, Andrea Tirinzoni, Ahmed Touati, Anssi Kanervisto, Yingchen Xu, Jesse Farebrother, Fair At Meta, Mateusz Guzek

arXiv · PDF · Open in the Atlas

Code that ran

We lifted 31 functions out of this paper's own repositories and ran 16 of them in a sandbox. "Ran" means the function executed on a synthesized input and returned a value. It is not a reproduction of the paper's results.

RepositoryRoleRan
facebookresearch/metamotivo canonical 15 of 30
facebookresearch/humenv canonical 1 of 1
FunctionStatusWhere it lives
ActorArchiConfig Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("7072f819126bcba5")
ArchiConfig Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("f0076a0b9ee82626")
BackwardArchiConfig Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("da844f0b3ebf1f60")
BackwardMap Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("a5a3e8c377e77a82")
Config Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("1f089d1db6c11d54")
DenseParallel Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("c0563387a851f5be")
ForwardArchiConfig Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("d1e1861240004451")
Norm Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("cc09fe08b93015a6")
ParallelLayerNorm Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("96fae2cd4fb681f8")
TruncatedNormal Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("0c73c35f93c90cfb")
build_backward Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("d572ba72d9339001")
config_from_dict Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("7bebc0e93d8ff2e2")
layernorm Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("ee57a886c99dd0b1")
linear Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("c092126f33402e08")
load_model Ran facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("feddcd5c2a9fd9a2")
make_from_name Ran facebookresearch/humenv/humenv/env.py
pointer only (licence: NOASSERTION) · get_code("c168a019337992da")
Actor Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("92468117ea8270ba")
Block Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("01f0428c88bde5de")
FBModel Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("79c4ebb09e02aaff")
ForwardMap Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("4071a91883ae5542")
ResidualActor Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("e1091fe2e9a10d40")
ResidualBlock Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("5d792e7fe20ec8bd")
ResidualForwardMap Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("6c14b5df35e6dc85")
SequetialFMap Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("47676b887f26870f")
_build_batch_forward Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("00681738ef179d76")
build_actor Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("300a59992d3edcb4")
build_forward Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("8857dd4c88d11076")
dict_to_config Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("999b9fb5750aca10")
eval_mode Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("68a1973e5ff83c48")
residual_embedding Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("20a14ba3346110ba")
simple_embedding Not yet run facebookresearch/metamotivo/metamotivo/fb/model.py
pointer only (licence: NOASSERTION) · get_code("af0184a440f48156")

Repositories linked to this paper

Some links come from the archived Papers with Code dataset (CC BY-SA 4.0): attribution and licence.

Abstract

Unsupervised reinforcement learning (RL) aims at pre-training agents that can solve a wide range of downstream tasks in complex environments. Despite recent advancements, existing approaches suffer from several limitations: they may require running an RL process on each downstream task to achieve a satisfactory performance, they may need access to datasets with good coverage or well-curated task-specific samples, or they may pre-train policies with unsupervised losses that are poorly correlated with the downstream tasks of interest. In this paper, we introduce a novel algorithm regularizing unsupervised RL towards imitating trajectories from unlabeled behavior datasets. The key technical novelty of our method, called Forward-Backward Representations with Conditional-Policy Regularization, is to train forward-backward representations to embed the unlabeled trajectories to the same latent space used to represent states, rewards, and policies, and use a latent-conditional discriminator to encourage policies to "cover" the states in the unlabeled behavior dataset. As a result, we can learn policies that are well aligned with the behaviors in the dataset, while retaining zero-shot generalization capabilities for reward-based and imitation tasks. We demonstrate the effectiveness of this new approach in a challenging humanoid control problem: leveraging observation-only motion capture datasets, we train META MOTIVO, the first humanoid behavioral foundation model that can be prompted to solve a variety of whole-body tasks, including motion tracking, goal reaching, and reward optimization. The resulting model is capable of expressing human-like behaviors and it achieves competitive performance with task-specific methods while outperforming state-of-the-art unsupervised RL and model-based baselines.

For agents

The same record, over MCP at https://syntology.ai/mcp:

get_harvested_code_for_paper("2504.11054")
get_code_for_paper("2504.11054")
have("2504.11054")

Connect an agent — have() is free.