Alessandro Lazaric, Matteo Pirotta, Andrea Tirinzoni, Ahmed Touati, Anssi Kanervisto, Yingchen Xu, Jesse Farebrother, Fair At Meta, Mateusz Guzek
We lifted 31 functions out of this paper's own repositories and ran 16 of them in a sandbox. "Ran" means the function executed on a synthesized input and returned a value. It is not a reproduction of the paper's results.
| Repository | Role | Ran |
|---|---|---|
| facebookresearch/metamotivo | canonical | 15 of 30 |
| facebookresearch/humenv | canonical | 1 of 1 |
| Function | Status | Where it lives |
|---|---|---|
| ActorArchiConfig | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("7072f819126bcba5") |
| ArchiConfig | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("f0076a0b9ee82626") |
| BackwardArchiConfig | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("da844f0b3ebf1f60") |
| BackwardMap | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("a5a3e8c377e77a82") |
| Config | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("1f089d1db6c11d54") |
| DenseParallel | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("c0563387a851f5be") |
| ForwardArchiConfig | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("d1e1861240004451") |
| Norm | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("cc09fe08b93015a6") |
| ParallelLayerNorm | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("96fae2cd4fb681f8") |
| TruncatedNormal | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("0c73c35f93c90cfb") |
| build_backward | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("d572ba72d9339001") |
| config_from_dict | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("7bebc0e93d8ff2e2") |
| layernorm | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("ee57a886c99dd0b1") |
| linear | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("c092126f33402e08") |
| load_model | Ran | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("feddcd5c2a9fd9a2") |
| make_from_name | Ran | facebookresearch/humenv/humenv/env.py pointer only (licence: NOASSERTION) · get_code("c168a019337992da") |
| Actor | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("92468117ea8270ba") |
| Block | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("01f0428c88bde5de") |
| FBModel | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("79c4ebb09e02aaff") |
| ForwardMap | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("4071a91883ae5542") |
| ResidualActor | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("e1091fe2e9a10d40") |
| ResidualBlock | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("5d792e7fe20ec8bd") |
| ResidualForwardMap | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("6c14b5df35e6dc85") |
| SequetialFMap | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("47676b887f26870f") |
| _build_batch_forward | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("00681738ef179d76") |
| build_actor | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("300a59992d3edcb4") |
| build_forward | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("8857dd4c88d11076") |
| dict_to_config | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("999b9fb5750aca10") |
| eval_mode | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("68a1973e5ff83c48") |
| residual_embedding | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("20a14ba3346110ba") |
| simple_embedding | Not yet run | facebookresearch/metamotivo/metamotivo/fb/model.py pointer only (licence: NOASSERTION) · get_code("af0184a440f48156") |
Some links come from the archived Papers with Code dataset (CC BY-SA 4.0): attribution and licence.
Unsupervised reinforcement learning (RL) aims at pre-training agents that can solve a wide range of downstream tasks in complex environments. Despite recent advancements, existing approaches suffer from several limitations: they may require running an RL process on each downstream task to achieve a satisfactory performance, they may need access to datasets with good coverage or well-curated task-specific samples, or they may pre-train policies with unsupervised losses that are poorly correlated with the downstream tasks of interest. In this paper, we introduce a novel algorithm regularizing unsupervised RL towards imitating trajectories from unlabeled behavior datasets. The key technical novelty of our method, called Forward-Backward Representations with Conditional-Policy Regularization, is to train forward-backward representations to embed the unlabeled trajectories to the same latent space used to represent states, rewards, and policies, and use a latent-conditional discriminator to encourage policies to "cover" the states in the unlabeled behavior dataset. As a result, we can learn policies that are well aligned with the behaviors in the dataset, while retaining zero-shot generalization capabilities for reward-based and imitation tasks. We demonstrate the effectiveness of this new approach in a challenging humanoid control problem: leveraging observation-only motion capture datasets, we train META MOTIVO, the first humanoid behavioral foundation model that can be prompted to solve a variety of whole-body tasks, including motion tracking, goal reaching, and reward optimization. The resulting model is capable of expressing human-like behaviors and it achieves competitive performance with task-specific methods while outperforming state-of-the-art unsupervised RL and model-based baselines.
The same record, over MCP at https://syntology.ai/mcp:
get_harvested_code_for_paper("2504.11054")
get_code_for_paper("2504.11054")
have("2504.11054")
Connect an agent — have() is free.