PDF document

Efficient Reinforcement Learning by Guiding World Models with ...

During pre-training, rather than training separate models per task as in previous work [54–56], we train one world model per benchmark and demonstrate that a single multi-task & embodiment world model can effectively leverage non-curated data.

Source: arxiv.org