“Training Reinforcement Learning models is expensive because it requires interaction with a simulator to generate synthetic data, and creating a sufficient variety of simulation environments is difficult.”