“OpenAI's o1 model, released in late 2024, was the first demonstration of a model trained with Reinforcement Learning from Verifiable Rewards (RLVR).”