“OpenAI's O-1 model uses large-scale reinforcement learning to generate an optimized chain of thought before answering.”