“Cursor utilizes massive post-training based on reinforcement learning (RL) in its model development process.”