Using too much synthetic reasoning data in mid-training makes it significantly harder to improve ..., Sonic AI
“Using too much synthetic reasoning data in mid-training makes it significantly harder to improve model performance later with Reinforcement Learning (RL).”