“The current process for pre-training large models is a monolithic effort, in contrast to a more desirable, decomposed, modular approach.”