“Deep learning models lack compositional generalization, a capability the ArcGI 2 benchmark is designed to measure.”