“Fable achieved an 18.71X speedup by writing Cuda code on an NVIDIA RTX PRO 6000 Blackwell GPU, compared against an optimized PyTorch baseline.”