Evaluating models at AI Safety Level 4 (ASL-4) will require techniques like mechanistic interpret..., Sonic AI
“Evaluating models at AI Safety Level 4 (ASL-4) will require techniques like mechanistic interpretability, as simple interaction-based tests may be defeated by model deception.”