In the Kimi Linear architecture, Attention Residuals (AttnRes) mitigate Pre-Layer Normalization (..., Sonic AI
“In the Kimi Linear architecture, Attention Residuals (AttnRes) mitigate Pre-Layer Normalization (PreNorm) dilution, leading to more uniform output magnitudes and gradient distribution across model depth.”