Tiefengestützte Sensitivitätsanalyse von Mixture-of-Experts-Modellen durch magnitude-basierte Expert Masking
arXiv:2608.13565v1 Ankündigungstyp: neu Abstract: Mixture-of-Experts (MoE) Architekturen skalieren Large Language Models (LLMs), während sie computationale Effizienz durch sparsame Aktivierung bewahren. Trotz ihrer weit verbreiteten Anwendung bleibt die relative Bedeutung einzelner MoE-Schichten unzureichend untersucht