ExFold: Vereinigte Expert Folding für trainingsfreie MoE Prefill-Decode Beschleunigung
arXiv:2608.24938v1 Ankündigungstyp: neu Abstract: Mixture-of-Experts (MoE) Modelle skalieren Kapazität für starke Qualität, während pro-Token-Berechnung durch sparse Expert Aktivierung begrenzt bleibt. Dennoch wird die Inferenz mit niedriger Latenz bei MoE zunehmend herausfordernd, da sie zwei Inferenzphasen mit fundamentalen