Verteilungs-konsistente Inferenz für dynamische Sparse Mixture-of-Experts

arXiv:2609.09241v1 Neuer Beitrag: Mixture-of-Experts (MoE)-Architekturen haben sich als mächtiges Paradigma zur Skalierung der Modellkapazität bei gleichzeitiger effizienter Inferenz in großen Foundation Models etabliert. Jedoch nutzen die meisten MoE-Modelle eine feste Top-k-Expert-Selection-Policy