Topologie-bewusste Datenbewegung für verteilte GPU-Inferenz
arXiv:2607.28633v1 Verteilte LLM-Inferenz schafft ein Datenzentrum-Netzwerk-Problem, das kein bestehendes System korrekt löst. Wenn Prefill und Decode auf separaten GPU-Pools laufen, muss der KV-Cache zwischen ihnen übertragen werden. Bei einem 70B-Modell sind das 2,6 GB pro Anfrage