Dual-Flow Transformers: Entkopplung des primären Prefill-Pfads vom zusätzlichen Decode-Computing
arXiv:2608.12385v1 Ankündigungstyp: neu Abstract: Da Large Language Models mehr Anfragen verarbeiten, wird die kumulative Inferenzkosten immer wichtiger im Vergleich zu einmaligen Trainingskosten. Die zwei Inferencephasen belasten Hardware unterschiedlich: Prompt-Prefill ist parallel und typischerweise rechengebunden,