DecodeShare: Verfolgung des gemeinsamen Unterraums von LLM-Dekodierungs-Entscheidungen

arXiv:2607.20469v1 Ankündigungstyp: neu Abstract: Large Language Models (LLMs) bewältigen viele Aufgaben mit einem Satz von Parametern, doch unter KV-Cached-Inferenz ist unklar, welche aufgabenallgemeine Struktur, falls vorhanden, während der Dekodierung anstatt während des Prefill verwendet wird. Wir schlagen DecodeShare vor, ein Protokoll, das