LinearKV: Ein gecachter Zustand genügt für positionsunabhängiges Caching in Hybrid-LLMs

arXiv:2608.11231v1 Ankündigungstyp: neu Abstrakt: LLM-Serving wird zunehmend durch positionsunabhängiges Caching (PIC) beschleunigt. Bestehende PIC-Methoden sind jedoch für Full-Attention-Modelle konzipiert, bei denen ein Token-indexierter KV-Cache seinen Kernoperationen zugrunde liegt: Matching wiederverwendbarer Token-Chunks, Verkettung…