Fester Zustand, langer Reichweite: Was ein konstant dimensionierter Cache bei Block Diffusion im großen Maßstab bringt

arXiv:2609.11998v1 Diffusions-Language-Modelle dekodieren Token parallel, aber ihr bidirektionaler Denoiser schließt den naiven Key-Value (KV) Cache hinter schneller autoregressiver Inference aus. Block Diffusion stellt das Caching wieder her durch Block-für-Block-Dekodierung, und die Block-Caches werden bereitgestellt