Ein Jahr beim LLM Serving: Workload-Entwicklung, Caching und Load-Balancing

arXiv:2608.13573v1 Ankündigungstyp: neu Abstract: Large Language Model (LLM) Serving ist zu einer kritischen Cloud-Workload geworden, und realistische Traces sind wesentlich für die Motivation und das Benchmarking von Serving-Systemen. Allerdings bleiben bestehende LLM-Serving-Workload-Studien in Umfang und Scope begrenzt. Sie beschränken sich oft auf