FineServe: Ein detailliertes Dataset und eine Charakterisierung globaler LLM-Serving-Workloads

arXiv:2607.19349v1 Ankündigungstyp: neu Zusammenfassung: Large Language Models (LLMs) werden zunehmend als immer verfügbare Online-Services eingesetzt, was effizientes LLM-Serving zu einer kritischen Systemherausforderung macht. Um niedrige Latenzen und hohen Durchsatz bei volatiler Nachfrage zu erreichen, ist ein tiefes Verständnis realer