Request-Level Energieverbrauchszuordnung für Batch-LLM-Serving
Batch-LLM-Serving verbessert den Durchsatz, erschwert aber die Energiebilanzierung. GPU-Stromtelemetrie ist aggregiert, während Nachhaltigkeitsberichte, Kostenverteilung und Workload-Analyse oft Request-Level-Energiekosten benötigen. Bestehende Inferenz-Energie-Benchmarks haben diese Anforderung nicht erfüllt