Jenseits von Genauigkeit und Kosten: Latenz-bewusste LLM-Query-Weiterleitung für dynamische Workloads

arXiv:2607.18253v1 Moderne Language-Query-Router verbessern die Inferenzeffizienz durch Zuweisung jeder Anfrage an ein Modell, das Antwortqualität und monetäre Kosten ausgleicht. Jedoch berücksichtigen aktuelle Query-Router größtenteils nicht die Generierungs-Latenz