Übertragbare Latenz-Vorhersage für schnelle LLM-Filterung auf heterogenen Edge-Geräten
arXiv:2607.21602v1 Genaue Latenz-Vorhersage ist kritisch für die Bereitstellung von Large Language Models auf heterogenen Edge-Geräten, wo die Inferenz-Latenz durch Modellarchitektur, Prompt-Verhalten, Runtime-Backend, Hardware-Auslastung und dynamische Spannung beeinflusst wird…