FAMPWQ: Fisher-Information-basierte adaptive gemischte Präzisions-Gewichtsquantisierung für effiziente LLM-Inferenz

arXiv:2608.24945v1 Ankündigungstyp: neu Abstract: Die letzten Jahre haben bemerkenswerte Erfolge von Large Language Models (LLMs) in mehreren Domänen gesehen, während die exzessiven Ressourcenanforderungen von LLMs die Bereitstellung auf ressourcenbeschränkten Geräten behindern. Obwohl Modellquantisierung sich abheben würde als