CARPRT: Klassenabhängiges Zero-Shot-Prompt-Reweighting für Black-Box Vision-Language-Modelle

arXiv:2607.14125v1 Vortrainierte Vision-Language-Modelle (VLMs) ermöglichen Zero-Shot-Bildklassifikation durch Berechnung des Ähnlichkeitsscores zwischen einem Bild und Textbeschreibungen, typischerweise durch Einfügen einer Klassenbeschriftung in einen Prompt