SharedSAE: Ein Feature Dictionary über Language Models hinweg
Sparse Autoencoders werden weit verbreitet zur Interpretation von Language-Model-Aktivierungen genutzt. Ein einzelner gemeinsamer SAE kann eine Sammlung dedizierter SAEs pro Modell ersetzen.