@article{interpretabilityillusionswithsparse, title = {Interpretability Illusions with Sparse Autoencoders: Evaluating Robustness of Concept Representations}, author = {Aaron J. Li and Suraj Srinivas and Usha Bhalla and Himabindu Lakkaraju}, year = {2025}, eprint = {2505.16004}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.16004v1}, }