@article{robustsafetyclassifierforlargelanguage, title = {Robust Safety Classifier for Large Language Models: Adversarial Prompt Shield}, author = {JinHwa Kim and Ali Derakhshan and Ian G. Harris}, year = {2023}, eprint = {2311.00172}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2311.00172v1}, }