Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations
- View PDF HTML (experimental) Abstract:Safety evaluations for large language models rely on surface-form classifiers that report declining harm scores across model generations.
- We provide evidence that this methodology is systematically incomplete: explicit discriminatory content is transformed rather than removed.
Unverified
- View PDF HTML (experimental) Abstract:Safety evaluations for large language models rely on surface-form classifiers that report declining harm scores across model generations.
- We provide evidence that this methodology is systematically incomplete: explicit discriminatory content is transformed rather than removed.
Sources: Arxiv