arXiv AI

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning

arXiv:2606. 00160v1 Announce Type: cross Abstract: Large language models (LLMs) suffer from degraded safety capabilities even when fine-tuned with benign datasets.