arXiv AI By Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang, Jie Pan, Jinbiao Zhu

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning

Read the original on arXiv AI →

arXiv:2606. 00160v1 Announce Type: cross Abstract: Large language models (LLMs) suffer from degraded safety capabilities even when fine-tuned with benign datasets.

Summary generated by The Flow from the publisher's feed. The full article lives at arXiv AI.