arXiv Machine Learning By Shuo Yang, Qihui Zhang, Yuyang Liu, Xiaojun Jia, Kunpeng Ning, Jiayu Yao, Jigang Wang, Hailiang Dai, Yibing Song, Li Yuan

AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin

Read the original on arXiv Machine Learning →

arXiv:2506. 08473v4 Announce Type: replace Abstract: Fine-tuning large language models (LLMs) improves performance but introduces critical safety vulnerabilities: even minimal harmful data can severely compromise safety measures.

Summary generated by The Flow from the publisher's feed. The full article lives at arXiv Machine Learning.