arXiv AI By Mengyang Li, Haozhan Geng, Zhong Zhang, Shuang Liu

Dual-Difficulty Curriculum Learning for Direct Preference Optimization

Read the original on arXiv AI →

arXiv:2504. 07856v4 Announce Type: replace Abstract: Curriculum learning enhances Direct Preference Optimization (DPO) for aligning Large Language Models (LLMs), yet existing methods rely on a one-dimensional view of difficulty.

Summary generated by The Flow from the publisher's feed. The full article lives at arXiv AI.