← Back to all news
arXiv Machine Learning June 3, 2026 By Fr\'ed\'eric Berdoz, Luca A. Lanzend\"orfer, Ren\'e Caky, Roger Wattenhofer

Alignment-Aware Decoding

Read the original on arXiv Machine Learning →

arXiv:2509. 26169v2 Announce Type: replace Abstract: Alignment of large language models remains a central challenge in natural language processing.

Summary generated by The Flow from the publisher's feed. The full article lives at arXiv Machine Learning.

  • llms
  • nlp
  • reinforcement-learning
  • benchmarks
  • safety

Related stories

arXiv AI
Jul 7

Unbiased Alignment for Large Language Models with Noisy Preferences

arXiv:2607. 03248v1 Announce Type: cross Abstract: The alignment of large language models with human preferences is commonly achieved through Reinforcement Learning from Human Feedback or Direct Preference Optimization.

By Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li
llmsreinforcement-learningbenchmarkssafety
More like this →
arXiv AI
Jul 7

Safe Inference-Time Alignment via Lagrangian Reward Augmentation

arXiv:2607. 02781v1 Announce Type: cross Abstract: Inference-time alignment steers a frozen language model during decoding using auxiliary reward signals, avoiding the cost of repeated weight updates.

By Yaswanth Chittepu, Ativ Joshi, Sohini Chintala, Scott Niekum
llmsragreinforcement-learningfine-tuningsafety
More like this →
arXiv AI
Jun 11

Toward Preference-aligned Large Language Models via Residual-based Model Steering

arXiv:2509. 23982v2 Announce Type: replace-cross Abstract: Preference alignment is a critical step in making Large Language Models (LLMs) useful and aligned with (human) preferences.

By Lucio La Cava, Andrea Tagarelli
llmsreinforcement-learningbenchmarkssafety
More like this →
arXiv Machine Learning
Jun 10

Gradient-Guided Reward Optimization for Inference-time Alignment

arXiv:2606. 09635v1 Announce Type: cross Abstract: Ensuring the reliability of Large Language Models (LLMs) under distribution drift requires inference-time adaptation.

By Hankun Lin, Ruqi Zhang
llmsreinforcement-learningbenchmarkssafety
More like this →
arXiv AI
1d ago

Leveraging Machine Unlearning for Cost-Efficient Preference Alignment

arXiv:2504. 06659v2 Announce Type: replace-cross Abstract: Despite advances in Preference Alignment (PA) for Large Language Models (LLMs), mainstream methods like reinforcement learning with human feedback face notable challenges.

By Xiaohua Feng, Yuyuan Li, Huwei Ji, Jiaming Zhang, Li Zhang, Tianyu Du, Chaochao Chen
llmsreinforcement-learningsafety
More like this →
arXiv AI
Jun 4

Test-time reward-guided alignment of language models by importance sampling on pre-logit space

arXiv:2510. 26219v3 Announce Type: replace-cross Abstract: Test-time alignment of large language models (LLMs) attracts attention because fine-tuning of LLMs requires high computational costs.

By Sekitoshi Kanai, Tsukasa Yoshida, Hiroshi Takahashi, Haru Kuroki, Kazumune Hashimoto
llmsfine-tuningsafety
More like this →