arXiv cs.CL
· Papers
Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning
arXiv:2608.05080v1 Announce Type: cross Abstract: Critic-free group-based reinforcement learning has become a scalable approach for post-training large language models. However, most existing methods allocate the same number of rollouts to every task and trajectory state, even though some rollouts provide much more use