Skip to content
arXiv cs.CL · Papers

Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

arXiv:2608.05080v1 Announce Type: cross Abstract: Critic-free group-based reinforcement learning has become a scalable approach for post-training large language models. However, most existing methods allocate the same number of rollouts to every task and trajectory state, even though some rollouts provide much more use