Skip to content
arXiv cs.LG · Papers

When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO

arXiv:2608.03467v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) com- monly optimizes each correct completion as an independent learning signal. In GRPO, this completion-level uniformity creates structure-level skew: recurring correct solution forms accumulate positive coefficient