arXiv cs.LG
· Papers
When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO
arXiv:2608.03467v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) com- monly optimizes each correct completion as an independent learning signal. In GRPO, this completion-level uniformity creates structure-level skew: recurring correct solution forms accumulate positive coefficient