Skip to content
arXiv cs.CL · Papers

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

arXiv:2607.14614v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) commonly uses entropy for advantage shaping. However, entropy cannot distinguish useful uncertainty from detrimental confusion, limiting its effectiveness as a correctness signal. We propose Contrastive Policy Optimi