arXiv cs.CL
· Papers
Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
arXiv:2607.14614v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) commonly uses entropy for advantage shaping. However, entropy cannot distinguish useful uncertainty from detrimental confusion, limiting its effectiveness as a correctness signal. We propose Contrastive Policy Optimi