arXiv cs.CL
· Papers
SCOPE-RL: Optimizing Reasoning Paths Before and After Success
arXiv:2607.11506v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) optimizes LLMs using sparse verifiable final-answer rewards. This sparse anchor reliably verifies whether a trajectory succeeds but provides no direct feedback on the reasoning path that produced it. Before success,