Skip to content
arXiv cs.CL · Papers

SCOPE-RL: Optimizing Reasoning Paths Before and After Success

arXiv:2607.11506v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) optimizes LLMs using sparse verifiable final-answer rewards. This sparse anchor reliably verifies whether a trajectory succeeds but provides no direct feedback on the reasoning path that produced it. Before success,