HF Daily Papers
· Papers
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
Large language model agents have shown strong potential in complex interactive tasks, yet their reinforcement learning (RL) is often hindered by sparse rewards, as a long multi-turn trajectory may receive only a single outcome-level signal. On-policy self-distillation (OPSD) provides dense token-lev