Skip to content
arXiv cs.LG · Papers

Variance Reduction Based Experience Replay for Policy Optimization

arXiv:2602.05379v2 Announce Type: replace-cross Abstract: Effective reinforcement learning (RL) for complex stochastic systems requires leveraging historical data to improve sample efficiency and accelerate policy optimization. However, classical experience replay treats all past observations uniformly and fails to acc