arXiv stat.ML
· Papers
An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning
arXiv:2504.18587v2 Announce Type: replace-cross Abstract: Reinforcement learning has emerged as a powerful approach for improving the reasoning capabilities of large language models, as demonstrated by systems such as OpenAI's O1~cite{o1} and DeepSeek-R1~cite{r1}. However, widely used algorithms such as PPO~cite{ppo