Skip to content
arXiv cs.AI · Papers

Co-Evolving LLM Evaluators and Policies via DynamicRubric

arXiv:2607.20083v2 Announce Type: replace-cross Abstract: Post-training with evaluator feedback on policy-induced samples serves as a major mechanism for improving large language models. As policies improve, these sampled responses become close in quality. These close candidates create a bottleneck for policy optimizat