arXiv cs.AI
· Papers
Co-Evolving LLM Evaluators and Policies via DynamicRubric
arXiv:2607.20083v2 Announce Type: replace-cross Abstract: Post-training with evaluator feedback on policy-induced samples serves as a major mechanism for improving large language models. As policies improve, these sampled responses become close in quality. These close candidates create a bottleneck for policy optimizat