arXiv:2606. 18388v1 Announce Type: new Abstract: RL post-training strategies are dataset-dependent and reveal a recurring empirical pattern: capacity parameters accumulate monotonically across stages, while regularization parameters predominantly oscillate in response to shifting training dynamics.
Paper
LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents
Unreadunread