The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
A research paper proposing a framework for training AI agents to perform multi-turn, long-horizon planning through on-policy distillation from single and multiple teacher models. The work explores pre-training and post-training paradigms.