Multi-Turn On-Policy Distillation with Prefix Replay
Baohao Liao, Hanze Dong, Christof Monz, et al.
ReOPD enables efficient multi-turn on-policy distillation for LLM agents by reusing teacher trajectories as replayed prefixes, avoiding costly environment interactions.