Lightning OPD: Offline On-Policy Distillation Eliminates Live Teacher Server During LLM Post-Training
arXiv·medium signal
Wu et al. solve a key infrastructure bottleneck in LLM post-training: standard on-policy distillation requires a live teacher inference server throughout training, adding substantial GPU overhead. Lightning OPD decouples teacher inference from student training via an offline strategy, dramatically reducing infrastructure costs while maintaining distillation quality. Directly relevant for teams doing post-training on reasoning models.