Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
arXiv·medium signal
Demonstrates that extrapolative (not just interpolative) weight averaging between fine-tuned checkpoints extends Pareto frontiers for code generation — trading off correctness vs. efficiency without additional training. Enables finding new useful checkpoints at inference time. Practical for teams that want multiple cost/quality operating points from a single training run.