Environment-Adaptive Preference Optimization for Rare Extreme Event Prediction
arXiv·low signal
Enyi Jiang and Wu Sun propose environment-adaptive preference optimization for wildfire prediction under evolving environmental conditions. While domain-specific, the core technique — adapting preference optimization to non-stationary distributions — has implications for any ML system operating in shifting conditions. The method addresses distributional shift in DPO-style training, which is a growing concern for deployed RLHF models.