AEM: Supervision-Free Credit Assignment for Multi-Turn Agentic Reinforcement Learning
arXiv·medium signal
Adaptive Entropy Modulation solves the sparse-reward credit assignment problem in multi-turn LLM agent training without requiring dense intermediate supervision (process reward models or auxiliary signals). Adaptively modulates entropy dynamics during RL training to balance exploration-exploitation, avoiding the tuning complexity and poor generalization of process-reward approaches. Directly relevant to anyone training agents on long-horizon tasks with outcome-only rewards.