MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection
arXiv·medium signal
MLLMs have been applied to multimodal embedding but their reasoning capabilities remain underutilized. MMEmb-R1 introduces pair-aware selection and adaptive control to incorporate chain-of-thought reasoning into embedding learning, addressing two fundamental challenges: noisy reasoning degrading embedding quality and reasoning overhead at inference. First work to successfully merge generative reasoning with embedding training.