Research
No Hard Negatives Required: Concept Centric Learning Achieves Compositional Vision-Language Understanding Without Expensive Data Curation
Introduces Concept Centric Learning for contrastive vision-language models (CLIP family) that achieves compositional understanding without requiring carefully curated hard negative training pairs. Prior methods to fix compositionality in V&L models relied on expensive hard negative generation pipelines; this approach decomposes representations into individual concept components using standard training data. Maintains zero-shot transfer capabilities while improving compositional reasoning — a practical advance for anyone building on CLIP-based systems.
Source
↳ Follow the thread