Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors
arXiv·low signal
Generates multi-speaker dialogue audio scenes using in-the-wild reference priors instead of requiring structured supervision like per-turn speaker tags or multi-stream inputs. Lowers the annotation burden for synthetic speech/dialogue data, though it's a niche audio-generation result. By Michael Finkelson, Daniel Segal, Eitan Richardson et al. (cs.SD/cs.AI/cs.CV).