How can diffusion-like objectives preserve diversity and generative possibility rather than collapsing onto a single reward gradient?
Open-Ended Intelligence · RL · diversity · entropy · agent swarms