Generative Vision Atlas

Training signal option

Online RL / policy gradient

Fine-tune a generator against a reward model with online policy-gradient methods such as GRPO, rather than only maximizing likelihood on a fixed dataset.

Introduced by

Used by (1)

Flow-GRPO

Alternatives on this axis

Representation alignment (REPA-style)

← All Training signal options