Training signal option
Online RL / policy gradient
Fine-tune a generator against a reward model with online policy-gradient methods such as GRPO, rather than only maximizing likelihood on a fixed dataset.
Introduced by
- Flow-GRPO 2025-05
Training signal option
Fine-tune a generator against a reward model with online policy-gradient methods such as GRPO, rather than only maximizing likelihood on a fixed dataset.