Generative Vision Atlas

Architecture option

Diffusion Transformer (DiT)

A plain Vision-Transformer backbone for diffusion/flow models, operating on a grid of latent patch tokens with adaptive layer norm for timestep/class conditioning.

Introduced by

Used by (3)

DiT, RAE, SiT

Alternatives on this axis

DiT with diffusion head (DiT^DH), MM-DiT (dual-stream joint attention), Single-stream (unified-weight) DiT, UNet backbone

← All Architecture options