One model learns any data distribution
A single transformer architecture jointly estimates data density and score functions across different distributions.
A single transformer architecture jointly estimates data density and score functions across different distributions.