Cogvideo: Large-scale pretraining for text-to-video generation via transformers
Wenyi Hong, Ming Ding, Wendi Zheng, et al.
CogVideo is the first large-scale pretrained transformer for text-to-video generation, leveraging a pretrained text-to-image model to achieve state-of-the-art results.