TY - RPRT TI - Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders AU - Dohun Lee AU - Hyeonho Jeong AU - Jiwook Kim AU - Duygu Ceylan AU - Jong Chul Ye PY - 2025 UR - https://arxiv.org/abs/2509.09547 ID - 2509.09547 ER -