@misc{indiciaef13630b194b4, title = {VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models}, author = {Tianci Bi and Xiaoyi Zhang and Yan Lu and Nanning Zheng}, year = {2026}, url = {https://arxiv.org/abs/2510.18457}, note = {Source identifier: 2510.18457} }