@misc{indiciae5ba814d62077, title = {CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation}, author = {Chengzhuo Tong and Mingkun Chang and Shenglong Zhang and Yuran Wang and Cheng Liang and Zhizheng Zhao and Ruichuan An and Bohan Zeng and Yang Shi and Yifan Dai and Ziming Zhao and Guanbin Li and Pengfei Wan and Yuanxing Zhang and Wentao Zhang}, year = {2026}, url = {https://arxiv.org/abs/2601.10061}, note = {Source identifier: 2601.10061} }