@misc{indiciae73662f4ea68c, title = {FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis}, author = {Zhen Hao Wong and Jingwen Deng and Yuzhao Wang and Wenkai Yu and Jihao Huang and Runming He and Chengyu Shen and Hao Liang and Wentao Zhang}, year = {2026}, url = {https://arxiv.org/abs/2511.16216}, note = {Source identifier: 2511.16216} }