@misc{indiciaed599b6852c3e, title = {Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search}, author = {Yuta Oshima and Masahiro Suzuki and Yutaka Matsuo and Hiroki Furuta}, year = {2025}, url = {https://arxiv.org/abs/2501.19252}, note = {Source identifier: 2501.19252} }