@misc{indiciae5c9e36c88b5a, title = {F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation}, author = {Dinghao Zhou and Xingchen Song and Di Wu and Pengyu Cheng and Shengfan Shen and Sixiang Lv}, year = {2026}, url = {https://arxiv.org/abs/2606.06357}, note = {Source identifier: 2606.06357} }