@misc{indiciae20ee6b053436, title = {olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models}, author = {Jake Poznanski and Aman Rangapur and Jon Borchardt and Jason Dunkelberger and Regan Huff and Daniel Lin and Christopher Wilhelm and Kyle Lo and Luca Soldaini}, year = {2025}, url = {https://arxiv.org/abs/2502.18443}, note = {Source identifier: 2502.18443} }