TY - RPRT TI - Perception Encoder: The best visual embeddings are not at the output of the network AU - Daniel Bolya AU - Po-Yao Huang AU - Peize Sun AU - Jang Hyun Cho AU - Andrea Madotto AU - Chen Wei AU - Tengyu Ma AU - Jiale Zhi AU - Jathushan Rajasegaran AU - Hanoona Rasheed AU - Junke Wang AU - Marco Monteiro AU - Hu Xu AU - Shiyu Dong AU - Nikhila Ravi AU - Daniel Li AU - Piotr Dollár AU - Christoph Feichtenhofer PY - 2025 UR - https://arxiv.org/abs/2504.13181 ID - 2504.13181 ER -