TY - RPRT TI - Reinforcement Learning Fine-tuning of Language Models is Biased Towards More Extractable Features AU - Diogo Cruz AU - Edoardo Pona AU - Alex Holness-Tofts AU - Elias Schmied AU - VĂ­ctor Abia Alonso AU - Charlie Griffin AU - Bogdan-Ionut Cirstea PY - 2023 UR - https://arxiv.org/abs/2311.04046 ID - 2311.04046 ER -