TY - RPRT TI - Improving Neuron-level Interpretability with White-box Language Models AU - Hao Bai AU - Yi Ma PY - 2025 UR - https://arxiv.org/abs/2410.16443 ID - 2410.16443 ER -