Skip to yearly menu bar Skip to main content


Poster Fri, Dec 11, 2026 • 3:30 AM – 5:30 AM AEDT Paris Poster Hall

Control Reinforcement Learning: Token-Level Mechanistic Analysis via Learned SAE Feature Steering

Seonglae Cho ⋅ Zekun Wu ⋅ Adriano Koshiyama

Abstract

Chat is not available.