Skip to yearly menu bar Skip to main content


Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training

Avidan Shah ⋅ Jannik Brinkmann ⋅ Rico Angell

Abstract

Chat is not available.