Skip to yearly menu bar Skip to main content


Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

Hadas Orgad ⋅ Boyi Wei ⋅ Kaden Zheng ⋅ Martin Wattenberg ⋅ Peter Henderson ⋅ Seraphina Goldfarb-Tarrant ⋅ Yonatan Belinkov

Abstract

Chat is not available.