Skip to yearly menu bar Skip to main content


Poster Tue, Dec 8, 2026 • 10:00 AM – 1:00 PM AEDT Hall 1-4

How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis

Rei Higuchi ⋅ Ryotaro Kawata ⋅ Akifumi Wachi ⋅ Shokichi Takakura ⋅ Kohei Miyaguchi ⋅ Taiji Suzuki

Abstract

Chat is not available.