Skip to yearly menu bar Skip to main content


Poster Tue, Dec 8, 2026 • 5:00 PM – 8:00 PM AEDT Hall 1-4

Dataset Mismatch Matters in Group Relative Policy Optimization for Reinforcement Learning from Verifiable Rewards

Zhen-Yu Zhang ⋅ Jiandong Zhang ⋅ Huaxiu Yao ⋅ Gang Niu ⋅ Masashi Sugiyama

Abstract

Chat is not available.