Skip to yearly menu bar Skip to main content


Poster Thu, Dec 10, 2026 • 2:00 AM – 5:00 AM AEDT Hall C1

CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

Zhen Zhang ⋅ Kaiqiang Song ⋅ Sean Wang ⋅ Yebowen Hu ⋅ Weixiang Yan ⋅ Chenyang Zhao ⋅ Henry P Zou ⋅ Haoyun Deng ⋅ Sathish Reddy Indurthi ⋅ Shujian Liu ⋅ Simin Ma ⋅ Xiaoyang Wang ⋅ Xin Wang ⋅ Song Wang

Abstract

Chat is not available.