Skip to yearly menu bar Skip to main content


Poster Thu, Dec 10, 2026 • 10:00 AM – 1:00 PM AEDT Hall 1-4

Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

Jintao Zhang ⋅ Kai Jiang ⋅ Chendong Xiang ⋅ Weiqi Feng ⋅ Yuezhou Hu ⋅ Haocheng Xi ⋅ Shuo Yang ⋅ Mengfei Xia ⋅ Jianfei Chen ⋅ Jun Zhu

Abstract

Chat is not available.