Language Models Can Control Their Own AttentionMay 22, 2026ยท[P1] Namgyu Ho*, Huzama Ahmad*, Woosung Koh*, Se-Young Yun, Tal Schuster, Cicero Nogueira Dos Santosยท 0 min read PDFTypeConference paperPublicationPre-printLast updated on Sep 12, 2026Long-Context Efficient Inference Sparse Attention ← Continually Post-training Small Models via Synthetic Self-distillation Sep 1, 2026mSFT: Addressing Dataset Mixtures Overfiting Heterogeneously in Multi-task SFT Mar 25, 2026 →