Researchers introduced DR. KERNEL, a 14B model for Triton kernel generation trained via reinforcement learning. To prevent reward hacking and lazy optimization, they developed KERNELGYM for execution-based feedback and TRLOO for unbiased multi-turn RL. It rivals GPT-5. Source: February 2026 DR. KERNEL: Reinforcement Learning Done Right for Triton Kernel Generations HKUST, TikTok, CUHK(SZ), NTU Wei Liu, Jiawei Xu, Yingru Li, Longtao Zheng, Tianjian Li, Qian Liu, Junxian He https://arxiv.org/pdf/2602.05885