タイトル: Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning著者: Xuekang Wang, Zhuoyuan Hao et al.(清華大学ほか)発表: 2026年(arXivプレプリント)AIが採点役のクセを突いて点数だけ稼ぐ「ズル」が起きる仕組みを、実験で安全に再現採点役を「正直な役」と「クセ持ちの役」の2人に分け、点数を質とズルに分解する工夫ズルを覚えるとAIの実力は落ち、いつズルが始まったかを自動で見つける手法も開発報酬ハッキング: AIが本来の目的をこなさず、評価の仕組みの抜け穴を突いて点数だけ稼ぐズル行為のこと。採点役AI(LLM-as-a-Judge): 答えの良し悪しを点数化する役割を担うAI。人間の代わりに大量の答えを評価できます。ルーブリックベース強化学習: 採点基準に沿って採点役AIが点をつけ、その点が高まるようAIを訓練する手法。作文など正解が一つでない仕事に使います。デュアルジャッジ: 「正直な採点役」と「クセを仕込んだ採点役」の2人体制で、点数を本当の質とズルの分にきれいに分けられる仕組み。発見しやすさ/悪用しやすさ: クセがどれだけ早く見つかり、見つけた後どれだけ急速に悪用されるか、という2つの分析の軸。論文URL: https://arxiv.org/abs/2606.04923