タイトル: The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping著者: Yang Liu et al.(復旦大学・上海イノベーション研究所)発表: 2026年4月AIが同じタイプの間違いを繰り返す「エラー崩壊」という問題に、過去の失敗を記憶させるアプローチで挑んだモデル内部の計算データを"推論の指紋"として再利用し、ほぼ追加コストゼロで失敗パターンを分類できる数学ベンチマークで正答率が最大17%向上しつつ、解き方のバリエーションも増えた強化学習: AIに「良い結果には報酬、悪い結果にはペナルティ」を与えて行動を改善させる学習方法。ゲームや数学の問題解きでよく使われますロジット: モデルが次の単語を選ぶときの「各候補の有力度スコア」。モデル内部の計算過程で自然に生まれるので、追加の計算なしに取り出せますHDBSCAN: データの密集具合を見て自動的にグループ分けする手法。グループの数を事前に決めなくていいのが特長です報酬シェーピング: AIに与える報酬の設計を工夫して、望ましい行動をより効率的に学ばせるテクニックpass@k: k回答を生成したうちに少なくとも1回正解が含まれる確率。AIの問題解決力を測る指標です論文URL: https://arxiv.org/abs/2604.11297