世界47カ国・17言語・3万問のオリンピアド級数学問題を集めたMIT発の新ベンチマーク「MathNet」(ICLR 2026採択論文)を解説。最新のフロンティアモデル──Gemini 3.1 Pro、GPT-5、Claude Opus 4.6、DeepSeek V3.2 Specialeらを徹底比較し、「問題を解く力」では77%超えを叩き出す一方、「数学的に等価な問題を検索する力」ではなんとTop-1正解率たった5%という衝撃の結果が明らかに。なぜAIは x²+y²=1 と |u|²=1 が"同じ"だと気づけないのか?表層の言葉ではなく、数学の構造そのものを理解する次世代AIの課題を、エンジニアじゃなくても分かるようにフランクに解説します。