タイトル: Gym-Anything: Turn any Software into an Agent Environment著者: Pranjal Aggarwal, Graham Neubig, Sean Welleck(カーネギーメロン大学)発表: 2026年4月(arXiv プレプリント)AIがソフトウェアのテスト環境を自動で作り、別のAIがスクリーンショットで監査する「作成・監査ループ」がすごい200種類のソフト・1万件超のタスクという桁違いのベンチマークが誕生し、AIの実力がリアルに測れるようになった最強モデルでも達成率27.5%——AIに仕事を丸投げできる時代はまだ先だけど、小型モデルの急成長にも注目Computer-Use Agent(CUA): 人間のようにマウスやキーボードでパソコンを操作するAIのこと。画面を見てクリックやタイプを行い、ソフトウェアを使いこなすことを目指します作成・監査ループ: AIが環境を作り、別のAIがスクリーンショットなどの証拠でチェックして不備を指摘する品質管理の仕組み。施工者と検査員のような関係です提案→増幅(Propose-and-Amplify): 高性能なAIが少数のお手本タスクを作り、安価なAIがそれを参考に大量のタスクを生成する二段階のデータ作成手法蒸留(Distillation): 大きく高性能なAIの「解き方」を小さなモデルに学習させて性能を移す技術。大型モデルの知恵を圧縮して持ち運べるようにするイメージですGDP基盤のソフト選定: テスト対象のソフトを「その職業がどれだけ経済価値を生んでいるか」から逆算して選ぶ方法。経済的に重要なソフトを優先的にカバーします論文URL: https://arxiv.org/abs/2604.06126v1