Das Paper arXiv:2609.21058 (Agarwal, Garg, Singhal, 17. September 2026) misst den Abstand zwischen Benchmark-Punktzahl und Produktionswirkung bei GPU-Kernen, die von Sprachmodellen geschrieben werden: 91,1 % korrekte Kernel auf KernelBench Level 1, verifizierte Speedups in 22 von 56 Fällen mit einem Median von 1,235x und ein adressierbarer Wall-Clock-Anteil von 8,9 % bis 58,2 % über sieben Workloads. Bei Transformern bleibt die realistische End-to-End-Marge bei rund 1 %; bei Recommendern steigt die Projektion auf 8,63 %. Die Korrektheitsprüfung des Benchmarks lässt sich bei 4 von 60 Problemen