Neuer Felony Benchmark gedropped.
Erst hackt sich ein OpenAI model in Huggingface in zuge einer Evaluation. Dann meldet Anthrophic das es bei ihnen auch schon 3 mal passiert ist.
Selbst Meta meldet sich zum Thema.
Außerdem, Deepseek V4 0731 macht Druck auf Amerikanische AI Labs. Mit guten Benchmark Ergebnissen und sehr günstigem Betrieb stellt sich die Frage, warum sind Codex und Claude so teuer?
Und wie performed Claude eigentlich im Vergleich zu Deepseek in einem optimierten remote development Setup.
Hört rein um mehr zu erfahren