“Hallo ChatGPT, wirst du uns alle umbringen?” Die Gefahren durch Künstliche Intelligenz sind enorm und die Auslöschung der gesamten Menschheit ist kein unrealistisches Szenario mehr. Der Ausbruch einer Künstlichen Intelligenz von OpenAI aus einem Testbereich hat dies nun in Ansätzen auch der Öffentlichkeit klargemacht. Doch was kann man dagegen tun? Welcher Weg muss eingeschlagen werden, um die Kontrolle nicht zu verlieren? Wir sprechen mit dem KI-Experten Benjamin Balde von ControlAI.
https://amirbenjaminbalde.substack.com/
https://www.thecompendium.ai/intelligence
UK AISI, Frontier AI Trends Report (Dezember 2025): Autonome Cyberfähigkeiten verdoppeln sich etwa alle acht Monate, in jedem getesteten System fanden sich universelle Jailbreaks, und Modelle übertreffen inzwischen promovierte Fachleute in wissenschaftlichen Wissenstests in der Biologie.
https://www.aisi.gov.uk/research/aisi-frontier-ai-trends-report-2025
Alignment Faking in Large Language Models (arXiv 2412.14093): Modelle täuschten in bis zu 78 Prozent der Fälle strategisch Regelkonformität vor, die Folgestudie (arXiv 2506.18032) kommt auf bis zu 96 Prozent.
https://arxiv.org/abs/2412.14093
https://arxiv.org/abs/2506.18032
Dario Amodei, The Urgency of Interpretability (April 2025): Der Mitgründer und CEO von Anthropic hält fest, dass wir auf präziser Ebene nicht erklären können, warum ein Modell eine bestimmte Entscheidung trifft, und dass die Interpretierbarkeitsforschung dem Fortschritt der Fähigkeiten hinterherläuft.
https://www.darioamodei.com/post/the-urgency-of-interpretability
Entdecke auch:
Damit Sich Was Dreht