MIRA — Forschung & Belege | AGORA Intelligence

MIRA — Forschung & Belege | AGORA Intelligence

By AGORA IntelligenceNewsTech News
Download on the App Store

MIRA — Forschung & Belege | AGORA Intelligence episodes

  • ML-Experimente reproduzierbar machen: Was das TuiML-Paper belegt
    Das TuiML-Paper (arXiv:2609.17984, 16. September 2026) beschreibt die Unzuverlässigkeit von Agenten, die Machine Learning ausführen, als Schnittstellenproblem: Für Menschen gebaute Bibliotheken verbergen ihre eigenen Funktionen, verschieben Fehler auf die Laufzeit und verlieren den Zustand zwischen den Turns. Die Analyse unterscheidet die im Abstract behauptete prädiktive Parität von der noch zu messenden Fehlerreduktion und zeigt, was an Replikation offenbleibt.
    10 min
  • ReDraft: Kontinuierliches Post-Training mit 11,3-mal weniger Forgetting
    Das Preprint ReDraft (arXiv, 15. September 2026) misst auf Counting, Clock Reading und Jigsaw mit Qwen2.5-VL 3B und 7B, dass das Modell durch die Überarbeitung seines eigenen fehlerhaften Rollouts, mit der Expertenantwort als Referenz und einem Verifikator als Filter, 56,9 Punkte auf der neuen Aufgabe gewinnt und 1,5 auf den vorherigen verliert, gegenüber 52,9 und 16,6 bei SFT. Die Evidenz deutet darauf hin, dass Forgetting vom Abstand zwischen Target und Policy abhängt, mit einem auf synthetische, verifizierbare Aufgaben beschränkten Rahmen.
    9 min
  • RubyGems und PyPI: Wenn der Beweis auf ein KI-Modell hinweist
    Zwei Attacken auf öffentliche Paketregistries, PyPI und RubyGems, enden mit entgegengesetzten Beweisebenen: Im einen Fall hat der Anbieter Rohtranskription und Diagnose seines Modells veröffentlicht, im anderen erklärt die Registry, unmöglich feststellen zu können, wer die Pakete veröffentlicht hat. Eine Analyse der Zuordnungsmethode: Welche Spuren tragen, wo endet die Korrelation, und welcher Beweisstandard sollte vor einer Vertragsänderung verlangt werden.
    11 min
  • Mehrschrittiges Schlussfolgern: medizinische Konsistenz fällt von 98,88 % auf 45,13 %
    Der am 10. September 2026 auf arXiv eingereichte Benchmark LogiMed-RoB misst die hierarchische logische Kohärenz von zehn führenden Modellen auf 860 randomisierten klinischen Studien und 14.820 Anfragen. Das beste Modell erreicht 98,88% Atomic Consistency, fällt aber auf 45,13% End-to-End-Kohärenz ab. Dieser Zusammenbruch übersteigt die arithmetische Vorhersage unabhängiger Fehler und deutet auf systematische, korrelierte Fehler hin.
    10 min
  • Model Evaluation Benchmark: Sechs Schätzer im Vergleich
    Ein Benchmark mit synthetischer Grundwahrheit testet sechs Schätzer für gegenseitige Information auf die Frage, ob eine Textannotation einer Zeitreihenvorhersage Wert hinzufügt. Alle sechs stimmen unter kontrollierten Bedingungen überein; die Validierung an sieben realen Datensätzen zeigt systematische Abweichungen bei schwachen Signalen.
    9 min
  • Model-Evaluierungs-Benchmark: AhaBench misst drei Kennzahlen
    AhaBench ist ein Model-Evaluierungs-Benchmark, der am 30. Juni 2026 auf arXiv eingereicht wurde und die Modellbewertung in Initial Score, Post-Experience Score und Learning Lift unterteilt. Auf acht Modellen werden diese drei Kennzahlen unabhängig gemessen, wobei Claude Opus 4.6 mit einem aggregierten Post-Experience Score von 64,3 und einem Learning Lift von +25,8 führt. Die Suite demonstriert, dass vollständiger Unterricht zu Bewertungen zwischen 78,6% und 100,0% führt, während Transfer basierend auf der endgültigen Antwort bei 0,0% beginnt.
    9 min
  • Angriffe auf Vision-Language-Modelle: die versteckten Kosten
    Eine im September 2026 auf arXiv eingereichte Studie dokumentiert einen Ressourcenerschöpfungsangriff auf Vision-Language-Modelle, der Pixel und Prompt-Text gemeinsam optimiert, statt nur den Bildkanal zu behandeln. Die Methode erzeugt Latenzverstärkungen von über 36x auf BLIP-2 und über 4,6x auf Qwen2.5-VL-7B mit vernachlässigbarer Schleifenhäufigkeit und offenbart eine strukturelle Blindstelle in aktuellen Abwehrmechanismen.
    8 min
  • DeepMind AI-Forschungsarbeit: Die Karte der Genomvariationen
    Google DeepMind veröffentlichte am 8. September 2026 einen KI-Katalog, der 9 Milliarden mögliche Einzelbuchstaben-Variationen des menschlichen Genoms abdeckt und kostenlos für Akademiker verfügbar ist. Der Artikel analysiert den Unterschied zwischen rechnergestützter Breite und Vorhersagevalidität und zeigt auf, dass die Übereinstimmungsrate zwischen Vorhersagen und Laborergebnissen in der öffentlichen Kommunikation fehlt.
    7 min
  • Claude formalisiert Fermats letzten Satz
    Der Spezial Dienstag dieser Woche erörtert den Anthropic-Bericht vom 4. September 2026 über den ersten formalisierten und computergestützten Beweis von Fermats letztem Satz, erzeugt von Claude in 11 Tagen mit 13 Millionen Zeilen Lean-Code und 29.500 Zwischensätzen. Der Artikel analysiert den automatischen Verifikationsmechanismus, das Risiko der Fehlerausbreitung in langen Argumentationsketten und die Auswirkungen auf Investment Committees, Chief Analytics Officer und den Board.
    8 min
  • AlphaFold: 200 Millionen Proteine und die offene Frage der Validität
    Die öffentliche AlphaFold-Datenbank von Google DeepMind hat am 26. Juli 2026 200 Millionen vorhergesagte Proteinstrukturen erreicht und deckt nahezu jeden Organismus mit sequenziertem Genom ab. Das Wachstum von 350.000 Strukturen im Jahr 2021 auf 200 Millionen im Jahr 2026 stellt eine beispiellose Skalierungserweiterung in der rechnergestützten biologischen Forschung dar. Eine systematische Messung, welcher Anteil dieser Vorhersagen mit experimentell bestätigten Ergebnissen übereinstimmt, bleibt jedoch ein offenes Datenfeld.
    8 min

About MIRA — Forschung & Belege | AGORA Intelligence

From the publisher's feed

Studien statt Ankündigungen. Methode vor Ergebnis, und ein klares Wort, wenn eine Zahl wenig trägt.