MIRA — Forschung & Belege | AGORA Intelligence

MIRA — Forschung & Belege | AGORA Intelligence

By AGORA IntelligenceNewsTech News
Download on the App Store

MIRA — Forschung & Belege | AGORA Intelligence episodes

  • KI-Interpretability-Forschung: das Grundrauschen der Messung
    Ein am 12. August 2026 auf arXiv eingereichtes Paper misst den Split-Half-Boden jener Cosine Similarity, mit der der Transfer von Interpretability-Artefakten auf quantisierte Gewichte zertifiziert wird. Bei Qwen2.5-1.5B-Instruct reicht die Klassentrennung von 33 bis 61, weshalb zwei unabhängige Durchläufe desselben Difference-in-Means-Schätzers allein durch die Stichprobenziehung zwischen 0,978 und 0,994 übereinstimmen: ein veröffentlichter Cosinus von 0,996 bleibt unlesbar, solange n fehlt. Mit dem im komprimierten Modell gemessenen Null dreht die Richtung bei INT4 über das Rauschen hinaus, b
    10 min
  • LLM Benchmark Evaluation: Der Richter hängt vom Modell ab
    Ein am 25. September 2026 auf arXiv eingereichtes Paper misst, wie stark das Protokoll zur Sammlung der Evidenz einen paarweisen Sprachrichter beeinflusst. Über vier Benchmarks und zwei Backbones mit 8 Milliarden Parametern gewinnt die vorgeschlagene Methode (BAER) in allen acht Konstellationen, mit Zugewinnen zwischen 0,87 und 7,32 Punkten gegenüber der besten externen Baseline. Der entscheidende Befund ist die Abhängigkeit: Der jeweils beste Mechanismus wechselt mit dem Benchmark und dem Judge-Modell, und das relativiert die Vorstellung vom LLM-Richter als neutraler Instanz.
    9 min
  • Ausführbare KI-Labore: Die Studie, die den Maßstab verschiebt
    Das Paper LabFactory, am 23. September 2026 auf arXiv eingereicht, dokumentiert 28 ausgewählte Konstruktionen über sieben Kategorien wissenschaftlicher Aufgaben: Die ausgelieferten Labore haben die konfigurierten Referenzwerte in allen 33 Subtests unter host-seitiger Ausführung übertroffen. Der messbare Beitrag liegt im Protokoll: Gegenstand der Bewertung wird das ausgelieferte Artefakt, ausgeführt von einem separaten Host auf Held-out-Eingaben, mit den Reference Labels außerhalb der Eingabeschnittstelle des Solvers. Zehn Labore enthalten während der Konstruktion trainierte Modelle, die übrige
    9 min
  • ISA-Bench: Wo LLMs beim Ausführen den Faden verlieren
    ISA-Bench, am 19. September 2026 auf arXiv veröffentlicht, bewertet Sprachmodelle anhand von Programmierspielen mit reduzierten Befehlssätzen, jedes ausgestattet mit Parser, virtueller Maschine und Verifizierer. Reasoning-Modelle erreichen höhere durchschnittliche Lösungsquoten als codespezialisierte Modelle, und unbekannte Syntax bleibt eine vorrangige Fehlerquelle. Die von den Autoren eingeführte Analyse des Reasoning-Execution-Gap dokumentiert eine wiederkehrende Kluft zwischen dem Finden einer plausiblen Rechenstrategie und deren Niederschrift als korrektes Programm in der Ziel-ISA, mit se
    9 min
  • Text-to-SQL: Modellbewertung erkennt nur 25 Prozent der korrekten Queries
    Eine am 17. September 2026 auf arXiv eingereichte Studie von Alrashed, Ozcan, Jacobsson, Neiman und Chen vermisst die Schwachstelle der Bewertung im Text-to-SQL mit AI-Operatoren. Die Execution Accuracy erkennt nur 25% der gültigen Übersetzungen, und ein LLM-Autorater auf dem Stand der Technik weist 32% der korrekten Queries fälschlich zurück. Ein geschichtetes Framework, das relationale Logik und AI-Semantik trennt, erreicht auf BigQuery und ThalamusDB bis zu 97,2% Gesamtgenauigkeit.
    9 min
  • LLM-Benchmark-Evaluation: Der Bias steckt im Prompt
    PsyAgentBench, ein arXiv-Preprint vom 23. Juli 2026 von Joy Bose, veröffentlicht 41.904 Durchläufe zu fünf klassischen psychologischen Paradigmen, angewandt auf Sprachagenten, mit einem faktoriellen Design, das benanntes oder maskiertes Paradigma, kanonische oder umgeschriebene Fassung und Persona-Manipulation kreuzt. Das Konformitätsparadigma von Asch springt bei gpt-oss-120B von 0 Prozent auf 83,3 Prozent, sobald sich allein die Formulierung ändert; der Ankereffekt beträgt null bei überprüfbaren Fakten und fast das Maximum bei erfundenen Größen; die Sunk-Cost-Verzerrung bleibt aus; die Zutei
    9 min
  • GPU-Kernel aus LLMs: Die 91,1 %, die in der Produktion 1 % wert sind
    Das Paper arXiv:2609.21058 (Agarwal, Garg, Singhal, 17. September 2026) misst den Abstand zwischen Benchmark-Punktzahl und Produktionswirkung bei GPU-Kernen, die von Sprachmodellen geschrieben werden: 91,1 % korrekte Kernel auf KernelBench Level 1, verifizierte Speedups in 22 von 56 Fällen mit einem Median von 1,235x und ein adressierbarer Wall-Clock-Anteil von 8,9 % bis 58,2 % über sieben Workloads. Bei Transformern bleibt die realistische End-to-End-Marge bei rund 1 %; bei Recommendern steigt die Projektion auf 8,63 %. Die Korrektheitsprüfung des Benchmarks lässt sich bei 4 von 60 Problemen
    10 min
  • Neuronale Scaling Laws: Der Beweis kommt von Rydberg-Atomen
    Das Paper "Do Quantum Models Scale Like LLMs?", am 17. September 2026 auf arXiv eingereicht von Berman, Kao, Melko und Stapleton, trainiert den autoregressiven Transformer RydbergGPT auf Daten projektiver Qubit-Messungen aus Arrays von Rydberg-Atomen. Nahe am kritischen Punkt des Systems folgt die Loss als Funktion der Datensatzgröße gut einem Potenzgesetz mit Loss-Floor-Korrektur, fern der Kritikalität sinkt die Güte dieser Beschreibung erheblich. Der Vergleich zwischen der statistischen Struktur der Quantenmessungen und jener natürlichsprachlicher Korpora, durchgeführt mit einer Zweipunktfun
    8 min
  • Reproduzierbarkeit im Machine Learning: Es kommt auf das Protokoll an
    Eine am 16. September 2026 auf arXiv eingereichte Studie erkennt vier motorische Zustände anhand sensorbestückter Einlegesohlen bei 15 gesunden Erwachsenen. Methodisch entscheidend ist der Übergang von einer stratifizierten 10-fach-Kreuzvalidierung, die dem Screening dient, zu einer teilnehmerunabhängigen Stratified-Group-Kreuzvalidierung mit 5 Folds, die die Generalisierung auf trainingsfremde Personen misst. Unter diesem Protokoll erreicht das Histogram-Based Gradient Boosting einen Makro-F1 von 0,954 und 0,959 an den einzelnen Füßen und 0,980 bei beidseitiger Messung, während der Vergleich
    9 min

About MIRA — Forschung & Belege | AGORA Intelligence

From the publisher's feed

Studien statt Ankündigungen. Methode vor Ergebnis, und ein klares Wort, wenn eine Zahl wenig trägt.