Wie funktioniert eigentlich KI?

Wie funktioniert eigentlich KI?

By Wie funktioniert eigentlich ...?Education
Download on the App Store

Wie funktioniert eigentlich KI? episodes

  • Sprachassistent – Erst das Weckwort startet die Übertragung

    Ein Sprachassistent liegt in fast jeder Hosentasche — und kaum jemand weiß, was zwischen dem Weckwort und der Antwort tatsächlich passiert. Die Datenschutzfrage entscheidet sich genau dort.


    Was du in dieser Folge lernst:

    - Warum „hört immer zu“ und „nimmt immer auf“ zwei verschiedene Dinge sind — und was ein Ringpuffer damit zu tun hat

    - Wie die Weckwort-Erkennung auf dem Gerät arbeitet: kein Ja oder Nein, sondern ein Ähnlichkeitswert an einer Marke

    - Warum Fehlauslösungen vor dem Fernseher die erwartbare Folge dieser Marke sind und kein heimliches Mithören

    - Was bei Apple und Amazon die zweite Prüfstufe tut — und warum sie die Übertragung nicht verhindert, sondern nur früh beendet

    - Wie aus einem gesprochenen Satz eine Absicht mit Parametern wird und wer sie am Ende ausführt


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Hey Google, Timer auf zehn Minuten

    (01:31) Ein Speicher, der sich selbst überschreibt

    (02:23) Ein Ähnlichkeitswert und eine Schwelle

    (03:20) Eine zweite Stufe prüft nach

    (04:40) Vom Wortlaut zur Absicht

    (05:46) Fünf Stufen, fünf Fehlerquellen

    (07:25) Er versteht nicht, er sortiert ein

    (08:18) Vom Ringpuffer bis zur gesprochenen Antwort


    Begriffe aus dieser Folge:

    - Weckwort: Das eine festgelegte Wort, auf das ein Sprachassistent im Ruhezustand horcht und das erst die weiteren Stufen in Gang setzt.

    - Ringpuffer: Ein Zwischenspeicher von wenigen Sekunden, in den das Mikrofon fortlaufend schreibt und der sich dabei selbst überschreibt.

    - Keyword Spotting: Das Verfahren der Weckwort-Erkennung, das den Ton nicht in Text übersetzt, sondern nur seine Ähnlichkeit mit einem trainierten Wortmuster bewertet.

    - Schwellenwert: Die festgelegte Marke, die der Ähnlichkeitswert überschreiten muss, damit das Gerät aufwacht.

    - Intent: Die vorgesehene Absicht, der das Sprachverstehen einen Satz zuordnet; ihre veränderlichen Angaben heißen Slots.


    Verwandte Episoden:

    - Folge 16 — Spracherkennung — Wie aus gesprochener Sprache geschriebener Text wird.

    - Folge 20 — Text-to-Speech — Wie aus einem Text eine natürlich klingende Stimme wird.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    10 min
  • KI-Suche – Die Antwort kommt aus einem fertigen Index

    Immer öfter beantwortet die Suche die Frage selbst, statt auf Seiten zu verweisen. Wer weiß, wie diese Antwort entsteht, kann einschätzen, was sie wert ist — und wann sich der Klick auf die Quelle lohnt.


    Was du in dieser Folge lernst:

    - Warum eine KI-Suche nicht das offene Netz durchsucht, sondern einen vorher gefüllten Index

    - Wie aus einer einzigen Frage mehrere Teilanfragen werden — das Prinzip Query Fan-out

    - Wie aus den Treffern Passagen ausgewählt und im Kontextfenster zu einem Antworttext verdichtet werden

    - Warum die Antwort aktueller sein kann als das Sprachmodell selbst

    - Warum eine Quellenangabe eine nachträgliche Zuordnung ist und in Tests oft danebenlag


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Ein fertiger Absatz statt zehn blauer Links

    (01:17) Gefragt wird der Index, nicht das Netz

    (02:06) Aus einer Frage werden viele

    (03:11) Ein paar Passagen, nicht ganze Seiten

    (03:59) Woher die Quellenangaben kommen

    (05:01) Je länger die Frage, desto eher die Zusammenfassung

    (06:35) Der Verweis ist eine Zuordnung, keine Garantie

    (07:47) Aktuell ist der Index, nicht das Modell


    Begriffe aus dieser Folge:

    - Index: Eine sehr große Datenbank, in der Programme heruntergeladene Webseiten ablegen, damit eine Suche sie abfragen kann.

    - Query Fan-out: Die Zerlegung einer Frage in mehrere Teilanfragen, die gleichzeitig an den Index gehen.

    - Kontextfenster: Die Menge an Text, die ein Sprachmodell in einer Anfrage gleichzeitig lesen und berücksichtigen kann.

    - AI Overview: Die zusammengefasste Antwort, die Google seit Mai 2024 über der Trefferliste anzeigt.


    Verwandte Episoden:

    - Folge 10 — RAG-System — Wie ein Sprachmodell mit externem Wissen (z. B. aus einer Datenbank) antwortet.

    - Folge 15 — KI-Halluzination — Warum ein Sprachmodell überzeugend klingt und trotzdem Dinge erfindet.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    9 min
  • KI-Training – Von den Texten bleiben nur Zahlen übrig

    Wer versteht, wie ein Modell trainiert wurde, kann seine Antworten besser einordnen: warum es bei aktuellen Ereignissen passen muss, warum es manches selbstsicher behauptet und warum eine Korrektur im Chat nichts dauerhaft verändert.


    Was du in dieser Folge lernst:

    - Woher die Trainingsdaten kommen — und warum ein einzelner Monatsabzug des Webs schon 2,3 Milliarden Seiten umfasst

    - Warum der Rohbestand vor dem Training gefiltert wird und was dabei wegfällt

    - Was Gewichte sind und warum sie am Ende das Einzige sind, was von den Texten bleibt

    - Wie aus einem reinen Textfortsetzer in zwei weiteren Phasen ein Antwortgeber wird

    - Was der Wissensstichtag ist und warum ein Modell im Gespräch nichts dazulernt


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Woher der Chatbot das alles hat

    (01:01) Eine Bibliothek lesen und kein Buch behalten

    (02:05) 2,3 Milliarden Webseiten, gefiltert

    (03:33) Monatelang tausende Grafikkarten

    (04:15) Menschen schreiben die Musterantworten

    (05:51) Der Wissensstichtag und die alte Antwort

    (06:48) Gespeichert sind nur Gewichte, keine Texte

    (07:38) Mehr Daten sind nicht automatisch besser


    Begriffe aus dieser Folge:

    - Trainingsdaten: Die Textmenge aus Netz, Büchern und lizenzierten Beständen, die ein Modell beim Training zu sehen bekommt.

    - Gewichte (Parameter): Die internen Zahlenwerte eines Modells, die beim Training verstellt werden und danach sein gesamtes Können tragen.

    - Vortraining: Die erste und längste Trainingsphase, in der ein Modell nur lernt, Text fortzusetzen.

    - Feinabstimmung: Das gezielte Nachtrainieren eines fertigen Modells auf zusätzlichen Daten, damit es eine bestimmte Aufgabe besser löst.

    - Wissensstichtag: Das Datum, bis zu dem die Trainingsdaten eingesammelt wurden — danach kennt das Modell nichts Neues.


    Verwandte Episoden:

    - Folge 04 — Machine Learning — Wie Maschinen aus Beispielen lernen, statt explizit programmiert zu werden.

    - Folge 06 — Sprachmodell — Wie ein Modell auf riesigen Textmengen trainiert wird und jeweils das nächste Wort vorhersagt.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    10 min
  • Spam-Filter – Kein einziges Wort ist verboten

    Ein Spam-Filter kennt kein einziges verbotenes Wort — er zählt Häufigkeiten. Warum eine echte Rechnung trotzdem im Spam-Ordner landen kann.


    Was du in dieser Folge lernst:

    - Warum ein Spam-Filter keine Liste verbotener Wörter abarbeitet, sondern Häufigkeiten aus zwei Stapeln Beispiel-Mails vergleicht

    - Was ein Schwellenwert ist und warum jede Verschärfung sofort auf der anderen Seite kostet

    - Warum eine echte Rechnung fast alle Merkmale einer gefälschten trägt

    - Was SPF, DKIM und DMARC prüfen — und was sie ausdrücklich nicht beurteilen

    - Warum „Als Spam melden“ für den Filter mehr zählt als Löschen


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Zwischen Gewinnbenachrichtigungen und Werbung

    (01:40) Jedes Merkmal einzeln gewogen

    (02:47) Zwei Arten von Fehlern, eine Marke

    (03:27) Der Absender ist nur eine Behauptung

    (04:22) Melden bringt mehr als Löschen

    (05:50) Warum verstellte Schreibweisen nichts bringen

    (06:45) Die Schwelle zu drehen kostet anderswo

    (07:21) Zwei Stapel, ein Schwellenwert, deine Rückmeldung


    Begriffe aus dieser Folge:

    - Merkmal: Die kleinste Einheit, die ein Spam-Filter zählt — ein Wort im Betreff, die Absenderadresse, der versendende Server oder ein Link im Text.

    - Ham: Die Bezeichnung für erwünschte Post, also das Gegenstück zu Spam.

    - Schwellenwert: Die einstellbare Grenze, ab der ein Filter eine Mail als Spam einordnet.

    - Falsch-Positiv: Eine erwünschte Mail, die im Spam-Ordner landet — der Fehler, der schwerer wiegt, weil niemand den Spam-Ordner täglich durchsieht.

    - Absenderprüfung (SPF, DKIM, DMARC): Drei Verfahren, die prüfen, ob eine Mail wirklich von der Domain kommt, die im Absender steht — nicht, ob sie Spam ist.


    Verwandte Episoden:

    - Folge 04 — Machine Learning — Wie Maschinen aus Beispielen lernen, statt explizit programmiert zu werden.

    - Folge 11 — Empfehlungsalgorithmus — Wie Plattformen aus deinem Verhalten vorhersagen, was dir als Nächstes gefällt.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    9 min
  • Text-to-Speech – Drei Sekunden genügen für eine Stimme

    Navigationsansage, Vorlesefunktion, Sprachassistent: Jeden Tag hören wir Stimmen, die niemand aufgenommen hat. Wie eine Maschine aus Buchstaben eine Schallwelle baut, ist erstaunlich gut nachvollziehbar — wenn man die Kette einmal von vorne kennt.


    Was du in dieser Folge lernst:

    - Warum ein Text nur sagt, WAS gesagt wird, und Betonung, Tempo und Stimme ergänzt werden müssen

    - Wie das Front-End Zahlen ausschreibt, Laute zuordnet und Betonungen markiert

    - Was ein Mel-Spektrogramm ist und wofür der Vokoder gebraucht wird

    - Warum moderne Systeme keine aufgenommenen Wörter zusammensetzen, sondern die Schallwelle neu erzeugen

    - Weshalb eine richtig betonte Stimme den Satz trotzdem nicht verstanden hat


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Straßennamen, die nie jemand eingesprochen hat

    (01:24) Der Voder von 1939

    (02:22) Erst ausschreiben, dann betonen

    (03:36) Ein Bild vom Ton statt Ton

    (05:29) Drei Sekunden genügen für eine Stimme

    (06:29) Warum blinde Nutzer die schnellere Stimme wollen

    (07:15) Betonung ist kein Verstehen

    (08:21) Nicht Spracherkennung rückwärts


    Begriffe aus dieser Folge:

    - Text-to-Speech: Ein Verfahren, das geschriebenen Text in ein hörbares Sprachsignal umwandelt.

    - Textnormalisierung: Der erste Schritt, der Zahlen, Abkürzungen und Symbole in ausgeschriebene Wörter überführt.

    - Prosodie: Die Satzmelodie aus Betonungen und Pausen — sie entscheidet, wie ein Satz ankommt, nicht wie die einzelnen Laute klingen.

    - Mel-Spektrogramm: Ein Bild vom Klang, das festhält, welche Frequenzen zu welchem Zeitpunkt wie stark vorkommen.

    - Vokoder: Das Netz, das aus diesem Bild die eigentliche Schallwelle zeichnet — mindestens 16.000 Werte pro Sekunde.


    Verwandte Episoden:

    - Folge 13 — Deepfake — Wie KI Gesichter und Stimmen so überzeugend fälscht, dass es echt wirkt.

    - Folge 16 — Spracherkennung — Wie aus gesprochener Sprache geschriebener Text wird.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    10 min
  • Generative KI – Erzeugen statt einordnen

    Ob Chatbot, Bildgenerator oder ein Assistent, der Fotos beschreiben und gleichzeitig sprechen kann — hinter all diesen Werkzeugen steckt dasselbe Grundprinzip, nur in unterschiedlichen Umsetzungen.


    Was du in dieser Folge lernst:

    - Was ein generatives Modell von einer einordnenden KI unterscheidet

    - Warum Sprachmodelle Wort für Wort arbeiten, Bild- und Videogeneratoren aber ein ganzes Bild aus Rauschen entrauschen

    - Wie Generative Adversarial Networks (GANs) seit 2014 als frühe Technik funktionierten

    - Was ein multimodales Modell wie GPT-4o von getrennten Einzelwerkzeugen unterscheidet

    - Warum generative KI keine Trainingsdaten speichert und älter ist als ChatGPT


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Ein Text und ein Bild, zwei Werkzeuge

    (01:09) Warum das gemeinsame Prinzip zählt

    (01:57) Erzeugen statt einordnen

    (02:54) Der Prompt lenkt, die Idee stammt von 2015

    (03:32) Von GAN zu Diffusion

    (04:28) Wenn beides in einem Modell steckt

    (05:57) Nicht erst seit ChatGPT

    (07:09) Ein Prinzip, mehrere Umsetzungen


    Begriffe aus dieser Folge:

    - Generatives Modell: Ein Modell, das lernt, wie seine Trainingsdaten insgesamt verteilt sind, und daraus neue, passende Beispiele erzeugt statt nur eine Eingabe einzuordnen.

    - Diffusionsmodell: Ein Verfahren, das aus reinem Zufallsrauschen schrittweise ein neues Bild oder eine Bilderfolge entrauscht.

    - GAN (Generative Adversarial Network): Eine frühe Technik, bei der ein Erzeuger-Netz und ein Prüf-Netz gegeneinander trainieren, bis der Erzeuger überzeugende Fälschungen liefert.

    - Prompt: Die Textbeschreibung, die vorgibt, was ein generatives Modell erzeugen soll, und die bei Bildgeneratoren in jeden Entrausch-Schritt einfließt.

    - Multimodales Modell: Ein einzelnes neuronales Netz, das mehrere Datenarten wie Text, Bild und Ton gemeinsam verarbeitet, statt mehrere Modelle hintereinanderzuschalten.


    Verwandte Episoden:

    - Folge 03 — Bildgenerierung mit KI — Wie aus einem Textsatz ein neues Bild entsteht — Schritt für Schritt aus Rauschen.

    - Folge 18 — Videogenerierung — Wie aus einem Text bewegte Szenen Bild für Bild entstehen.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    9 min
  • Videogenerierung – Eine Bilderfolge statt Einzelbilder

    Videos aus Werkzeugen wie Sora, Veo oder Runway sehen inzwischen aus wie mit einer echten Kamera gedreht — auf Social Media, in Werbung und in eigenen Kurzclips.


    Was du in dieser Folge lernst:

    - Wie ein Diffusionsmodell eine ganze Bilderfolge statt nur ein Einzelbild entrauscht

    - Was Raumzeit-Patches und zeitliche Konsistenz mit einem ruckelfreien KI-Video zu tun haben

    - Warum Videomodelle in einem komprimierten Latentraum statt direkt auf Bildpunkten rechnen

    - Wie Bild-zu-Video funktioniert und aus einem einzelnen Foto eine Bewegung wird

    - Warum KI-Videos oft an Physik scheitern, obwohl der Ton längst mitgeneriert wird


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Der Werbeclip, der wie gedreht aussah

    (01:20) Würfel aus Fläche und Zeit

    (02:10) Gerechnet wird im komprimierten Latentraum

    (03:06) Wie der Prompt das Video lenkt

    (04:06) Acht Sekunden, und dann geschnitten

    (04:55) Dieselbe Figur in mehreren Szenen

    (06:02) Kein Verständnis von Physik, nur Muster

    (07:11) Eine Bilderfolge, nicht viele Einzelbilder


    Begriffe aus dieser Folge:

    - Diffusionsmodell: Ein neuronales Netz, das Rauschen schrittweise in ein Bild oder eine ganze Bilderfolge zurückverwandelt.

    - Raumzeit-Patches: Kleine Videoausschnitte, die eine Bildfläche und gleichzeitig eine Zeitspanne abdecken.

    - Zeitliche Konsistenz: Der Abgleich benachbarter Bilder beim Entrauschen, damit Figuren und Objekte im Video nicht plötzlich ihre Form ändern.

    - Latentraum: Ein komprimierter Zwischenraum, in dem ein Videomodell rechnet, statt direkt auf einzelnen Bildpunkten.

    - Bild-zu-Video: Ein Verfahren, das aus einem einzelnen Startbild die passende Bewegung generiert.


    Verwandte Episoden:

    - Folge 03 — Bildgenerierung mit KI — Wie aus einem Textsatz ein neues Bild entsteht — Schritt für Schritt aus Rauschen.

    - Folge 13 — Deepfake — Wie KI Gesichter und Stimmen so überzeugend fälscht, dass es echt wirkt.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    9 min
  • Bilderkennung – Ein einziger Pixel kann das Netz kippen

    Ob Fotosuche am Handy, Gesichtsentsperrung oder die Kamera im Auto — Bilderkennung steckt heute in vielen Geräten des Alltags, ohne dass klar ist, wie sie ein Bild eigentlich „liest“.


    Was du in dieser Folge lernst:

    - Wie ein digitales Bild für einen Computer nur ein Raster aus Zahlen ist

    - Wie ein neuronales Netz in mehreren Stufen von Kanten bis zu ganzen Objekten erkennt

    - Warum Trainingsdaten wichtiger sind als eine hohe Bildauflösung

    - Wieso sich Bilderkennung durch winzige, kaum sichtbare Veränderungen täuschen lässt


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Die Fotosuche findet den Hund von allein

    (01:25) Aus Pixeln werden Zahlentabellen

    (02:26) Die Filter lernt das Netz selbst

    (03:28) Vierzehn Millionen beschriftete Bilder

    (04:45) Röntgenbild: markieren, nicht entscheiden

    (05:35) Mehr Pixel heißen nicht bessere Erkennung

    (06:27) Ein einziger Pixel kann das Netz kippen

    (07:05) Zahlenraster statt Verstehen


    Begriffe aus dieser Folge:

    - Pixel: Der kleinste Bildpunkt eines Digitalfotos, dargestellt durch Farbwerte für Rot, Grün und Blau.

    - Faltungsschicht: Die erste Verarbeitungsstufe eines Bilderkennungs-Netzes, in der ein kleiner Filter über das Bild wandert und nach Mustern wie Kanten sucht.

    - Merkmalskarte: Das Ergebnis einer Faltungsschicht, eine Art Landkarte, die zeigt, wo im Bild welches Muster gefunden wurde.

    - Pooling-Schicht: Eine Verarbeitungsstufe, die eine Merkmalskarte verkleinert und dabei nur die wichtigsten Stellen behält.

    - Trainingsdaten: Von Menschen beschriftete Beispielbilder, an denen ein Bilderkennungs-Netz lernt, welche Muster zu welcher Kategorie gehören.


    Verwandte Episoden:

    - Folge 05 — Neuronales Netz — Wie Schichten aus künstlichen Neuronen aus rohen Eingaben Muster erkennen.

    - Folge 14 — Selbstfahrendes Auto — Wie ein Auto seine Umgebung wahrnimmt, deutet und daraus Fahrentscheidungen ableitet.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    9 min
  • Spracherkennung – Sie rät mit und prüft, ob es Sinn ergibt

    Jedes Mal, wenn du eine Nachricht diktierst oder ein Sprachassistent dich versteht, arbeitet im Hintergrund ein Programm, das Laute errät statt sie abzulesen — und das nicht für jede Stimme gleich zuverlässig.


    Was du in dieser Folge lernst:

    - Wie ein Audiosignal Schritt für Schritt in geschriebenen Text verwandelt wird

    - Warum ein akustisches Modell und ein Sprachmodell zusammenarbeiten müssen, um mehrdeutige Laute aufzulösen

    - Was die Wort-Fehlerrate misst und wie nah moderne Systeme wie Whisper an menschliche Genauigkeit herankommen

    - Warum Spracherkennung nicht für jeden Akzent gleich gut funktioniert

    - Warum das reine Erkennen von Sprache und das Verstehen ihres Inhalts zwei getrennte Schritte sind


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Diktieren, und im Call laufen Untertitel mit

    (01:04) Sie rät — und prüft, ob es Sinn ergibt

    (02:06) Von zehn Ziffern 1952 zu neuronalen Netzen

    (03:11) „Meer“ und „mehr“ klingen gleich

    (04:28) Woher das Netz die Laute kennt

    (05:18) Live-Untertitel in Vorlesung und Meeting

    (06:09) Wenn mehrere durcheinanderreden

    (07:04) Warum Akzente schlechter erkannt werden


    Begriffe aus dieser Folge:

    - Spektrogramm: Ein Muster aus Frequenzen über die Zeit, in das ein Audiosignal zunächst verwandelt wird, damit ein Programm damit rechnen kann.

    - Akustisches Modell: Der Teil eines Spracherkennungssystems, der kurzen Abschnitten des Frequenzmusters wahrscheinliche Laute zuordnet.

    - Sprachmodell: Schätzt ab, welche Wortfolge in einer Sprache wahrscheinlich ist, und löst damit akustisch mehrdeutige Stellen auf.

    - Decoder: Die Komponente, die aus den Wahrscheinlichkeiten von akustischem Modell und Sprachmodell die insgesamt wahrscheinlichste Textausgabe sucht.

    - Wort-Fehlerrate (WER): Die Kennzahl, mit der gemessen wird, wie viele Wörter eine Spracherkennung falsch erkennt, auslässt oder zusätzlich einfügt.


    Verwandte Episoden:

    - Folge 12 — Transformer — Die Architektur hinter modernen Sprachmodellen und was Self-Attention bedeutet.

    - Folge 20 — Text-to-Speech — Wie aus einem Text eine natürlich klingende Stimme wird.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    9 min
  • KI-Halluzination – Im Training lohnt sich das Raten

    Wer eine KI nach einer Quelle, einer Zahl oder einem Zitat fragt, bekommt manchmal eine überzeugend klingende Antwort, die schlicht erfunden ist — vom harmlosen Referat bis zum Gerichtsschriftsatz.


    Was du in dieser Folge lernst:

    - Warum ein Sprachmodell beim Antworten nicht zwischen sicherem Wissen und reinem Raten unterscheidet

    - Wie Trainings- und Bewertungsverfahren dazu führen, dass Raten belohnt wird statt ein ehrliches „weiß ich nicht“

    - Was ein RAG-System ist und warum es Halluzinationen nur verringert, nicht beseitigt

    - Welche zwei teuren Praxisfälle zeigen, wie ernst das Problem werden kann

    - Woran man selbst erkennen kann, dass eine KI-Antwort möglicherweise erfunden ist


    Wenn du der Reihe folgst, ist die nächste Folge automatisch da.


    Kapitel:

    (00:00) Die Quelle, die es nie gab

    (01:05) Woher der Name Halluzination kommt

    (02:00) Warum ein erfundener Satz echt klingt

    (03:07) Im Training lohnt sich das Raten

    (04:06) Auch RAG löst es nicht vollständig

    (04:47) Der Anwalt, dem ChatGPT Urteile erfand

    (06:04) Häufiger, als man vermuten würde

    (07:00) Warum Sicherheit im Ton nichts beweist


    Begriffe aus dieser Folge:

    - KI-Halluzination: Eine Antwort eines Sprachmodells, die flüssig und selbstsicher klingt, inhaltlich aber falsch oder frei erfunden ist.

    - Kontextfenster: Die Menge an Text, die ein Sprachmodell in einer Anfrage gleichzeitig lesen und berücksichtigen kann.

    - RAG-System: Ergänzt ein Sprachmodell mit einer Suche in externem Wissen, sodass es beim Antworten auf geprüfte Quellen zugreifen kann.

    - Trainingsdaten: Die Textmenge, aus der ein Sprachmodell lernt — Lücken darin erhöhen die Wahrscheinlichkeit erfundener Antworten.


    Verwandte Episoden:

    - Folge 06 — Sprachmodell — Wie ein Modell auf riesigen Textmengen trainiert wird und jeweils das nächste Wort vorhersagt.

    - Folge 10 — RAG-System — Wie ein Sprachmodell mit externem Wissen (z. B. aus einer Datenbank) antwortet.


    Über den Podcast

    „Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.


    Transparenzhinweis

    Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.


    Feedback und Themenwünsche

    Schreib uns an [email protected]

    Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast

    Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.

    9 min

About Wie funktioniert eigentlich KI?

From the publisher's feed

„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt.