
Sign up to save your podcasts
Or


Autobahn-Stauassistenten und fahrerlose Taxis sind längst keine Zukunftsmusik mehr, sondern heute schon unterwegs — und mit ihnen die Frage, wie viel davon der Mensch am Ende noch selbst im Blick behalten muss.
Was du in dieser Folge lernst:
- Wie Kamera, Radar und Lidar zu einem einzigen Umgebungsbild verschmelzen (Sensorfusion)
- Warum ein neuronales Netz und eine hochgenaue digitale Karte zusätzlich zur Sensorik nötig sind
- Was die sechs Automatisierungsstufen (SAE-Level 0 bis 5) für Verantwortung und Haftung bedeuten
- Warum Teslas „Autopilot“ trotz des Namens nur Stufe zwei ist
- Was aktuelle Sicherheitsdaten von Robotaxi-Anbietern tatsächlich zeigen
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Robotaxis, in die man einfach einsteigt
(00:55) Kamera, Radar und Lidar
(02:09) Sensorfusion, und Tesla setzt nur auf Kameras
(03:26) Die Karte und die Bahnplanung
(04:06) Fünf Stufen, und wer im Zweifel haftet
(05:15) 95 km/h, Hände vom Lenkrad, Blick frei
(06:00) Autopilot heißt nicht fahrerlos
(06:54) Zugelassen heißt nicht fehlerfrei
Begriffe aus dieser Folge:
- Neuronales Netz: Ein Programm aus vielen einfachen Recheneinheiten in Schichten, das aus Beispielen lernt, Muster zu erkennen.
- Sensorfusion: Die Zusammenführung der Signale mehrerer Sensoren zu einem einzigen, verlässlichen Umgebungsbild.
- Lidar: Ein Sensor, der die Umgebung mit Laserpulsen abtastet und aus der Laufzeit bis zur Reflexion ein genaues räumliches Abbild berechnet.
- Automatisierungsstufe (SAE-Level): Die genormte Skala von Stufe null bis fünf, die festlegt, wie viel Verantwortung beim Fahrsystem und wie viel beim Menschen liegt.
Verwandte Episoden:
- Folge 09 — KI-Agent — Was einen Agenten ausmacht: Ziel, Werkzeuge, Handlungsspielraum.
- Folge 17 — Bilderkennung — Wie KI in Bildern Objekte, Gesichter oder Schäden findet.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Ein gefälschtes Video oder ein Betrugsanruf mit geklonter Stimme wirkt oft täuschend echt — und trifft längst nicht nur Prominente, sondern auch Unternehmen und ihre Mitarbeitenden.
Was du in dieser Folge lernst:
- Wie ein Deepfake aus vielen echten Aufnahmen lernt, ein Gesicht oder eine Stimme nachzubilden
- Was ein Generative Adversarial Network (GAN) ist und wie Generator und Diskriminator sich gegenseitig verbessern
- Wie ein Autoencoder beim Gesichtertausch Merkmale zerlegt und neu kombiniert
- Warum schon wenige Sekunden Audiomaterial für Voice Cloning ausreichen können
- Warum gute Deepfakes heute oft nicht mehr mit bloßem Auge erkennbar sind
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Ein Video, an dem nichts falsch aussieht
(00:51) Kein Bild kopiert, sondern ein Stil gelernt
(01:44) Zwei Netze, die sich gegenseitig hochtreiben
(02:43) Der Gesichtertausch mit dem Autoencoder
(03:21) Wenige Sekunden genügen für eine Stimme
(03:52) Der Anruf mit der Stimme der Chefin
(05:57) Kein Studio mehr nötig
(06:58) Aus echtem Material lernen, auf Neues übertragen
Begriffe aus dieser Folge:
- Deepfake: Mit KI erzeugtes oder verändertes Bild-, Ton- oder Videomaterial, das eine Person Dinge sagen oder tun lässt, die so nie stattgefunden haben.
- Generative Adversarial Network (GAN): Ein Trainingsaufbau aus zwei gegeneinander arbeitenden neuronalen Netzen — einem Generator, der Fälschungen erzeugt, und einem Diskriminator, der sie von echtem Material unterscheiden soll.
- Autoencoder: Ein neuronales Netz, das ein Gesicht in seine wesentlichen Merkmale zerlegt und daraus wieder ein Bild rekonstruiert, kombiniert mit den Merkmalen einer anderen Person.
- Voice Cloning: Das Nachbilden einer bestimmten Stimme aus Audio-Trainingsmaterial, sodass damit beliebiger neuer Text in dieser Stimme gesprochen werden kann.
Verwandte Episoden:
- Folge 18 — Videogenerierung — Wie aus einem Text bewegte Szenen Bild für Bild entstehen.
- Folge 20 — Text-to-Speech — Wie aus einem Text eine natürlich klingende Stimme wird.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Chatbots, Übersetzer, Bildgeneratoren — auffällig viele KI-Werkzeuge wurden etwa zur gleichen Zeit besser. Der Grund ist eine gemeinsame Bauart aus dem Jahr 2017: der Transformer.
Was du in dieser Folge lernst:
- Warum ein Transformer alle Wörter eines Abschnitts gleichzeitig betrachtet statt eines nach dem anderen
- Was Self-Attention ist und wie ein Wort seine Bedeutung aus seinen Nachbarn bekommt
- Warum eine Positionscodierung nötig ist, damit „Hund beißt Mann“ nicht wie „Mann beißt Hund“ wirkt
- Worin der Unterschied liegt zwischen einer Bauart wie dem Transformer und einem konkreten Modell wie ChatGPT
- Warum dieselbe Bauart heute auch in Bildgeneratoren und Spracherkennung steckt
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Liest das Modell wirklich von links nach rechts?
(01:31) Self-Attention: was zu wem gehört
(02:38) Abfrage, Schlüssel und Wert
(03:25) Mehrere Suchen gleichzeitig
(04:18) Warum das auch schneller lernt
(05:11) Warum Bezüge über zehn Sätze halten
(06:11) Vom ersten Transformer bis heute
(06:55) Aufmerksamkeit ist eine nüchterne Rechnung
Begriffe aus dieser Folge:
- Transformer: Die Architektur hinter modernen Sprachmodellen; sie verarbeitet alle Wörter eines Abschnitts gleichzeitig und entscheidet, welche zusammengehören.
- Self-Attention: Der Rechenschritt, bei dem jedes Wort gewichtet, wie stark jedes andere Wort dazugehört, und die wichtigen in seine Bedeutung einmischt.
- Token: Die kleinste Texteinheit, mit der ein Sprachmodell rechnet — meist ein kurzes Wortstück.
- Multi-Head-Attention: Mehrere parallele Aufmerksamkeits-Durchgänge, von denen jeder auf eine andere Art von Beziehung zwischen den Wörtern achtet.
- Positionscodierung: Eine Positionsmarke pro Wort, die dem Modell die Reihenfolge mitgibt, weil die Aufmerksamkeit sie von sich aus ignoriert.
Verwandte Episoden:
- Folge 05 — Neuronales Netz — Wie Schichten aus künstlichen Neuronen aus rohen Eingaben Muster erkennen.
- Folge 06 — Sprachmodell — Wie ein Modell auf riesigen Textmengen trainiert wird und jeweils das nächste Wort vorhersagt.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Startseiten, Shops und Feeds zeigen dir längst nicht alles, sondern eine kleine, auf dich zugeschnittene Auswahl. Dahinter steckt fast immer ein Empfehlungsalgorithmus, der aus deinem Verhalten schließt, was dir als Nächstes gefällt.
Was du in dieser Folge lernst:
- Wie ein Empfehlungsalgorithmus aus deinem bisherigen Verhalten eine Vorhersage macht
- Was explizites von implizitem Feedback unterscheidet — und warum Klicks oft mehr zählen als Sternebewertungen
- Wie kollaboratives und inhaltsbasiertes Filtern zusammenspielen
- Was das Cold-Start-Problem ist und wie der zweite Weg dabei aushilft
- Warum ein Spitzenplatz in der Liste Passung zu dir bedeutet, nicht objektive Qualität
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Warum ganz oben steht, was dort steht
(01:05) Klicks verraten mehr als Sterne
(02:10) Zwei Wege: Nachbarn oder Inhalt
(03:17) Und wenn ein Film ganz neu ist?
(04:28) Der Kurzvideo-Feed lernt am schnellsten
(05:26) Das Mikrofon hört nicht mit
(05:57) Die Reihenfolge sagt nichts über Qualität
(06:29) Ohne die anderen Nutzer ginge es nicht
Begriffe aus dieser Folge:
- Empfehlungsalgorithmus: Ein Verfahren, das aus dem bisherigen Verhalten einer Person vorhersagt, welche Inhalte ihr als Nächstes gefallen, und sie danach sortiert.
- explizites und implizites Feedback: Explizit ist eine ausdrücklich vergebene Bewertung, implizit das stille Verhalten wie Klicks oder Ansehdauer.
- kollaboratives Filtern: Eine Methode, die Personen mit ähnlichem Verhalten vergleicht und empfiehlt, was die einen mochten, den anderen.
- inhaltsbasiertes Filtern: Eine Methode, die die Merkmale der Inhalte selbst vergleicht und Ähnliches zu bereits Gemochtem vorschlägt.
- Cold-Start-Problem: Die Schwierigkeit, für neue Nutzer oder neue Inhalte ohne Verhaltensdaten gute Empfehlungen zu erzeugen.
Verwandte Episoden:
- Folge 04 — Machine Learning — Wie Maschinen aus Beispielen lernen, statt explizit programmiert zu werden.
- Folge 21 — Spam-Filter — Wie ein Postfach lernt, Werbung von echter Post zu unterscheiden.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Immer mehr Assistenten antworten nicht mehr aus dem Gedächtnis, sondern schlagen vorher in echten Dokumenten nach — und nennen die Quelle gleich dazu. Genau dieses Nachschlagen steckt hinter dem Kürzel RAG.
Was du in dieser Folge lernst:
- Was „Retrieval-Augmented Generation“ bedeutet — erst suchen, dann antworten
- Wie aus Dokumenten Chunks, Embeddings und eine Vektordatenbank werden
- Warum die semantische Suche nach Bedeutung statt nach Stichwort sucht
- Wieso das Modell dabei nicht nachtrainiert wird und trotzdem auf neues Wissen zugreift
- Woran eine RAG-Antwort scheitert, wenn die Suche den falschen Abschnitt holt
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Die Antwort mit dem Link ins Handbuch
(01:00) Erst suchen, dann antworten
(02:01) Was passiert, bevor du überhaupt fragst
(02:51) Suchen nach Bedeutung, nicht nach Wort
(04:01) Nur drei, vier Abschnitte gehen ans Modell
(04:39) Wie viele Urlaubstage im ersten Jahr?
(05:30) Das Modell lernt dabei nichts dazu
(06:32) Keine Stichwortsuche mit Chatbot davor
Begriffe aus dieser Folge:
- RAG-System: Ein RAG-System ergänzt ein Sprachmodell mit einer Suche in externem Wissen, sodass das Modell beim Antworten auf aktuelle oder spezifische Quellen zugreifen kann.
- Embedding: Eine Zahlenfolge, die einen Text, ein Bild oder einen Ton so darstellt, dass ähnliche Inhalte nah beieinanderliegen.
- Chunk: Ein kurzer Textabschnitt, in den ein Dokument vorab zerteilt wird, damit später gezielt die passende Stelle gefunden werden kann.
- Vektordatenbank: Ein Speicher, der Texte als Zahlenfolgen hält und zu einer Frage die inhaltlich nächstgelegenen Abschnitte findet — nicht nach Stichwort, sondern nach Nähe.
- semantische Suche: Eine Suche, die nach Bedeutung statt nach genauer Wortübereinstimmung arbeitet und so auch passende Stellen ohne gemeinsame Wörter findet.
Verwandte Episoden:
- Folge 09 — KI-Agent — Was einen Agenten ausmacht: Ziel, Werkzeuge, Handlungsspielraum.
- Folge 15 — KI-Halluzination — Warum ein Sprachmodell überzeugend klingt und trotzdem Dinge erfindet.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Aus dem reinen Antwort-Geben wird in vielen Anwendungen ein Erledigen über mehrere Schritte hinweg — Software, die Werkzeuge aufruft, Ergebnisse liest und selbst entscheidet, was als Nächstes dran ist.
Was du in dieser Folge lernst:
- Was einen KI-Agenten von einem reinen Chatbot unterscheidet — und warum nicht die Antwortlänge, sondern das Handeln zwischen den Antworten zählt
- Aus welchen Teilen ein Agent besteht: Ziel, Sprachmodell, Werkzeuge mit kurzer Beschreibung — und welche Rolle die Agenten-Schleife spielt
- Was eine Abbruchbedingung ist und warum produktive Agenten eine maximale Schrittzahl pro Aufgabe haben
- Warum mehr Werkzeuge nicht automatisch einen besseren Agenten ergeben
- Wo ein Agent selbst handelt — und wo in der Praxis eine ausdrückliche Rückfrage davor steht
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Die Anwendung suchte weiter, ohne neue Frage
(01:29) Chatbot antwortet einmal, der Agent handelt mehrfach
(02:06) Werkzeuge und ihre Beschreibungen
(03:03) Überlegen, Handeln, Beobachten
(03:50) Der Test ist rot — und er repariert ihn selbst
(05:01) Auswahl in fest gesetzten Grenzen
(05:53) Mehr Werkzeuge machen ihn nicht besser
(06:37) Der Spielraum kommt aus den Werkzeugen
Begriffe aus dieser Folge:
- KI-Agent: Ein Programm, das mit einem Sprachmodell ein Ziel verfolgt, dafür Werkzeuge benutzt und seine nächsten Schritte selbst entscheidet.
- Werkzeug: Ein Programm oder eine Schnittstelle, die der Agent aufrufen darf — etwa eine Websuche, ein Kalender, eine Datenbank oder ein Skript, das Code ausführt.
- Agenten-Schleife: Der wiederholte Ablauf aus drei Teilen: das Modell überlegt, ruft ein Werkzeug auf und nimmt das Ergebnis als Beobachtung entgegen.
- Abbruchbedingung: Eine Vorgabe, wann der Agent aufhört — typischerweise eine maximale Schrittzahl pro Aufgabe.
Verwandte Episoden:
- Folge 08 — Prompting — Wie die Formulierung der Eingabe das Ergebnis prägt — und welche Strukturen zuverlässig wirken.
- Folge 10 — RAG-System — Wie ein Sprachmodell mit externem Wissen (z. B. aus einer Datenbank) antwortet.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Jede Frage an einen Chatbot ist ein Prompt — und die Antwort hängt fast immer mehr an der Formulierung als am gewählten Modell.
Was du in dieser Folge lernst:
- Was ein Prompt ist und warum ein Sprachmodell ihn nicht ausführt, sondern Wort für Wort statistisch fortsetzt
- Welche drei Stellschrauben — Anweisung, Kontext, Format — jede gute Eingabe ausmachen
- Was System-Prompt, Few-Shot-Prompting und Chain-of-Thought sind und wann sie helfen
- Warum längere Prompts nicht automatisch bessere Antworten liefern
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Einmal kurz getippt, einmal ausführlich
(01:01) Alles andere ist für die Maschine nicht da
(01:42) Der System-Prompt, den du nie siehst
(02:26) Anweisung, Kontext, Format
(03:32) Beispiele mitgeben und laut denken lassen
(04:37) Von der Mail-Zusammenfassung zur Fehlersuche
(05:28) Warum die Fehlermeldung allein nicht reicht
(06:05) Es gibt keinen Zauber-Prompt
Begriffe aus dieser Folge:
- Prompt: Die gesamte Texteingabe, die ein Sprachmodell vor seiner Antwort verarbeitet — Nutzertext plus den System-Prompt der Anwendung.
- System-Prompt: Ein Stück Text, das der Entwickler einer Anwendung vor jeder Nutzerfrage automatisch einfügt und in dem Rolle, Stil und Grenzen des Modells festgelegt werden.
- Few-Shot-Prompting: Das Mitgeben einiger Beispielpaare aus Eingabe und gewünschter Ausgabe direkt im Prompt, damit das Modell das Format für die eigentliche Anfrage übernimmt.
- Chain-of-Thought: Die Aufforderung an das Modell, vor der eigentlichen Antwort die Überlegungsschritte zu nennen — was die Genauigkeit bei mehrschrittigen Aufgaben verbessert.
Verwandte Episoden:
- Folge 06 — Sprachmodell — Wie ein Modell auf riesigen Textmengen trainiert wird und jeweils das nächste Wort vorhersagt.
- Folge 15 — KI-Halluzination — Warum ein Sprachmodell überzeugend klingt und trotzdem Dinge erfindet.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Wenn ein Chatbot dir sagt, dein Dokument sei zu lang, oder eine API-Rechnung höher ausfällt als gedacht, dann ist meist dieselbe Größe schuld: die Token-Zahl. Token sind die Einheit, in der die KI-Welt rund um Sprache zählt — und sie sind weder Wörter noch Zeichen.
Was du in dieser Folge lernst:
- Was ein Token ist und warum es meist kein ganzes Wort, sondern ein kürzeres Wortstück darstellt
- Wie ein Tokenizer einen Text vor jeder Verarbeitung in eine Folge von Zahlen zerlegt
- Warum derselbe Inhalt auf Deutsch fast immer mehr Token braucht als auf Englisch
- Was das Kontextfenster ist und warum es die maximale Menge an Token pro Anfrage festlegt
- Warum jedes Modell seinen eigenen Tokenizer hat und Token-Zahlen zwischen Anbietern nicht vergleichbar sind
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Warum eine Anfrage überhaupt etwas kostet
(01:09) Fünfzigtausend Schubladen an der Wand
(02:13) Warum Deutsch mehr Token braucht als Englisch
(03:08) Das Modell sieht Nummern, keine Sprache
(04:01) Bezahlt wird pro Million Token
(04:34) Ein 300-Seiten-PDF im Kontextfenster
(06:11) Jedes Modell zerlegt anders
(06:44) Kleinste Einheit, feste Nummer, gezählte Kosten
Begriffe aus dieser Folge:
- Token: Die kleinste Texteinheit, mit der ein Sprachmodell rechnet — meist ein kurzes Wortstück.
- Tokenizer: Das Programm, das einen Eingabetext deterministisch in eine Folge von Token zerlegt, bevor das Modell ihn verarbeitet.
- Vokabular: Die feste Liste aller Token, die ein bestimmtes Modell kennt — typischerweise einige zehntausend bis über hunderttausend Einträge.
- Kontextfenster: Die maximale Menge an Token, die ein Sprachmodell in einer Anfrage gleichzeitig lesen und berücksichtigen kann.
- Eingabe- und Ausgabe-Token: Die zwei Zählgrößen, nach denen kommerzielle Sprachmodell-Anbieter abrechnen — alles, was hineingeht, und alles, was das Modell erzeugt, wird getrennt gezählt.
Verwandte Episoden:
- Folge 06 — Sprachmodell — Wie ein Modell auf riesigen Textmengen trainiert wird und jeweils das nächste Wort vorhersagt.
- Folge 08 — Prompting — Wie die Formulierung der Eingabe das Ergebnis prägt — und welche Strukturen zuverlässig wirken.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Chatbots, Übersetzer-Apps und Schreibvorschläge laufen heute alle über Sprachmodelle. Wenn du verstanden hast, wie sie im Inneren Wort für Wort rechnen, kannst du besser einschätzen, warum sie flüssig formulieren — und warum sie manchmal Fakten erfinden.
Was du in dieser Folge lernst:
- Warum ein Sprachmodell seine Antworten Token für Token aus einer Wahrscheinlichkeitsliste zusammensetzt
- Was Token sind und warum sie nicht immer ganze Wörter sind
- Wie das Modell im Training seine Stellschrauben anpasst und was die Feinabstimmung danach noch verändert
- Was die Temperatur einstellt und warum dieselbe Frage unterschiedliche Antworten erzeugen kann
- Warum ein Sprachmodell sinnvolle Antworten geben kann, ohne den Inhalt zu „verstehen“
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Was zwischen Frage und Antwort passiert
(01:10) Stück für Stück bis zum Schluss-Zeichen
(01:59) Gelernt durch Vorhersagen im Training
(02:49) Vom rohen Modell zum hilfreichen Chatbot
(03:42) Die Temperatur: wie viel Zufall erlaubt ist
(04:37) Übersetzer, Mail-Vorschlag, Suchvorschlag
(05:35) Kein Verstehen, kein Nachschlagen
(06:36) Das Sprachmodell rät immer nur weiter
Begriffe aus dieser Folge:
- Sprachmodell: Ein Programm, das aus einem Stück Text vorhersagt, welches Wortstück mit welcher Wahrscheinlichkeit als nächstes folgt.
- Token: Die kleinste Texteinheit, mit der ein Sprachmodell rechnet — meist ein kurzes Wortstück.
- Large Language Model (LLM): Ein Sprachmodell, das auf sehr großen Textmengen trainiert wurde und dadurch Sprache fortsetzen, übersetzen und beantworten kann.
- Feinabstimmung: Das gezielte Nachtrainieren eines fertigen Sprachmodells auf zusätzlichen Beispielen, damit es sich wie ein hilfreicher Assistent verhält.
- Temperatur: Eine Stellschraube beim Antworten, die festlegt, wie strikt das Modell das wahrscheinlichste Token nimmt oder auch unwahrscheinlichere zulässt.
Verwandte Episoden:
- Folge 07 — Token — Die kleinen Bausteine, in die Sprachmodelle Text zerlegen — und warum sie auch die Kosten bestimmen.
- Folge 12 — Transformer — Die Architektur hinter modernen Sprachmodellen und was Self-Attention bedeutet.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
Hinter Bilderkennung, Spracheingabe und Übersetzern steckt meist ein neuronales Netz: viele simple Recheneinheiten in Schichten. Mit einem Gehirn hat es dabei weniger zu tun, als der Name verspricht.
Was du in dieser Folge lernst:
- Wie ein neuronales Netz aus vielen Rechenstationen in Schichten aufgebaut ist und warum erst das Zusammenspiel mehrerer Schichten aus einem Foto eine Antwort macht
- Was im Inneren einer einzelnen Recheneinheit passiert: Eingaben mit Gewichten multiplizieren, summieren, durch eine Schwelle schicken
- Wie die Gewichte im Training rückwärts durch das Netz angepasst werden — das Verfahren heißt Backpropagation
- Was ein tiefes Netz ist und warum mehr Schichten und mehr Gewichte nicht automatisch besser sind
- Warum die Anleihe an die Biologie hauptsächlich namensgebend ist und ein neuronales Netz mit einem echten Gehirn wenig zu tun hat
Wenn du der Reihe folgst, ist die nächste Folge automatisch da.
Kapitel:
(00:00) Wie das Handy die Katze im Foto findet
(01:10) Jede Station für sich rechnet sehr einfach
(02:00) Was in einer einzelnen Station passiert
(02:51) Zufällige Gewichte, rückwärts korrigiert
(03:54) Schichten und Parameter: wie man ein Netz misst
(04:37) Diktieren, Fotos, Übersetzer — überall dasselbe
(05:17) Ein neuronales Netz ist kein Gehirn
(06:29) Von unten nach oben, und der Fehler zurück
Begriffe aus dieser Folge:
- Neuronales Netz: Programm aus vielen einfachen Recheneinheiten in Schichten, das aus Beispielen lernt, Muster zu erkennen.
- Schicht: Reihe von Recheneinheiten, die parallel arbeiten und ihre Ergebnisse an die nächste Reihe weitergeben; übliche Bauart: Eingabeschicht, eine oder mehrere verborgene Schichten, Ausgabeschicht.
- Gewicht: Zahl, die festlegt, wie wichtig eine bestimmte Eingabe für eine Recheneinheit ist; im Training werden diese Zahlen Schritt für Schritt angepasst.
- Backpropagation: Lernverfahren, bei dem der Fehler des Netzes rückwärts durch die Schichten geschickt wird und die Gewichte an jeder Station ein winziges Stück in die fehlerverringernde Richtung verschoben werden.
- Tiefes Netz: Neuronales Netz mit vielen verborgenen Schichten; das zugehörige Lernverfahren wird Deep Learning genannt.
Verwandte Episoden:
- Folge 04 — Machine Learning — Wie Maschinen aus Beispielen lernen, statt explizit programmiert zu werden.
- Folge 17 — Bilderkennung — Wie KI in Bildern Objekte, Gesichter oder Schäden findet.
Über den Podcast
„Wie funktioniert eigentlich KI?“ ist ein Podcast, der komplexe Themen rund um künstliche Intelligenz einfach erklärt — von Chatbots über Bildgeneratoren bis zu Sprachmodellen. In jeder Folge nehmen wir ein KI-Thema auseinander: verständlich, kompakt und ohne unnötigen Fachjargon. So einfach erklärt, dass du es danach selbst weitergeben kannst.
Transparenzhinweis
Dieser Podcast wird mit Unterstützung von künstlicher Intelligenz produziert. Die inhaltliche Verantwortung liegt beim Herausgeber.
Feedback und Themenwünsche
Schreib uns an [email protected]
Alle Folgen auch auf YouTube: youtube.com/@wie-funktioniert-podcast
Wenn dir die Folge weiterhilft: bewerten und teilen — das hilft anderen, den Podcast zu finden.
From the publisher's feed