Folge 100 bündelt, was Entscheider*innen über Data Science wissen sollten – aufgeteilt in vier Blöcke: Begriffsklärung, Datenqualität, Modellgüte und Erfolgsfaktoren. Mira und Amit ordnen ein, wie KI, Machine Learning und Statistik zusammenhängen, was supervised von unsupervised Learning unterscheidet und welche der vier Stufen der Datenanalyse für welche Fragestellung überhaupt nötig ist. Beim Thema Daten geht es um Validierung vor der eigentlichen Analyse, fehlende Zielvariablen und typische Formatprobleme, bei der Modellgüte um passende Gütemaße, Benchmarks, Overfitting, Explainability und die Evaluation von GenAI. Der letzte Teil behandelt die Frage, warum Datenprojekte in der Schublade landen: Auswahl des Use Cases, der Aufwandssprung von PoC zu MVP und Produkt sowie der eigene Data-Maturity-Level. Zum Abschluss stehen die fünf häufigsten Fehler.
Begriffe sortieren: KI ist als Überbegriff meist unscharf gemeint, zwischen Statistik und ML gibt es einen fließenden Übergang – entscheidend ist, ob Zusammenhänge verstanden oder Prognosen erstellt werden sollen.Vier Stufen der Datenanalyse: deskriptiv, diagnostisch, prädiktiv, präskriptiv – oft liefert schon die erste Stufe den Großteil der Erkenntnisse, Stufen lassen sich schlecht überspringen.Datenqualität vor Datenquantität: viele korrekte, aber irrelevante Spalten verbessern keine Prognose; fehlerhafte Daten sind das größere Problem – gilt für tabulare Daten wie für RAG-Dokumente.Validierung zuerst: explorative Analysen, Verteilungen und Ausreißerprüfung deckt Datenprobleme auf und erzeugt selbst schon Erkenntnisse.Das Gütemaß hängt vom Use Case ab: Kosten von False Positives und False Negatives unterscheiden sich, ein einfaches Benchmark-Modell zeigt, ob der Aufwand sich lohnt.Overfitting vermeiden: immer out-of-sample auf einem Testdatensatz evaluieren und zeitliche Struktur berücksichtigen – sonst sind Prognosen ungenauer als erwartet und man sieht Zusammenhänge, die es nicht gibt.GenAI-Evaluation ist der Engpass: ein PoC entsteht schnell, das MVP wird durch Bewertungsfragen (LLM as a Judge, User Testing) deutlich aufwändiger.Erfolgsfaktoren: konkreter Use Case mit messbarem Hebel, frühe Einbindung der Nutzer*innen, Implementierung von Anfang an mitdenken und Projekte zum eigenen Reifegrad wählen.Blogartikel zu Erfolgsfaktoren für Data-Science-Projekte https://www.inwt-statistics.de/blog/erfolgsfaktoren-fuer-data-science-projekteFolge #6: Statistik vs. Machine Learning https://www.podbean.com/ew/pb-ewip2-128c6f8Folge #83: Wie gut ist gut genug? Modellgütemaße richtig verstehen https://www.podbean.com/eas/pb-8q2a8-19a0252Folge #89: ROC around the clock – Alles rund um Gütemaße für Klassifikationsmodelle https://www.podbean.com/eas/pb-6jfj7-1a6a8baFolge #43: Damit es im Live-Betrieb nicht kracht: Vermeidung von Overfitting & Data Leakage https://www.podbean.com/ew/pb-vw736-15baac0Folge #86: "Garbage In, Garbage Out" verhindern: Datenvalidierung richtig gemacht https://www.podbean.com/eas/pb-5kyzq-1a305edFolge #2: Erfolgsfaktoren für Predictive Analytics Projekte https://www.podbean.com/ew/pb-kdcmd-12460abFolge #78: Der Use-Case-Guide: Navigationshilfe für echten Mehrwert https://www.podbean.com/ew/pb-s5e2r-1928b4fFolge #21: Machine Learning Operations (MLOps) https://www.podbean.com/ew/pb-taen7-13ce0faFolge #23: Unsexy aber wichtig: Tests und Monitoring https://www.podbean.com/ew/pb-vxp58-13f311aFolge #24: Explainable AI: Entscheidungen von Black-Box-Modellen verstehen https://www.podbean.com/ew/pb-kn67b-1403089Folge #47: Von Prognosen und Prompts: Data Science trifft generative KI mit Tobias Sterbak https://www.podbean.com/ew/pb-dkyex-1613842Folge #70: Der Aufstieg zur Datenreife – Stufe für Stufe zur Data Maturity https://www.podbean.com/ew/pb-a7663-1882b25Folge #32: Brauche ich Data-Science-Berater*innen und wenn ja wie viele? https://www.podbean.com/ew/pb-eaekc-14a6bbeFolge #69: AI Agents verstehen und evaluieren mit Matthäus Deutsch https://www.podbean.com/ew/pb-cq7xp-186d96dFolge #80: Willkommen an Bord: Wie wir neue Kolleg*innen begleiten https://www.podbean.com/ew/pb-232sr-1953fe6Folge #51: Wer rastet, rostet: Die Rolle von Weiterbildung in Data Science https://www.podbean.com/ew/pb-czpd3-16716c0Folge #97: Die Güte von Gen-AI-Projekten bewerten mit Tobias Sterbak https://www.podbean.com/eas/pb-7fhem-1b0096c📬 Fragen, Feedback oder Themenwünsche?
Schreibt uns gern an: [email protected]