Le centre de gravité

Interprétabilité de l'IA : la garantie invérifiable


Listen Later

Un lapin bondit devant un linguiste en terre inconnue. Un indigène pointe du doigt et dit un seul mot : gavagai. Personne ne pourra jamais prouver s'il a voulu dire lapin, morceau de lapin, ou simplement bondissant. Ce piège posé par le philosophe Quine en 1960 vient d'atterrir sur l'IA : le 25 juin 2026, deux philosophes posent la même question sur les grands modèles de langage. Peut-on un jour prouver ce qu'une IA croit, ou seulement le deviner mieux ?

Les laboratoires vendent leurs outils d'interprétabilité comme un pilier de sécurité devant régulateurs et entreprises clientes. Mais personne dans cette chaîne n'a vraiment intérêt à vérifier si l'outil prouve quoi que ce soit. On suit le fil de Quine à Davidson, de Golden Gate Claude au critère de réfutabilité de Popper, jusqu'à la question qui compte pour un décideur : qui porte le risque quand la garantie s'avère invérifiable.

Sources : arXiv (Herrmann & Levinstein ; Chalmers), Anthropic (« Scaling Monosemanticity » ; « Sleeper Agents »).

#philosophie

...more
View all episodesView all episodes
Download on the App Store

Le centre de gravitéBy Franck Dubray - Dragonfly