Comprendre l'intérieur des IA : l'interprétabilité au microscope
Un grand modèle de langage répond, mais personne ne sait vraiment comment. Des chercheurs tentent d'ouvrir la boîte noire, neurone par neurone et circuit par circuit. Premiers résultats, vraies limites.
Un réseau de neurones est entièrement transparent, en un sens : on connaît chacun de ses milliards de paramètres, on peut lire l'activité de chaque neurone à chaque instant. Et pourtant, on ignore le plus souvent pourquoi il a donné telle réponse plutôt que telle autre. Personne n'a écrit ses règles : elles ont émergé de l'entraînement, enfouies dans des tableaux de nombres. L'interprétabilité est la branche de la recherche qui tente de traduire ces nombres en mécanismes compréhensibles par un humain. Ses promoteurs aiment la comparer aux débuts de la microscopie, quand Robert Hooke découvrait au XVIIe siècle un monde jusque-là invisible.
Des neurones qui font plusieurs métiers
Le premier réflexe est de regarder les neurones un par un, et de chercher ce qui les fait réagir. Dans les réseaux de reconnaissance d'images, cela marche parfois très bien. En 2020, Chris Olah et ses collègues décrivent, dans le réseau InceptionV1, des détecteurs de courbes qui répondent à des arcs d'une certaine taille, déclinés dans toutes les orientations. Ils montrent aussi comment ces briques s'assemblent : un détecteur de voitures se construit en cherchant des fenêtres en haut et des roues en bas de la zone observée. Ces assemblages, des circuits, se lisent directement dans les poids du réseau.
Mais beaucoup de neurones résistent à l'analyse. L'un d'eux, dans le même réseau, réagit à la fois aux têtes de chat, aux calandres de voitures et aux pattes de chat, sans qu'aucun point commun ne relie ces trois objets. On parle de neurones polysémantiques. Le phénomène est fréquent, notamment dans les modèles de langage, et complique beaucoup l'inspection neurone par neurone.
La superposition, ou l'art de ranger plus que la place disponible
En 2022, une équipe menée par Nelson Elhage propose une explication à l'aide de petits modèles jouets. Un réseau doit représenter bien plus de notions, ou caractéristiques, qu'il ne possède de neurones. Il les range donc en superposition : chaque caractéristique correspond non pas à un neurone, mais à une direction dans l'espace des activations, presque perpendiculaire aux autres. Cela ne fonctionne que parce que la plupart des caractéristiques sont rarement actives en même temps : le texte qui parle d'un pont parle rarement, au même moment, de chimie organique. Les interférences entre directions voisines restent alors faibles. Le prix à payer est que chaque neurone participe à plusieurs caractéristiques à la fois.
Démêler les caractéristiques
Si les caractéristiques sont des directions, il faut un outil pour les retrouver. En 2023, Hoagy Cunningham et ses coauteurs utilisent des autoencodeurs parcimonieux : un second réseau, entraîné à reconstruire les activations du modèle étudié en n'utilisant à chaque fois qu'un petit nombre d'éléments parmi un très grand dictionnaire. Les caractéristiques ainsi obtenues sont jugées plus faciles à interpréter que les neurones eux-mêmes.
La méthode a vite changé d'échelle. En 2024, deux laboratoires industriels ont publié des dictionnaires de plusieurs millions de caractéristiques extraites de grands modèles de langage utilisés en production : jusqu'à 34 millions dans l'un, 16 millions dans l'autre. Certaines sont étonnamment précises : l'une s'active aux mentions du Golden Gate Bridge, en plusieurs langues et même sur une photo du pont ; en la forçant artificiellement, les chercheurs ont amené le modèle à se présenter lui-même comme le pont. D'autres réagissent à du code informatique vulnérable ou à des discussions sur la dissimulation. Les auteurs préviennent toutefois que l'existence de telles caractéristiques ne prouve pas qu'elles soient utiles pour la sûreté.
Des circuits dans les modèles de langage
L'étape suivante consiste à suivre le chemin d'un raisonnement. En mars 2025, Jack Lindsey et ses collègues ont construit des « graphes d'attribution » sur un modèle de langage commercial. Interrogé sur la capitale de l'État où se trouve Dallas, le modèle semble bien passer par une étape intermédiaire, le Texas, avant de répondre Austin. Pour écrire un poème rimé, il choisit la rime avant d'écrire le vers qui y mène. Mais les auteurs reconnaissent que leur méthode n'a fourni une explication satisfaisante que pour environ un quart des requêtes essayées.
Le même mois, une autre équipe industrielle publie des résultats négatifs : pour détecter l'intention nuisible d'un utilisateur, surtout face à des situations nouvelles, une simple sonde linéaire, un détecteur entraîné directement sur les activations, fait mieux que les autoencodeurs parcimonieux. L'équipe a décidé de réduire ses recherches fondamentales sur ces outils, sans les abandonner. Le domaine reste jeune, et ses méthodes doivent encore prouver leur utilité pratique face à des approches plus simples.
Et vers les étoiles ?
La marche « Microscope des Pensées » (voir la marche F-INT-13) vise à rendre lisibles les concepts et les raisonnements internes des grands modèles. Une intelligence artificielle à qui l'on confierait un jour une mission de plusieurs décennies vers Alpha du Centaure, loin de toute supervision, devra avoir été vérifiée de l'intérieur, et pas seulement sur ses réponses. La marche prévoit de publier, avec chaque version des modèles ouverts développés dans le programme, des dictionnaires de caractéristiques, sur le modèle des outils ouverts déjà diffusés pour certains modèles publics, et de comparer honnêtement méthodes mécanistes et sondes simples.
Sur Terre, le besoin est immédiat. Évaluer la solvabilité d'un emprunteur ou l'accès d'une personne à des prestations publiques figurent parmi les usages « à haut risque » du règlement européen sur l'IA. Les hôpitaux, les banques et les administrations qui s'appuient sur des modèles de langage gagneraient à disposer d'outils ouverts pour repérer, avant le déploiement, certains comportements indésirables comme un biais ou une intention nuisible, en complément des tests classiques. C'est ce que la marche veut leur fournir, en sachant qu'aujourd'hui ces outils permettent de détecter certains comportements, mais pas encore d'expliquer de façon fiable chaque réponse.