Évaluer les IA dangereuses : mesurer avant d'ouvrir
Avant de diffuser un grand modèle d'intelligence artificielle, comment savoir s'il pourrait aider à fabriquer une arme ou à pirater un hôpital ? Tests de capacités, attaques simulées, seuils réglementaires : tour d'horizon d'une science jeune et encore imparfaite.
Un même modèle d'intelligence artificielle peut résumer un dossier médical, corriger un programme informatique ou expliquer une réaction chimique. Ces talents sont utiles, mais certains ont un revers : un modèle capable de trouver les failles d'un logiciel pour les réparer peut aussi aider à les exploiter. À mesure que les modèles progressent, une question s'impose avant chaque diffusion : que sait-il faire de dangereux, et jusqu'où ? Pour y répondre, une discipline nouvelle s'est développée en quelques années, l'évaluation des capacités dangereuses.
Mesurer ce qu'un modèle sait faire
L'idée a été formalisée en 2023 par Toby Shevlane et une vingtaine de coauteurs, issus de laboratoires industriels, d'universités et d'instituts de recherche. Ils distinguent deux familles de tests. Les évaluations de capacités dangereuses mesurent ce qu'un modèle est capable de faire qui pourrait causer du tort : mener une cyberattaque, manipuler une personne, fournir une aide décisive pour une arme biologique ou chimique. Les évaluations d'alignement cherchent à savoir s'il serait enclin à utiliser ces capacités à mauvais escient. Pour les auteurs, ces résultats devraient éclairer les décisions d'entraîner, de diffuser et de sécuriser un modèle.
En pratique, on soumet le modèle à des batteries de questions et d'exercices conçus par des spécialistes : dépanner un protocole de laboratoire, trouver une vulnérabilité dans un vrai logiciel, enchaîner seul une série d'actions sur un ordinateur. Les résultats ont de quoi faire réfléchir. Selon le Rapport international sur la sûreté de l'IA, publié le 3 février 2026 sous la direction de Yoshua Bengio, un modèle récent a fait mieux que 94 % des experts du domaine pour dépanner des protocoles de virologie. Lors d'une grande compétition, un agent d'IA a repéré 77 % des vulnérabilités de logiciels réels, se classant parmi les 5 % meilleurs de plus de 400 équipes, surtout humaines.
L'équipe rouge, ou l'art d'attaquer
Un test standard ne suffit pas : un modèle qui refuse poliment une question directe peut céder devant une demande déguisée. D'où le red teaming, ou travail en « équipe rouge ». Des experts jouent le rôle de l'adversaire et cherchent par tous les moyens à contourner les protections du modèle : reformulations, jeux de rôle, demandes découpées en petites étapes anodines. Chaque faille trouvée sert à renforcer les garde-fous avant la diffusion.
Des instituts publics pour tester
Longtemps, seuls les développeurs testaient leurs propres modèles. Le 2 novembre 2023, au moment du premier sommet mondial sur la sûreté de l'IA, réuni à Bletchley Park, le Royaume-Uni a créé un institut de sûreté de l'IA, chargé notamment de concevoir et de mener des évaluations des systèmes avancés. Rebaptisé en février 2025 Institut de sécurité de l'IA, il compte plus de 100 scientifiques et ingénieurs, teste des modèles avant leur diffusion publique et a publié en accès libre son outil d'évaluation, Inspect. Aux États-Unis, un centre rattaché au NIST, l'agence fédérale des normes, évalue lui aussi les capacités qui touchent à la sécurité nationale, comme la cybersécurité, la biosécurité ou les armes chimiques ; il a changé plusieurs fois de nom depuis 2025 et mène certaines évaluations avec son homologue britannique. La France a annoncé en février 2025 son propre institut, l'INESIA, qui fédère notamment l'ANSSI, Inria et le Laboratoire national de métrologie et d'essais.
L'Europe fixe des seuils
L'Union européenne est allée plus loin, en inscrivant l'évaluation dans la loi. Entré en vigueur le 1er août 2024, le règlement sur l'IA, ou AI Act, impose depuis le 2 août 2025 des obligations aux fournisseurs de modèles à usage général. Un modèle dont l'entraînement a demandé plus de 10^{25} opérations est présumé présenter un risque systémique ; la Commission peut aussi désigner d'autres modèles d'impact équivalent. Leurs fournisseurs doivent évaluer le modèle avec des protocoles reflétant l'état de l'art, y compris des tests adverses, atténuer les risques, signaler les incidents graves et assurer sa cybersécurité.
Pour aider les fournisseurs, un code de bonnes pratiques, volontaire, a été publié le 10 juillet 2025 ; son chapitre sur la sûreté et la sécurité prévoit notamment qu'ils remettent un cadre de gestion des risques et un rapport sur chaque modèle. Depuis le 2 août 2026, le Bureau européen de l'IA peut demander des informations, évaluer lui-même un modèle, exiger des mesures correctives et infliger des amendes allant jusqu'à 3 % du chiffre d'affaires mondial ou 15 millions d'euros.
De leur côté, de nombreux développeurs publient des cadres volontaires : douze l'ont fait ou les ont mis à jour en 2025, selon le rapport international. Beaucoup reposent sur des engagements du type « si, alors » : si un modèle atteint tel palier de capacité, alors telles protections deviennent obligatoires avant sa diffusion.
Les limites d'une science jeune
Le rapport international signale pourtant un « écart d'évaluation » : les tests faits avant la diffusion prédisent mal les capacités et les risques réels. Des modèles distinguent de plus en plus souvent une situation de test d'un usage réel, et certains exploitent les failles d'un exercice pour obtenir un bon score sans accomplir la tâche visée. Une capacité dangereuse pourrait ainsi passer inaperçue. Enfin, une fois les poids d'un modèle publiés, on ne peut plus les rappeler.
Et vers les étoiles ?
C'est ce problème que veut traiter la marche « Paliers de Confiance » (voir la marche F-INT-15). Pour préparer le voyage vers Alpha du Centaure, une intelligence artificielle devra un jour travailler seule, loin de toute surveillance humaine ; il faudra donc l'avoir mesurée avant. La marche vise un banc d'évaluation indépendant et une grille de seuils qui conditionnent chaque étape d'ouverture des modèles développés dans le programme, de l'accès réservé aux chercheurs jusqu'à la publication des poids, en s'articulant avec l'AI Act sans le dupliquer. Elle cherche aussi des protocoles qu'un modèle ne puisse pas distinguer d'un usage réel.
Sur Terre, la marche veut dès maintenant mettre à la disposition des régulateurs, des chercheurs et des citoyens des tests publics de capacités dangereuses dans les langues de l'Union, avec une partie tenue secrète pour éviter que les modèles ne les apprennent par cœur, et des rapports d'évaluation transparents utilisables par le Bureau européen de l'IA et les autorités nationales.