Le repliement des protéines, une énigme de cinquante ans
Une protéine n'est qu'un collier d'acides aminés, mais sa forme décide de tout. Prédire cette forme a résisté un demi-siècle, jusqu'à une percée récompensée par le prix Nobel de chimie 2024. Récit d'un problème résolu, et de ce qui reste à faire.
Une protéine est fabriquée comme un collier : la cellule enfile des acides aminés, vingt sortes différentes, dans l'ordre inscrit dans le gène. Mais ce collier ne reste pas étalé. En une fraction de seconde, il se replie et prend une forme précise, hérissée de creux et de bosses. C'est cette forme qui fait le travail : une enzyme ne coupe sa cible que parce que celle-ci s'emboîte dans une cavité taillée à sa mesure. Connaître la séquence est facile ; en déduire la forme a occupé les chercheurs cinquante ans.
Le pari d'Anfinsen et le labyrinthe de Levinthal
En 1972, dans son discours de réception du prix Nobel de chimie, Christian Anfinsen avance une idée forte : la séquence d'acides aminés devrait suffire à déterminer entièrement la structure de la protéine. Toute l'information est là. Encore faut-il savoir la lire.
La difficulté avait été chiffrée en 1969 par Cyrus Levinthal : une protéine ordinaire pourrait adopter de l'ordre de 10^{300} configurations. Les essayer une à une prendrait plus longtemps que l'âge de l'univers. La nature, elle, replie la chaîne en quelques millisecondes.
Longtemps, la seule méthode fiable a donc été expérimentale : cristalliser la protéine, la bombarder de rayons X et déduire la position des atomes du motif de diffraction. Un travail long et coûteux, parfois des années pour une seule molécule. D'où un déséquilibre spectaculaire : en 2020, la banque UniProt recensait environ 180 millions de séquences de protéines, contre quelque 170 000 structures déterminées expérimentalement dans la Protein Data Bank.
CASP, un concours à l'aveugle
Pour trancher entre les méthodes de prédiction, John Moult et Krzysztof Fidelis créent en 1994 une épreuve devenue célèbre, CASP, pour Critical Assessment of Structure Prediction. Tous les deux ans, les organisateurs distribuent des séquences de protéines dont la structure vient d'être résolue expérimentalement, mais n'a pas encore été publiée. Les prédictions rendues sont ensuite comparées à la réalité : personne ne peut tricher, la bonne réponse existe, elle est simplement tenue secrète.
La note principale, le GDT, varie de 0 à 100 et mesure en gros la part des atomes placés à moins d'une certaine distance de leur position réelle. Au-delà de 90, une prédiction rivalise avec une mesure de laboratoire. Pendant vingt-cinq ans, les meilleures équipes sont restées loin de ce seuil.
2020 : la barre est franchie
À l'édition CASP14, le programme AlphaFold2, présenté par Demis Hassabis et John Jumper, obtient un GDT médian de 92,4 sur l'ensemble des cibles, avec une erreur moyenne d'environ 1,6 ångström, soit l'ordre de grandeur de la taille d'un atome. Sur les cibles les plus difficiles, celles pour lesquelles aucune protéine voisine connue ne peut servir de modèle, elle atteint encore 87,0.
Le prix Nobel de chimie 2024 a consacré ce travail : une moitié à David Baker, de l'université de Washington à Seattle, pour la conception de protéines par ordinateur, l'autre moitié partagée entre Demis Hassabis et John Jumper, de Google DeepMind, pour la prédiction de structures. Le communiqué de l'Académie royale des sciences de Suède rappelle qu'AlphaFold2 a prédit la structure de la quasi-totalité des quelque 200 millions de protéines identifiées par les chercheurs, et a été utilisé par plus de deux millions de personnes dans 190 pays.
Une base de données ouverte à tous
Ce dernier chiffre tient à un choix : les résultats ont été publiés et non vendus. DeepMind et l'Institut européen de bio-informatique, l'EMBL-EBI, ouvrent en juillet 2021 l'AlphaFold Protein Structure Database, avec plus de 350 000 structures prédites, dont le protéome humain complet. En juillet 2022, elle passe à plus de 200 millions de structures, sous licence CC BY 4.0.
Le détail compte : sur les 27 protéomes ajoutés à cette occasion, 17 appartiennent à des agents de maladies tropicales négligées, qui touchent plus d'un milliard de personnes. Ces maladies attirent peu les investissements privés ; leurs chercheurs disposent désormais, gratuitement, des formes des protéines de leurs parasites. En un peu plus d'un an, plus de 500 000 chercheurs de plus de 190 pays avaient consulté la base.
Quand les particuliers prêtaient leurs ordinateurs
Avant l'apprentissage automatique, une autre approche avait tenté sa chance : simuler physiquement le repliement, atome par atome. Comme aucun laboratoire n'avait assez de puissance de calcul, le projet Folding@home, lancé en octobre 2000 dans le laboratoire de Vijay Pande à l'université Stanford, l'a empruntée aux particuliers. Chacun installait un logiciel qui calculait un bout de trajectoire pendant que la machine ne servait à rien. En 2007, une version pour la console PlayStation 3 fait franchir au projet son premier pétaflop soutenu. En juillet 2019, la direction passe à Greg Bowman, à l'université Washington à Saint-Louis.
Son heure de gloire arrive le 25 mars 2020 : porté par l'afflux de volontaires au début de l'épidémie de Covid-19, Folding@home devient le premier système de calcul au monde à dépasser l'exaflop, soit un milliard de milliards d'opérations par seconde. Dès avril, il simule les protéines du coronavirus.
Et sur Terre ?
Le problème a changé de nature. Prédire une forme est devenu courant ; ce qui manque, c'est l'accès aux outils et la prédiction de l'affinité, c'est-à-dire de la force avec laquelle une molécule candidate se fixera sur sa cible. AlphaFold 3, publié dans Nature en 2024, prédit les complexes entre protéines, acides nucléiques et petites molécules, mais ses poids ne s'obtiennent qu'auprès de Google et sous conditions. D'autres modèles sont entièrement ouverts : Boltz-2, publié en juin 2025, diffuse code et poids sous licence permissive et approche les calculs d'énergie libre pour l'affinité, plus de 1 000 fois plus vite ; OpenFold3, dévoilé en octobre 2025 par un consortium mené par l'université Columbia, est sous licence Apache 2.0 et réentraînable.
La marche « Plieur de Protéines Nomade » (voir la marche E-LIF-17) veut une chaîne de conception biomoléculaire qui tourne hors connexion, sur un calculateur compact : un équipage à des années-lumière ne pourra pas interroger un serveur terrestre pour concevoir l'enzyme qui manque à sa boucle de recyclage. Dès aujourd'hui, elle prévoit d'attribuer des heures de calcul et de mesurer des affinités sur des cibles de maladies négligées, pour que les équipes qui travaillent sur ces maladies puissent se servir des modèles ouverts existants. Les structures sont publiques ; le calcul, lui, ne l'est pas encore.