En mars 2016, AlphaGo affronte à Séoul Lee Sedol, vainqueur de 18 titres mondiaux de go. Lors de la deuxième partie, la machine pose sa 37e pierre très haut sur le plateau, à un endroit que les professionnels jugent d’abord étrange. DeepMind estime qu’un humain n’aurait choisi ce coup qu’une fois sur 10 000. Quelques heures plus tard, il apparaît comme une idée décisive. L’IA venait de transformer un silence de commentateurs en chapitre d’histoire.
Le go refuse les recettes toutes faites
Le go se joue sur une grille de 19 lignes sur 19. Deux adversaires y placent alternativement des pierres afin de contrôler le territoire. Les règles tiennent en peu de phrases, mais le nombre de positions possibles rend impossible l’examen exhaustif de chaque suite de coups. Même une machine rapide ne peut pas ouvrir toutes les portes, vérifier toutes les pièces et revenir avant le déjeuner.
Les programmes classiques avaient donc longtemps progressé moins vite au go qu’aux échecs. Pour choisir correctement, il faut évaluer une position globale et reconnaître des formes dont la valeur dépend du contexte. Les grands joueurs développent cette intuition pendant des années. AlphaGo doit construire une capacité comparable à partir de données, de parties contre lui-même et de recherches ciblées dans l’arbre des possibilités.
Des parties humaines, puis un adversaire disponible en permanence
AlphaGo combine des réseaux de neurones et une recherche arborescente. Un premier réseau apprend à proposer des coups plausibles en observant des parties humaines expertes. Le système joue ensuite contre différentes versions de lui-même pour améliorer ses décisions. Un autre réseau estime la probabilité de victoire d’une position, ce qui évite de poursuivre chaque variante jusqu’à la fin de la partie.
Cette architecture ne récite donc pas seulement une bibliothèque de coups. Elle produit des candidats, explore les suites les plus prometteuses et évalue le résultat probable. L’auto-jeu lui fournit en outre un partenaire qui ne dort pas, ne se vexe pas et accepte immédiatement une nouvelle revanche. C’est pratique pour apprendre ; nettement moins pour partager le café.
Le coup 37 arrive là où les habitudes ne regardent pas
Dans la deuxième partie, AlphaGo place le coup 37 sur la cinquième ligne. Les professionnels privilégient généralement des positions plus proches du bord à ce stade. Les commentateurs cherchent une explication et Lee Sedol quitte brièvement la salle. Le geste ressemble d’abord à une maladresse numérique, comme si la souris avait glissé sur un plateau qui n’en possède pas.
Pourtant, cette pierre exerce une influence à grande échelle et contribue à la victoire d’AlphaGo. DeepMind décrit ce choix comme ayant une probabilité d’usage humain d’environ une sur 10 000. Le système ne cherche pas à être original : il sélectionne un coup que son évaluation juge fort. La surprise vient de l’écart entre ce calcul et les habitudes accumulées par les joueurs.
Lee Sedol répond avec son propre coup inattendu
AlphaGo remporte le match par quatre victoires à une. L’unique victoire humaine contient elle aussi un moment célèbre : le coup 78 de la quatrième partie, une manœuvre que le système évalue mal. La machine commet ensuite plusieurs erreurs et Lee Sedol gagne. Le duel ne raconte donc pas simplement le remplacement d’une intuition par un calcul ; il montre deux formes d’exploration capables de se surprendre.
Pour les équipes qui utilisent l’IA, c’est un rappel utile. Une proposition inhabituelle ne mérite ni rejet automatique ni admiration automatique. Elle mérite une vérification : quel objectif optimise-t-elle, sur quelles hypothèses repose-t-elle et résiste-t-elle à un adversaire ou à un test indépendant ? Le coup 37 était brillant parce qu’il fonctionnait sur le plateau, pas parce qu’il était bizarre.
La créativité peut ressembler à une anomalie pendant quelques minutes
Après le match, des joueurs professionnels étudient les idées d’AlphaGo et expérimentent de nouvelles ouvertures. La machine ne ferme pas la discipline ; elle agrandit le vocabulaire des coups envisagés. Son apport le plus intéressant n’est peut-être pas d’avoir gagné, mais d’avoir rendu visible une possibilité que la tradition évaluait rarement.
Dans un outil créatif, une sortie surprenante doit toutefois rester traçable et testable. Sans règles, métriques et regard humain, l’originalité peut n’être qu’une erreur bien habillée. Avec un cadre, elle devient une hypothèse à essayer. Les commentateurs du coup 37 ont eu besoin de quelques heures pour passer de « impossible » à « remarquable ». C’est encore un délai raisonnable pour une réunion.
