Tous les récits

Capacités · Intro

Les Transformers et l’attention

Publié le 13 juillet 20263 min de lecture

Ce site s’est donné une règle avant d’écrire sa première ligne : ne jamais refaire en moins bien ce qui existe déjà en superbe. Cette page est la première à l’appliquer.

Il fallait pourtant les expliquer, les Transformers. C’est l’architecture derrière à peu près tout ce qui se raconte ici : ChatGPT, Claude, Gemini, les générateurs d’images, et la quasi-totalité des systèmes que ce site dissèque récit après récit.

En septembre 2023, l’équipe de récit visuel du FT publie « Generative AI exists because of the transformer »[1]. Vous faites défiler, et l’architecture se déplie dans l’ordre : les mots deviennent des tokens, les tokens des vecteurs, les vecteurs sont pesés, malaxés, comparés et, par la magie du génie mathématique, du sens apparaît. Les Grands Modèles de Langue peuvent naître. Près de trois ans plus tard, cela reste la plus belle porte d’entrée que nous connaissions. Elle est en anglais, en accès libre, et vaut chacune de vos minutes.

──────[ le récit du FT ]──────

« Generative AI exists because of the transformer »

Financial Times · visual storytelling · septembre 2023 · accès libre

Si vous voulez remonter à la source de la source, l’article scientifique qui introduit les Transformers s’appelle « Attention Is All You Need ». Il date de 2017, il ne fait que 8 petites pages, et il a changé le monde à tout jamais.

──────[ attention is all you need · 2017 ]──────

fin de la phrase :

Juin 2017. Huit chercheurs de Google publient « Attention Is All You Need »[2], l’article qui remplace la lecture mot à mot par un principe unique : laisser chaque mot regarder tous les autres, et apprendre lesquels comptent. C’est ce regard que rejoue le schéma ci-dessus, sur l’exemple canonique popularisé avec l’article[3]. Presque toute l’IA moderne descend de ces huit pages.

Poids d’attention illustratifs. Changez la fin de la phrase : la référence bascule de l’animal à la rue, et le pronom change de genre avec elle. C’est exactement le calcul que le mécanisme d’attention apprend à faire.

Le jour où quelqu’un fera mieux que le FT, cette page sera refaite. En attendant, elle reste courte à dessein : c’est sa façon d’être honnête. Et pour comprendre pourquoi grossir ces Transformers les a rendus si puissants, la suite naturelle est notre récit sur les lois d’échelle.


Sources et pour aller plus loin