Au cœur d'un LLM — Transformers, attention et raisonnement
Des tokens à la génération, l'anatomie d'un modèle de langage — manipulable, sans équation avant l'intuition.
Blog IA
Comprendre ce qui se passe entre votre prompt et une action dans le monde réel.
Cinq chapitres, chacun une couche plus profonde dans la machine. Les figures sont manipulables : on y déplace des tokens, on y pondère de l'attention, on y regarde une décision passer une politique. Aucune connaissance préalable n'est supposée.
Chaque étage du schéma est un chapitre.
Des tokens à la génération, l'anatomie d'un modèle de langage — manipulable, sans équation avant l'intuition.
Outils, état, boucle, autonomie — ce qu'il faut ajouter autour d'un modèle pour que la génération devienne une action, et ce que cela coûte.
Découper, représenter, retrouver, augmenter — le pipeline qui donne du contexte à un modèle, et les cinq façons dont il produit une réponse fausse sans prévenir.
Hôte, client, serveur, et les trois choses qu'un serveur expose. Le protocole qui standardise l'accès — et la question qu'il laisse entière.
Identité, politique, approbation humaine, trace, preuve — la couche qui manque entre une décision d'agent et son effet sur le monde.