Programme de Formation
11
module(s)
Durée totale : 1320
Décomposer et implémenter l'architecture Transformer pièce par pièce — attention, self-attention, multi-head, positional encoding, encodeur, décodeur. 11 leçons pour entrer dans le moteur.
Module 1 : De l'attention aux Transformers : pourquoi cette révolution ?
90
Situer l'arrivée des Transformers dans l'histoire du NLP, comprendre les limites des RNN et LSTM, et saisir pourquoi l'attention a tout changé en 2017.
Module 2 : L'attention : intuition et mécanique
120
Ouvrir le moteur de l'attention en découvrant query, key et value, comprendre la formule scaled dot-product et calculer pas à pas une attention simple.
Module 3 : Self-attention en profondeur
120
Décomposer la self-attention ligne par ligne, l'implémenter en PyTorch, visualiser les poids et comprendre pourquoi chaque token construit son propre contexte.
Module 4 : Multi-head attention
120
Découvrir pourquoi plusieurs têtes d'attention en parallèle valent mieux qu'une seule, implémenter le mécanisme complet et apprendre à interpréter les spécialisations.
Module 5 : Positional encoding
90
Comprendre pourquoi la self-attention perd la notion d'ordre, implémenter l'encodage sinusoïdal et comparer avec les alternatives apprises ou rotatives.
Module 6 : Le bloc encodeur complet
120
Assembler attention, feed-forward, résidus et layer norm en un bloc encodeur complet, l'implémenter en PyTorch et tracer le flux des tenseurs.
Module 7 : Le bloc décodeur et le masking causal
120
Comprendre comment le décodeur ajoute masking causal et cross-attention, l'implémenter en PyTorch et saisir pourquoi il est la base des modèles génératifs.
Module 8 : Layer norm, résidus et feed-forward
90
Plonger dans les trois stabilisateurs du Transformer — layer norm, skip connections et feed-forward — et comprendre pourquoi aucun grand modèle ne s'entraîne sans eux.
Module 9 : TP — implémenter self-attention from scratch
150
Coder à la main scaled dot-product attention et multi-head attention, puis valider l'implémentation en comparant numériquement à nn.MultiheadAttention de PyTorch.
Module 10 : TP — mini-Transformer pour classification
150
Construire un mini-Transformer encoder complet, l'entraîner sur un jeu de classification de texte et évaluer ses performances sur un jeu de test dédié.
Module 11 : Lecture commentée du papier "Attention Is All You Need"
150
Parcourir le papier fondateur de 2017 section par section, relier chaque passage à votre implémentation et identifier les innovations qui ont défini une décennie d'IA.
Commentaires
0 commentaire
Aucun commentaire pour le moment
Soyez le premier à partager votre avis !
Se connecter pour commenter