Programme de Formation
12
module(s)
Durée totale : 1200
Des modèles qui unifient texte, image et audio — CLIP, BLIP, LLaVA, Whisper, MusicGen. 12 leçons pour construire des pipelines multimodaux complets.
Module 1 : Panorama du multimodal
60
Cartographier l'univers des modèles multimodaux — texte, image, audio, vidéo — et situer CLIP, BLIP, LLaVA, Whisper et consorts dans un même paysage.
Module 2 : CLIP : aligner texte et image
120
Comprendre l'entraînement contrastif de CLIP, calculer des similarités texte-image et classifier n'importe quoi sans avoir jamais entraîné le modèle.
Module 3 : Recherche d'images par texte avec CLIP
90
Construire un moteur de recherche visuelle — indexer un dossier d'images avec CLIP, requêter par texte libre et évaluer la pertinence des résultats.
Module 4 : BLIP : captioning d'images
90
Générer automatiquement des légendes d'images avec BLIP et BLIP-2 — architecture, inférence avec transformers et évaluation avec CIDEr/BLEU.
Module 5 : LLaVA et les VLMs : question answering visuel
120
Utiliser LLaVA pour répondre à des questions libres sur une image, comprendre l'architecture des VLMs et comparer aux modèles commerciaux.
Module 6 : GPT-4V, Claude Vision, Gemini : les modèles commerciaux
90
Comparer les trois grands VLMs commerciaux via API — forces, faiblesses, prix, confidentialité — et apprendre à choisir selon le cas d'usage.
Module 7 : Audio : Whisper pour l'ASR
90
Transcrire automatiquement l'audio avec Whisper — architecture, modèles disponibles, inférence multilingue et mesure du WER.
Module 8 : Génération audio : MusicGen et Bark
90
Générer musique et voix avec MusicGen et Bark — architecture à tokens audio, inférence via transformers et limites actuelles du domaine.
Module 9 : Text-to-speech et cloning vocal
90
Utiliser XTTS et Tortoise pour synthétiser de la parole, distinguer TTS et cloning, et aborder les questions éthiques du clonage de voix.
Module 10 : TP : captioning d'images avec BLIP
120
Travaux pratiques — charger BLIP, captioner un jeu d'images, évaluer la qualité des descriptions et exporter un rapport reproductible.
Module 11 : TP : pipeline vidéo → transcription → résumé → image
180
Travaux pratiques — assembler ffmpeg, Whisper, un LLM et Stable Diffusion en un pipeline complet qui transforme une vidéo en résumé illustré.
Module 12 : Synthèse multimodal
60
Consolider les acquis du chapitre — cartographie des modèles vus, grille de décision par cas d'usage et passerelle vers l'entraînement à grande échelle.
Commentaires
0 commentaire
Aucun commentaire pour le moment
Soyez le premier à partager votre avis !
Se connecter pour commenter