+237 680 39 05 82 contact@syneduc.com
Accredited & Certified Programs
Chapitres des cours

Multimodal

Des modèles qui unifient texte, image et audio — CLIP, BLIP, LLaVA, Whisper, MusicGen. 12 leçons pour construire des pipelines multimodaux complets.

1200
Tous niveaux
CIA Formation
CIA Formation Centre Vérifié

Programme de Formation

12 module(s)
Durée totale : 1200
Des modèles qui unifient texte, image et audio — CLIP, BLIP, LLaVA, Whisper, MusicGen. 12 leçons pour construire des pipelines multimodaux complets.

Module 1 : Panorama du multimodal

60
Cartographier l'univers des modèles multimodaux — texte, image, audio, vidéo — et situer CLIP, BLIP, LLaVA, Whisper et consorts dans un même paysage.

Module 2 : CLIP : aligner texte et image

120
Comprendre l'entraînement contrastif de CLIP, calculer des similarités texte-image et classifier n'importe quoi sans avoir jamais entraîné le modèle.

Module 3 : Recherche d'images par texte avec CLIP

90
Construire un moteur de recherche visuelle — indexer un dossier d'images avec CLIP, requêter par texte libre et évaluer la pertinence des résultats.

Module 4 : BLIP : captioning d'images

90
Générer automatiquement des légendes d'images avec BLIP et BLIP-2 — architecture, inférence avec transformers et évaluation avec CIDEr/BLEU.

Module 5 : LLaVA et les VLMs : question answering visuel

120
Utiliser LLaVA pour répondre à des questions libres sur une image, comprendre l'architecture des VLMs et comparer aux modèles commerciaux.

Module 6 : GPT-4V, Claude Vision, Gemini : les modèles commerciaux

90
Comparer les trois grands VLMs commerciaux via API — forces, faiblesses, prix, confidentialité — et apprendre à choisir selon le cas d'usage.

Module 7 : Audio : Whisper pour l'ASR

90
Transcrire automatiquement l'audio avec Whisper — architecture, modèles disponibles, inférence multilingue et mesure du WER.

Module 8 : Génération audio : MusicGen et Bark

90
Générer musique et voix avec MusicGen et Bark — architecture à tokens audio, inférence via transformers et limites actuelles du domaine.

Module 9 : Text-to-speech et cloning vocal

90
Utiliser XTTS et Tortoise pour synthétiser de la parole, distinguer TTS et cloning, et aborder les questions éthiques du clonage de voix.

Module 10 : TP : captioning d'images avec BLIP

120
Travaux pratiques — charger BLIP, captioner un jeu d'images, évaluer la qualité des descriptions et exporter un rapport reproductible.

Module 11 : TP : pipeline vidéo → transcription → résumé → image

180
Travaux pratiques — assembler ffmpeg, Whisper, un LLM et Stable Diffusion en un pipeline complet qui transforme une vidéo en résumé illustré.

Module 12 : Synthèse multimodal

60
Consolider les acquis du chapitre — cartographie des modèles vus, grille de décision par cas d'usage et passerelle vers l'entraînement à grande échelle.
Nous contacter

Commentaires

0 commentaire

Se connecter pour commenter

Aucun commentaire pour le moment

Soyez le premier à partager votre avis !

Se connecter pour commenter

Supprimer le commentaire ?

Cette action est irréversible. Le commentaire sera définitivement supprimé.

Your Cart

Your cart is empty

Add programs to start learning