Programme de Formation
Durée totale : 120
Découvrir Direct Preference Optimization — une perte de classification directe sur paires préférées, sans reward model ni PPO, devenue le standard open-source en 2024.
Le programme détaillé sera bientôt disponible.
Contactez le centre pour plus d'informations.
Commentaires
0 commentaire
Aucun commentaire pour le moment
Soyez le premier à partager votre avis !
Se connecter pour commenter