Module
Module 4 sur 6Leçon 2 sur 2~24 min

Concevoir et calibrer un modèle juge

Comment spécifier un modèle juge, repérer ses biais et vérifier qu'il note comme vos experts avant de lui confier des milliers de réponses. Un juge mal réglé produit des scores flatteurs qui peuvent faire valider une version défaillante ; savoir l'auditer vous permet de poser les bonnes questions à l'équipe qui l'a construit.

Objectif de la leçon

À la fin de cette leçon, vous serez capable de spécifier un modèle juge (grille, format de notation, choix du modèle), d'identifier ses biais et de le calibrer contre des notes humaines avant de lui confier l'évaluation à grande échelle.

Thèmes abordés

  • LLM as a judge
  • modèle juge
  • biais du juge
  • calibration du juge
  • grille d'évaluation

Dans quel module

Noter les réponses

Comment noter chaque critère de façon fiable, et quand faire confiance à un modèle juge ?

Leçons du module

  1. Choisir une méthode de notation par critère
  2. Concevoir et calibrer un modèle juge (cette leçon)

Ce que vous apprendrez dans la formation

Cette leçon fait partie de la formation Évaluer une fonctionnalité IA : jeux de test, métriques et LLM-juge

  • Traduire l'objectif d'une fonctionnalité IA en critères de succès spécifiques, mesurables, atteignables et pertinents, en tenant compte de la gravité des erreurs.
  • Constituer un jeu de test représentatif à partir du trafic réel, de cas limites et de cas adverses, et justifier sa composition.
  • Annoter le jeu de test avec un guide, mesurer l'accord entre annotateurs, le versionner et le protéger du surajustement.
  • Choisir, pour chaque critère, une méthode de notation (code, humain, modèle juge) et justifier le compromis entre coût, vitesse et fiabilité.
  • Concevoir un modèle juge (grille, format, modèle différent), identifier ses biais et le calibrer contre des notes humaines.
  • Choisir et interpréter les métriques adaptées à une classification et à un RAG, et en déduire l'étape à corriger.
  • Définir la règle de régression, l'articulation entre évaluations hors ligne et en ligne, et des seuils de mise en production fixés avant les résultats.