Module
Module 3 sur 6Leçon 1 sur 2~22 min

Constituer un jeu de test représentatif

Comment composer un jeu de test qui ressemble aux vraies demandes de vos utilisateurs, y compris les cas rares et les tentatives de détournement. C'est le socle de toute décision sur une fonctionnalité IA : un jeu mal composé donne des scores rassurants sur des cas sans importance, et sa taille conditionne l'effort à négocier avec l'équipe data.

Objectif de la leçon

À la fin de cette leçon, vous serez capable de composer un jeu de test à partir du trafic réel, de cas limites et de cas adverses, d'en fixer la taille de départ et de justifier sa répartition.

Thèmes abordés

  • jeu de test IA
  • golden dataset
  • échantillonnage stratifié
  • cas limites
  • cas adverses
  • données synthétiques

Dans quel module

Construire le jeu de test

Sur quels cas tester, et comment garder ce jeu fiable dans le temps ?

Leçons du module

  1. Constituer un jeu de test représentatif (cette leçon)
  2. Annoter, versionner et protéger le jeu de test

Ce que vous apprendrez dans la formation

Cette leçon fait partie de la formation Évaluer une fonctionnalité IA : jeux de test, métriques et LLM-juge

  • Traduire l'objectif d'une fonctionnalité IA en critères de succès spécifiques, mesurables, atteignables et pertinents, en tenant compte de la gravité des erreurs.
  • Constituer un jeu de test représentatif à partir du trafic réel, de cas limites et de cas adverses, et justifier sa composition.
  • Annoter le jeu de test avec un guide, mesurer l'accord entre annotateurs, le versionner et le protéger du surajustement.
  • Choisir, pour chaque critère, une méthode de notation (code, humain, modèle juge) et justifier le compromis entre coût, vitesse et fiabilité.
  • Concevoir un modèle juge (grille, format, modèle différent), identifier ses biais et le calibrer contre des notes humaines.
  • Choisir et interpréter les métriques adaptées à une classification et à un RAG, et en déduire l'étape à corriger.
  • Définir la règle de régression, l'articulation entre évaluations hors ligne et en ligne, et des seuils de mise en production fixés avant les résultats.