Module
Module 2 sur 6Leçon 1 sur 2~14 min

Pourquoi le ressenti ne suffit pas

Pourquoi une démo réussie et quelques essais internes ne prouvent pas qu'une fonctionnalité IA est prête à sortir. Vous y trouvez les arguments pour obtenir du temps d'évaluation face à une équipe pressée de lancer, et pour expliquer ce qu'une évaluation rejouable protège quand le prompt ou le modèle évolue.

Objectif de la leçon

À la fin de cette leçon, vous serez capable d'expliquer pourquoi quelques essais ne prouvent pas la qualité d'une fonctionnalité IA, et de décrire ce qu'apporte une évaluation rejouable à chaque changement.

Thèmes abordés

  • evals LLM
  • évaluation au ressenti
  • non-déterminisme des LLM
  • régression de prompt
  • tester une fonctionnalité IA

Dans quel module

Pourquoi évaluer, et quoi mesurer

Qu'est-ce qui prouve qu'une fonctionnalité IA marche, et selon quels critères ?

Leçons du module

  1. Pourquoi le ressenti ne suffit pas (cette leçon)
  2. Définir des critères de succès mesurables

Ce que vous apprendrez dans la formation

Cette leçon fait partie de la formation Évaluer une fonctionnalité IA : jeux de test, métriques et LLM-juge

  • Traduire l'objectif d'une fonctionnalité IA en critères de succès spécifiques, mesurables, atteignables et pertinents, en tenant compte de la gravité des erreurs.
  • Constituer un jeu de test représentatif à partir du trafic réel, de cas limites et de cas adverses, et justifier sa composition.
  • Annoter le jeu de test avec un guide, mesurer l'accord entre annotateurs, le versionner et le protéger du surajustement.
  • Choisir, pour chaque critère, une méthode de notation (code, humain, modèle juge) et justifier le compromis entre coût, vitesse et fiabilité.
  • Concevoir un modèle juge (grille, format, modèle différent), identifier ses biais et le calibrer contre des notes humaines.
  • Choisir et interpréter les métriques adaptées à une classification et à un RAG, et en déduire l'étape à corriger.
  • Définir la règle de régression, l'articulation entre évaluations hors ligne et en ligne, et des seuils de mise en production fixés avant les résultats.