Module
Retour aux formations
IA & ProduitConfirmé

Évaluer une fonctionnalité IA : jeux de test, métriques et LLM-juge

Décider sur des preuves qu’une fonctionnalité IA est prête : critères, jeu de test versionné, notation, LLM-juge calibré, métriques et seuils de mise en production.

55 étapes~3 hNiveau : Confirmé · Pratique régulière : vous utilisez déjà l’outil ou êtes confronté à la thématique.

Décider sur des preuves, et non sur des impressions, qu'une fonctionnalité IA est prête pour la production : critères de succès, jeu de test représentatif et versionné, méthode de notation par critère, modèle juge calibré, métriques adaptées et seuils de mise en production. Vous repartez avec le plan d'évaluation de votre fonctionnalité, son jeu de test et ses seuils, sans écrire de code.

Ce que vous saurez faire

  • Traduire l'objectif d'une fonctionnalité IA en critères de succès spécifiques, mesurables, atteignables et pertinents, en tenant compte de la gravité des erreurs.
  • Constituer un jeu de test représentatif à partir du trafic réel, de cas limites et de cas adverses, et justifier sa composition.
  • Annoter le jeu de test avec un guide, mesurer l'accord entre annotateurs, le versionner et le protéger du surajustement.
  • Choisir, pour chaque critère, une méthode de notation (code, humain, modèle juge) et justifier le compromis entre coût, vitesse et fiabilité.
  • Concevoir un modèle juge (grille, format, modèle différent), identifier ses biais et le calibrer contre des notes humaines.
  • Choisir et interpréter les métriques adaptées à une classification et à un RAG, et en déduire l'étape à corriger.
  • Définir la règle de régression, l'articulation entre évaluations hors ligne et en ligne, et des seuils de mise en production fixés avant les résultats.

Prérequis

  • Avoir conçu ou piloté une fonctionnalité qui utilise un LLM (assistant, résumé, classement, extraction), ou s'apprêter à le faire
  • Savoir ce qu'est un prompt, un system prompt et, pour la partie RAG, une recherche de passages
  • Cours recommandés, non bloquants : Créer un assistant IA pour votre produit ; Concevoir une architecture RAG adaptée à son produit.
  • Ce cours ne s'adresse pas aux développeurs qui cherchent un tutoriel d'outillage (SDK, code).

Programme

Que vais-je construire dans ce cours, et dans quel ordre ?

  1. Objectif · À la fin de cette présentation, vous saurez ce que vous allez produire (le plan d'évaluation de votre fonctionnalité IA, son jeu de test versionné et ses seuils de mise en production) et dans quel ordre les cinq modules vous y conduisent.

Qu'est-ce qui prouve qu'une fonctionnalité IA marche, et selon quels critères ?

  1. Objectif · À la fin de cette leçon, vous serez capable d'expliquer pourquoi quelques essais ne prouvent pas la qualité d'une fonctionnalité IA, et de décrire ce qu'apporte une évaluation rejouable à chaque changement.

  2. Objectif · À la fin de cette leçon, vous serez capable de traduire l'objectif d'une fonctionnalité IA en critères de succès spécifiques, mesurables, atteignables et pertinents, couvrant plusieurs dimensions et hiérarchisés selon la gravité des erreurs.

Sur quels cas tester, et comment garder ce jeu fiable dans le temps ?

  1. Objectif · À la fin de cette leçon, vous serez capable de composer un jeu de test à partir du trafic réel, de cas limites et de cas adverses, d'en fixer la taille de départ et de justifier sa répartition.

  2. Objectif · À la fin de cette leçon, vous serez capable de faire annoter un jeu de test avec un guide, de vérifier l'accord entre annotateurs, de le versionner avec le prompt et le modèle, et de le protéger du surajustement grâce à un jeu réservé.

Comment noter chaque critère de façon fiable, et quand faire confiance à un modèle juge ?

  1. Objectif · À la fin de cette leçon, vous serez capable de choisir, pour chaque critère, entre notation par code, notation humaine et modèle juge, et de justifier ce choix par la nature du critère, le coût, la vitesse et la fiabilité.

  2. Objectif · À la fin de cette leçon, vous serez capable de spécifier un modèle juge (grille, format de notation, choix du modèle), d'identifier ses biais et de le calibrer contre des notes humaines avant de lui confier l'évaluation à grande échelle.

Quelles métriques lire, et que disent-elles de l'étape à corriger ?

  1. Objectif · À la fin de cette leçon, vous serez capable de lire une matrice de confusion, de choisir entre exactitude, précision, rappel et F1 selon le coût des erreurs, et de repérer quand un déséquilibre des classes rend un score trompeur.

  2. Objectif · À la fin de cette leçon, vous serez capable de choisir les métriques d'une fonctionnalité appuyée sur un RAG (rappel et précision du contexte, fidélité, exactitude de la réponse, exactitude des citations), de savoir lesquelles demandent une référence, et d'en déduire l'étape à corriger.

Quand une version est-elle prête, et comment éviter qu'un changement la dégrade ?

  1. Objectif · À la fin de cette leçon, vous serez capable de définir des seuils de mise en production fixés avant les résultats, une règle de régression à chaque changement, et la place des évaluations hors ligne et en ligne dans la décision.

  2. Objectif · À la fin de cette leçon, vous serez capable d'assembler le plan d'évaluation de votre fonctionnalité IA, avec son jeu de test versionné et ses seuils de mise en production, et de planifier sa mise en œuvre à 7 et 30 jours.