Module
Module 1 sur 6Leçon 1 sur 1~2 min

Présentation du cours

Ce cours vous apprend à évaluer une fonctionnalité IA pour passer d'une impression favorable à une décision de lancement que vous pouvez défendre. Vous y bâtissez, sur votre propre produit, les pièces qui rendent cette décision solide et que vos ingénieurs pourront rejouer à chaque nouvelle version.

Objectif de la leçon

À la fin de cette présentation, vous saurez ce que vous allez produire (le plan d'évaluation de votre fonctionnalité IA, son jeu de test versionné et ses seuils de mise en production) et dans quel ordre les cinq modules vous y conduisent.

Thèmes abordés

  • évaluer une fonctionnalité IA
  • evals LLM
  • LLM as a judge
  • jeu de test
  • mise en production IA

Dans quel module

Vue d'ensemble

Que vais-je construire dans ce cours, et dans quel ordre ?

Leçons du module

  1. Présentation du cours (cette leçon)

Ce que vous apprendrez dans la formation

Cette leçon fait partie de la formation Évaluer une fonctionnalité IA : jeux de test, métriques et LLM-juge

  • Traduire l'objectif d'une fonctionnalité IA en critères de succès spécifiques, mesurables, atteignables et pertinents, en tenant compte de la gravité des erreurs.
  • Constituer un jeu de test représentatif à partir du trafic réel, de cas limites et de cas adverses, et justifier sa composition.
  • Annoter le jeu de test avec un guide, mesurer l'accord entre annotateurs, le versionner et le protéger du surajustement.
  • Choisir, pour chaque critère, une méthode de notation (code, humain, modèle juge) et justifier le compromis entre coût, vitesse et fiabilité.
  • Concevoir un modèle juge (grille, format, modèle différent), identifier ses biais et le calibrer contre des notes humaines.
  • Choisir et interpréter les métriques adaptées à une classification et à un RAG, et en déduire l'étape à corriger.
  • Définir la règle de régression, l'articulation entre évaluations hors ligne et en ligne, et des seuils de mise en production fixés avant les résultats.