Evals (évaluation d'une fonctionnalité IA)
Les evals sont des tests systématiques des sorties d'une fonctionnalité IA, menés sur un ensemble d'entrées représentatives et selon des critères définis. Chaque cas associe une entrée à ce qu'une bonne réponse doit contenir ou éviter, et une méthode de notation attribue un score : correspondance exacte, vérification par code, relecture humaine ou autre modèle utilisé comme juge. Les evals transforment « ça a l'air mieux » en un chiffre que l'on suit de version en version.
Pourquoi c’est important pour un PM
Les sorties d'un LLM varient, et un changement de prompt ou de modèle qui corrige un cas peut en casser dix autres sans bruit. Les evals permettent au PM de décider si une fonctionnalité est prête, si un nouveau modèle vaut la peine et si la qualité dérive en production. Elles jouent pour l'IA le rôle des critères d'acceptation, et le PM est le mieux placé pour définir ce qu'est une bonne réponse pour les utilisateurs.
Exemple
Avant de passer son assistant de réponse aux e-mails sur un modèle moins cher, une équipe fait tourner les deux versions sur 200 vrais e-mails clients. Le modèle moins cher obtient le même score sur le ton, mais perd deux points sur l'exactitude des règles commerciales, dont une erreur grave sur un remboursement. L'équipe garde le modèle actuel pour cette catégorie.
Points clés
- Partir de critères de réussite liés à l'impact utilisateur, avec une gravité par type d'erreur.
- Construire le jeu de test à partir de vraies entrées, cas limites et cas adverses compris, pas seulement d'exemples typiques.
- Pour chaque critère, retenir la façon de noter adaptée : le code quand la règle est objective, des humains ou des juges calibrés sinon.
- Fixer la barre de mise en production, et ce qui compte comme une régression, avant de voir le moindre score.
- Garder une partie des données de côté pour ne pas ajuster le prompt au jeu de test lui-même.
Erreurs fréquentes
- Livrer sur une impression tirée de quelques exemples choisis à la main.
- Présenter un score moyen qui masque des échecs graves sur un petit segment.
- Ne jamais enrichir le jeu de test alors que l'usage réel révèle de nouveaux cas.
- Évaluer seulement hors ligne, sans jamais contrôler la qualité sur le trafic réel.
Pour aller plus loin dans Module
Les formations et les leçons qui traitent cette notion :