Évaluer un agent sur des tâches, des essais et des trajectoires
Leçon 2 du module « Observer et évaluer un agent » de la formation « Concevoir des agents et du tool calling fiables ».
Objectif de la leçon
À la fin de cette leçon, vous serez capable de concevoir l'évaluation d'un agent : tâches tirées de cas réels, correcteurs sur l'état final, invariants de trajectoire, essais multiples, métriques pass@k et pass^k, et seuils fixés avant la mesure.
Dans quel module
Observer et évaluer un agent
Comment reconstituer ce qu'a fait l'agent, et comment savoir qu'il est fiable ?
Leçons du module
- Spécifier la trace d'un run et ses métriques
- Évaluer un agent sur des tâches, des essais et des trajectoires (cette leçon)
Ce que vous apprendrez dans la formation
Cette leçon fait partie de la formation Concevoir des agents et du tool calling fiables
- Décider, avec des critères explicites, si un cas d'usage relève d'un appel unique, d'un workflow ou d'un agent, et choisir le motif adapté.
- Rédiger des fiches outils que le modèle utilise bien (nom, description, paramètres, retour, erreurs, idempotence, niveau de risque).
- Spécifier la boucle d'un agent (objectif, contexte, conditions d'arrêt, budgets, gestion des erreurs) et juger le recours à un orchestrateur et à des sous-agents.
- Placer les points de validation humaine et les permissions d'un agent selon le rayon d'impact de chaque action.
- Identifier les chemins d'injection de prompt par les sorties d'outils et spécifier des parades structurelles, hors du seul prompt.
- Spécifier la trace d'un run et l'évaluation d'un agent (succès de la tâche, trajectoire, coût, latence, régularité sur plusieurs essais).
Formations liées
- Créer un assistant IA pour votre produitConfirmé · ~3 h
- Concevoir une architecture RAG adaptée à son produitConfirmé · ~3 h 30 min
- Évaluer une fonctionnalité IA : jeux de test, métriques et LLM-jugeConfirmé · ~3 h