Module
Module 6 sur 7Leçon 2 sur 2~19 min

Évaluer un agent sur des tâches, des essais et des trajectoires

Leçon 2 du module « Observer et évaluer un agent » de la formation « Concevoir des agents et du tool calling fiables ».

Objectif de la leçon

À la fin de cette leçon, vous serez capable de concevoir l'évaluation d'un agent : tâches tirées de cas réels, correcteurs sur l'état final, invariants de trajectoire, essais multiples, métriques pass@k et pass^k, et seuils fixés avant la mesure.

Dans quel module

Observer et évaluer un agent

Comment reconstituer ce qu'a fait l'agent, et comment savoir qu'il est fiable ?

Leçons du module

  1. Spécifier la trace d'un run et ses métriques
  2. Évaluer un agent sur des tâches, des essais et des trajectoires (cette leçon)

Ce que vous apprendrez dans la formation

Cette leçon fait partie de la formation Concevoir des agents et du tool calling fiables

  • Décider, avec des critères explicites, si un cas d'usage relève d'un appel unique, d'un workflow ou d'un agent, et choisir le motif adapté.
  • Rédiger des fiches outils que le modèle utilise bien (nom, description, paramètres, retour, erreurs, idempotence, niveau de risque).
  • Spécifier la boucle d'un agent (objectif, contexte, conditions d'arrêt, budgets, gestion des erreurs) et juger le recours à un orchestrateur et à des sous-agents.
  • Placer les points de validation humaine et les permissions d'un agent selon le rayon d'impact de chaque action.
  • Identifier les chemins d'injection de prompt par les sorties d'outils et spécifier des parades structurelles, hors du seul prompt.
  • Spécifier la trace d'un run et l'évaluation d'un agent (succès de la tâche, trajectoire, coût, latence, régularité sur plusieurs essais).