Scorers intégrés
Mastra fournit un ensemble complet de scorers intégrés pour évaluer les sorties d’IA. Ces scorers sont optimisés pour les scénarios d’évaluation courants et sont prêts à être utilisés dans vos agents et workflows.
Pour créer vos propres scorers, consultez le guide Scorers personnalisés.
Scorers disponiblesLien direct vers Scorers disponibles
Exactitude et fiabilitéLien direct vers Exactitude et fiabilité
Ces scorers évaluent l’exactitude, la véracité et l’exhaustivité des réponses de votre agent :
answer-relevancy: évalue dans quelle mesure les réponses répondent à la requête fournie (0-1, plus la valeur est élevée, mieux c’est)answer-similarity: compare les sorties de l’agent aux réponses de référence pour les tests CI/CD à l’aide d’une analyse sémantique (0-1, plus la valeur est élevée, mieux c’est)faithfulness: mesure la fidélité avec laquelle les réponses représentent le contexte fourni (0-1, plus la valeur est élevée, mieux c’est)hallucination: détecte les contradictions factuelles et les affirmations non étayées (0-1, plus la valeur est faible, mieux c’est)completeness: vérifie que les réponses incluent toutes les informations nécessaires (0-1, plus la valeur est élevée, mieux c’est)content-similarity: mesure la similarité textuelle par correspondance caractère par caractère (0-1, plus la valeur est élevée, mieux c’est)textual-difference: mesure les différences textuelles entre des chaînes (0-1, une valeur plus élevée indique une plus grande similarité)tool-call-accuracy: évalue si le LLM sélectionne le bon tool parmi les options disponibles (0-1, plus la valeur est élevée, mieux c’est)trajectory-accuracy: évalue la séquence d’actions attendue pour tous les types de span. Les spans couverts incluent l’activité des tools et des modèles, ainsi que les étapes des workflows (0-1, plus la valeur est élevée, mieux c’est)prompt-alignment: mesure l’alignement des réponses de l’agent avec l’intention, les exigences, l’exhaustivité et le format du prompt utilisateur (0-1, plus la valeur est élevée, mieux c’est)
Qualité du contexteLien direct vers Qualité du contexte
Ces scorers évaluent la qualité et la pertinence du contexte utilisé pour générer des réponses :
context-precision: utilise la précision moyenne (Mean Average Precision) pour évaluer le classement du contexte. Un contexte pertinent reçoit un score plus élevé lorsqu’il apparaît tôt (0-1, plus la valeur est élevée, mieux c’est)context-relevance: mesure l’utilité du contexte par niveaux de pertinence et suivi d’utilisation. Il détecte également les contextes manquants (0-1, plus la valeur est élevée, mieux c’est)
Sélection d’un scorer de contexte
- Utilisez Context Precision lorsque l’ordre du contexte compte et que vous avez besoin de métriques IR standard (idéal pour l’évaluation du classement RAG).
- Utilisez Context Relevance lorsque vous avez besoin d’une évaluation détaillée de la pertinence et souhaitez suivre l’utilisation du contexte et identifier les lacunes.
Les deux scorers de contexte prennent en charge :
- Contexte statique : tableaux de contexte prédéfinis
- Extraction de contexte dynamique : extrayez le contexte des runs avec des fonctions personnalisées (idéal pour les systèmes RAG, les bases de données vectorielles, etc.)
Qualité des sortiesLien direct vers Qualité des sorties
Ces scorers évaluent le respect des exigences de format, de style et de sûreté :
tone-consistency: mesure la cohérence du niveau de formalité, de complexité et du style (0-1, plus la valeur est élevée, mieux c’est)toxicity: détecte les contenus nuisibles ou inappropriés (0-1, plus la valeur est faible, mieux c’est)bias: détecte les biais potentiels dans la sortie (0-1, plus la valeur est faible, mieux c’est)keyword-coverage: évalue l’utilisation de la terminologie technique (0-1, plus la valeur est élevée, mieux c’est)
Vérifications rapidesLien direct vers Vérifications rapides
Micro-scorers sans LLM pour des assertions rapides et déterministes. Consultez le guide Vérifications rapides pour les détails d’utilisation.
checks.includes: attribue 1 si la sortie contient une sous-chaîne (0ou1)checks.excludes: attribue 1 si la sortie ne contient pas une sous-chaîne (0ou1)checks.equals: attribue 1 si la sortie correspond exactement à une chaîne (0ou1)checks.matches: attribue 1 si la sortie correspond à une expression régulière (0ou1)checks.similarity: similarité de chaînes via le coefficient de Dice (0-1, ou binaire avec un seuil)checks.calledTool: attribue 1 si un tool a été appelé au moins N fois (0ou1)checks.didNotCall: attribue 1 si un tool n’a pas été appelé (0ou1)checks.toolOrder: attribue 1 si les tools ont été appelés dans l’ordre (0ou1)checks.maxToolCalls: attribue 1 si le nombre d’appels de tools respecte la limite (0ou1)checks.usedNoTools: attribue 1 si aucun tool n’a été appelé (0ou1)checks.noToolErrors: attribue 1 si aucun appel de tool n’a produit d’erreur (0ou1)