내장 득점자
Mastra는 AI 출력을 평가하기 위한 완전한 내장 채점기 세트를 제공합니다. 이러한 채점자는 일반적인 평가 시나리오에 최적화되어 있으며 Agent 및 Workflow에서 사용할 수 있습니다.
자신만의 채점자를 만들려면 다음을 참조하세요.Custom Scorers guide.
사용 가능한 득점자사용 가능한 득점자에 대한 직접 링크
정확성과 신뢰성정확성과 신뢰성에 대한 직접 링크
이 채점자는 Agent의 답변이 얼마나 정확하고 진실하며 완전한지 평가합니다.
answer-relevancy: 응답이 입력 쿼리를 얼마나 잘 처리하는지 평가합니다(0-1, 높을수록 좋음)answer-similarity: 의미 분석을 사용하여 CI/CD 테스트의 정답과 Agent 출력을 비교합니다(0-1, 높을수록 좋음)faithfulness: 응답이 제공된 컨텍스트를 얼마나 정확하게 반영하는지 측정합니다(0-1, 높을수록 좋음)hallucination: 사실과의 모순과 근거 없는 주장을 감지합니다(0-1, 낮을수록 좋음)completeness: 응답에 필요한 정보가 모두 포함되어 있는지 확인합니다(0-1, 높을수록 좋음)content-similarity: 문자 수준 일치를 사용하여 텍스트 유사성을 측정합니다(0-1, 높을수록 좋음)textual-difference: 문자열 간의 텍스트 차이를 측정합니다(0-1, 높을수록 더 유사함)tool-call-accuracy: LLM이 사용 가능한 옵션 중 올바른 Tool을 선택하는지 평가합니다(0-1, 높을수록 좋음)trajectory-accuracy: Tool 및 Model 활동과 Workflow 단계를 포함한 모든 범위 유형에서 예상되는 작업 순서를 평가합니다(0-1, 높을수록 좋음)prompt-alignment: Agent 응답이 사용자 Prompt의 의도, 요구 사항, 완전성 및 형식에 얼마나 잘 부합하는지 측정합니다(0-1, 높을수록 좋음)
컨텍스트 품질컨텍스트 품질에 대한 직접 링크
이러한 채점자는 응답 생성에 사용된 맥락의 품질과 관련성을 평가합니다.
-
context-precision: 평균 정밀도의 평균을 사용하여 컨텍스트 순위를 평가합니다. 관련 컨텍스트가 앞에 나올수록 더 높은 점수를 받습니다(0-1, 높을수록 좋음) -
context-relevance: 관련성 수준과 사용량 추적을 통해 컨텍스트의 유용성을 측정합니다. 누락된 컨텍스트도 식별합니다(0-1, 높을수록 좋음) :::tip[컨텍스트 득점자 선택] -
컨텍스트 순서가 중요하고 표준 정보 검색 지표가 필요할 때는 Context Precision을 사용하세요(RAG 순위 평가에 적합).
-
관련성을 상세히 평가하고 컨텍스트 사용량을 추적하며 누락된 부분을 식별하려면 Context Relevance를 사용하세요. 두 컨텍스트 점수 측정기 모두 다음을 지원합니다.
-
정적 컨텍스트: 사전 정의된 컨텍스트 배열
-
동적 컨텍스트 추출: 사용자 정의 기능을 사용하여 실행에서 컨텍스트를 추출합니다(RAG 시스템, 벡터 데이터베이스 등에 이상적).
:::
출력 품질출력 품질에 대한 직접 링크
이러한 채점자는 형식, 스타일 및 안전 요구 사항에 대한 준수 여부를 평가합니다.
tone-consistency: 형식, 복잡성 및 스타일의 일관성을 측정합니다(0-1, 높을수록 좋음)toxicity: 유해하거나 부적절한 콘텐츠를 감지합니다(0-1, 낮을수록 좋음)bias: 출력에서 잠재적 편향을 감지합니다(0-1, 낮을수록 좋음)keyword-coverage: 기술 용어 사용을 평가합니다(0-1, 높을수록 좋음)
빠른 점검빠른 점검에 대한 직접 링크
빠르고 결정적인 어설션을 위한 Zero-LLM 마이크로 채점자입니다. 사용법은 빠른 검사 가이드를 참조하세요.
checks.includes: 출력에 하위 문자열이 포함되면 1점(0또는1)checks.excludes: 출력에 하위 문자열이 포함되지 않으면 1점(0또는1)checks.equals: 출력이 문자열과 정확히 같으면 1점(0또는1)checks.matches: 출력이 정규식과 일치하면 1점(0또는1)checks.similarity: Dice 계수를 사용한 문자열 유사성(0-1, 임계값을 사용하면 이진 점수)checks.calledTool: Tool이 N번 이상 호출되면 1점(0또는1)checks.didNotCall: Tool이 호출되지 않으면 1점(0또는1)checks.toolOrder: Tool이 순서대로 호출되면 1점(0또는1)checks.maxToolCalls: Tool 호출 횟수가 제한 이내이면 1점(0또는1)checks.usedNoTools: 호출된 Tool이 없으면 1점(0또는1)checks.noToolErrors: 오류가 발생한 Tool 호출이 없으면 1점(0또는1)