본문으로 건너뛰기

내장 득점자

Mastra는 AI 출력을 평가하기 위한 완전한 내장 채점기 세트를 제공합니다. 이러한 채점자는 일반적인 평가 시나리오에 최적화되어 있으며 Agent 및 Workflow에서 사용할 수 있습니다.

자신만의 채점자를 만들려면 다음을 참조하세요.Custom Scorers guide.

사용 가능한 득점자
사용 가능한 득점자에 대한 직접 링크

정확성과 신뢰성
정확성과 신뢰성에 대한 직접 링크

이 채점자는 Agent의 답변이 얼마나 정확하고 진실하며 완전한지 평가합니다.

  • answer-relevancy: 응답이 입력 쿼리를 얼마나 잘 처리하는지 평가합니다(0-1, 높을수록 좋음)
  • answer-similarity: 의미 분석을 사용하여 CI/CD 테스트의 정답과 Agent 출력을 비교합니다(0-1, 높을수록 좋음)
  • faithfulness: 응답이 제공된 컨텍스트를 얼마나 정확하게 반영하는지 측정합니다(0-1, 높을수록 좋음)
  • hallucination: 사실과의 모순과 근거 없는 주장을 감지합니다(0-1, 낮을수록 좋음)
  • completeness: 응답에 필요한 정보가 모두 포함되어 있는지 확인합니다(0-1, 높을수록 좋음)
  • content-similarity: 문자 수준 일치를 사용하여 텍스트 유사성을 측정합니다(0-1, 높을수록 좋음)
  • textual-difference: 문자열 간의 텍스트 차이를 측정합니다(0-1, 높을수록 더 유사함)
  • tool-call-accuracy: LLM이 사용 가능한 옵션 중 올바른 Tool을 선택하는지 평가합니다(0-1, 높을수록 좋음)
  • trajectory-accuracy: Tool 및 Model 활동과 Workflow 단계를 포함한 모든 범위 유형에서 예상되는 작업 순서를 평가합니다(0-1, 높을수록 좋음)
  • prompt-alignment: Agent 응답이 사용자 Prompt의 의도, 요구 사항, 완전성 및 형식에 얼마나 잘 부합하는지 측정합니다(0-1, 높을수록 좋음)

컨텍스트 품질
컨텍스트 품질에 대한 직접 링크

이러한 채점자는 응답 생성에 사용된 맥락의 품질과 관련성을 평가합니다.

  • context-precision: 평균 정밀도의 평균을 사용하여 컨텍스트 순위를 평가합니다. 관련 컨텍스트가 앞에 나올수록 더 높은 점수를 받습니다(0-1, 높을수록 좋음)

  • context-relevance: 관련성 수준과 사용량 추적을 통해 컨텍스트의 유용성을 측정합니다. 누락된 컨텍스트도 식별합니다(0-1, 높을수록 좋음) :::tip[컨텍스트 득점자 선택]

  • 컨텍스트 순서가 중요하고 표준 정보 검색 지표가 필요할 때는 Context Precision을 사용하세요(RAG 순위 평가에 적합).

  • 관련성을 상세히 평가하고 컨텍스트 사용량을 추적하며 누락된 부분을 식별하려면 Context Relevance를 사용하세요. 두 컨텍스트 점수 측정기 모두 다음을 지원합니다.

  • 정적 컨텍스트: 사전 정의된 컨텍스트 배열

  • 동적 컨텍스트 추출: 사용자 정의 기능을 사용하여 실행에서 컨텍스트를 추출합니다(RAG 시스템, 벡터 데이터베이스 등에 이상적).

:::

출력 품질
출력 품질에 대한 직접 링크

이러한 채점자는 형식, 스타일 및 안전 요구 사항에 대한 준수 여부를 평가합니다.

  • tone-consistency: 형식, 복잡성 및 스타일의 일관성을 측정합니다(0-1, 높을수록 좋음)
  • toxicity: 유해하거나 부적절한 콘텐츠를 감지합니다(0-1, 낮을수록 좋음)
  • bias: 출력에서 잠재적 편향을 감지합니다(0-1, 낮을수록 좋음)
  • keyword-coverage: 기술 용어 사용을 평가합니다(0-1, 높을수록 좋음)

빠른 점검
빠른 점검에 대한 직접 링크

빠르고 결정적인 어설션을 위한 Zero-LLM 마이크로 채점자입니다. 사용법은 빠른 검사 가이드를 참조하세요.