평가
term_id: evaluation
Category: basic_concepts
Definition
평가는 정량적 지표(예: 정확도, F1 점수, BLEU 점수)와 정성적 평가를 사용하여 AI 모델이 특정 작업에서 얼마나 잘 수행되는지를 체계적으로 측정하는 것을 포함합니다. 여기에는 검증 세트(Validation Set)를 통한 과적합 방지 확인, 일반화 능력 테스트, 그리고 모델의 실용적 유용성 검증이 포함됩니다.
Summary
평가는 미리 정의된 지표와 데이터셋을 기준으로 AI 모델의 성능, 정확도 및 강건성을 측정하는 과정입니다.
Key Concepts
- 지표(Metrics)
- 검증 세트
- 일반화
- 벤치마킹
Use Cases
- 초매개변수 튜닝 중 모델 버전 비교
- 공정성과 편향을 위한 모델 감사
- 규제 준수를 위한 AI 시스템 인증