아부하기
Definition
아부하기(Sycophancy)는 대규모 언어 모델에서 발생하는 실패 사례로, 시스템이 정확한 정보를 제공하는 것보다 사용자를 기쁘게 하는 것을 우선시합니다. 이 …
Terms tagged with Evaluation
아부하기(Sycophancy)는 대규모 언어 모델에서 발생하는 실패 사례로, 시스템이 정확한 정보를 제공하는 것보다 사용자를 기쁘게 하는 것을 우선시합니다. 이 …
머신러닝에서 안정성은 훈련 데이터에 작은 교란(perturbations)이 가해졌을 때 모델의 성능과 매개변수가 견고하게 유지되는 성질을 의미합니다. 안정적인 …
MAUVE는 생성형 언어 모델의 출력이 인간 언어 사용과 얼마나 밀접하게 유사한지 평가하도록 설계된 통계적 측정치입니다. 단순한 퍼플렉시티(perplexity) …
홀드아웃 교차 검증(LOOCV)은 k가 데이터셋의 샘플 수와 같아지는 k-폴드 교차 검증의 특정 경우입니다. 이는 모델 성능에 대해 거의 편향되지 않은 추정을 …
データリーケージは、モデルが予測時には利用できない情報をトレーニング中に取得してしまう機械学習における重大なエラーです。これは通常、不適切なデータ分割や特徴量エンジニアリングによ …
LLM-as-a-Judge는 대형 언어 모델이 다른 모델들의 출력 품질에 대한 자동 평가자 역할을 수행하는 평가 패러다임입니다. …
인셉션 스코어(IS)은 생성 적대 신경망(GAN) 및 기타 생성 모델의 성능을 평가하기 위해 도입된 통계적 측정치입니다. 이는 두 가지 요소를 결합합니다: 이미 …
FrontierMath는 대규모 언어 모델의 복잡한 수학 문제 해결 한계를 테스트하기 위해 만들어진 전문 평가 스위트입니다. 표준 산술 벤치마크와 달리, 높은 …
이 분야에는 정확도, 정밀도, 재현율, F1 점수 및 ROC 곡선 아래 면적(AUC-ROC) 등의 지표를 분석하는 작업이 포함됩니다. 이는 모델이 두 클래스를 …
교차 검증은 기계 학습 모델의 성능을 추정하는 통계적 방법입니다. 가장 일반적인 형태는 k-폴드 교차 검증으로, 데이터를 k개의 동일한 부분으로 나눕니다. 모델 …
혼동 행렬은 알고리즘(일반적으로 지도 학습 모델)의 성능을 시각화하기 위해 사용되는 특정 표 레이아웃입니다. 이 표는 참 양성(True Positive), 참 …
이 용어는 TensorFlow, PyTorch, Scikit-learn, Keras 등 다양한 머신러닝 라이브러리 및 플랫폼에 대한 체계적인 평가와 벤치마킹을 …
이 지표는 카테고리 집합이 해당 카테고리 내 속성 값을 얼마나 잘 예측할 수 있는지를 정량화합니다. 이는 카테고리의 크기와 그 내부 구성 요소의 동질성(균일성) …
비용 함수 또는 오차 함수라고도 불리는 손실 함수는 모델의 성능이 얼마나 좋은지를 나타내는 스칼라 값을 제공합니다. …
분포 밖(OOD) 감지는 학습 데이터 분포의 범위를 벗어난 입력을 식별합니다. 모델은 종종 OOD 데이터에서 성능이 저하되거나 과도하게 확신하며 잘못된 예측을 …
인공지능에서 고품질은 일반적으로 높은 충실도, 낮은 노이즈, 강력한 일반화 능력을 갖춘 데이터나 모델 출력을 설명합니다. 고품질의 학습 데이터는 모델의 성능을 …
‘홀드아웃’ 데이터셋은 머신러닝 모델의 훈련 단계에서 의도적으로 제외된 예제들의 집합입니다. 이 부분집합은 모델이 보지 못한 데이 …
테스트 세트는 최종 모델의 일반화 능력을 평가하기 위해 훈련 과정에서 제외된 데이터의 일부입니다. …
점수는 정확도, 정밀도 또는 보상과 같은 특정 지표에 대해 머신러닝 모델이 얼마나 잘 수행되었는지 정량화합니다. 강화 학습에서는 누적 보상을 나타내며, 분류 작 …
AI 모델을 평가할 때 ‘전반적’ 지표는 고립된 구성 요소에 집중하기보다 시스템 성능에 대한 포괄적인 시각을 제공합니다. 여기에는 전체 정 …
인공지능에서 증거는 모델의 행동, 정확도 또는 효과성에 대한 주장을 뒷받침하는 경험적 데이터, 통계적 결과 또는 관찰 가능한 결과를 의미합니다. 이는 모델의 신 …
벤치는 서로 다른 AI 모델이나 알고리즘의 능력을 비교하기 위한 표준화된 참조점을 제공합니다. 일반적으로 큐레이션된 데이터셋과 정확도나 속도 같은 특정 평가 지 …
인공지능에서 벤치마크는 머신러닝 모델의 능력을 측정하도록 설계된 표준화된 테스트 스위트 또는 데이터셋입니다. 이는 서로 다른 모델을 비교하기 위한 일관된 프레임 …
AI의 맥락에서 분석은 근본적인 패턴을 이해하거나 문제를 진단하며, 실행 가능한 통찰을 도출하기 위해 데이터, …
환각은 생성형 AI 모델이 현실이나 원본 데이터에 기반하지는 않지만 그럴듯해 보이는 출력을 생성할 때 발생합니다. 이는 높은 정확도가 요구되는 애플리케이션에서 …