정량화
Definition
AI 및 데이터 과학의 맥락에서 정량화는 텍스트, 이미지 또는 주관적인 의견과 같은 비수치 데이터를 측정 가능한 수치 값으로 변환하는 것을 의미합니다. 이 과정 …
Terms tagged with Preprocessing
AI 및 데이터 과학의 맥락에서 정량화는 텍스트, 이미지 또는 주관적인 의견과 같은 비수치 데이터를 측정 가능한 수치 값으로 변환하는 것을 의미합니다. 이 과정 …
인스턴스 선택은 중복되거나 노이즈가 있는 데이터 포인트를 제거하여 계산 효율성과 모델 성능을 향상시키는 것을 목표로 합니다. 특징 선택과 달리 이는 데이터셋의 …
피처 스케일링은 입력 변수의 범위를 표준화하여, 크기가 큰 피처가 학습 과정을 지배하는 것을 방지합니다. 일반적인 방법으로는 정규화(최소-최대 스케일링)와 표준 …
피처 엔지니어링은 도메인 전문 지식을 활용하여 원시 데이터를 머신러닝 알고리즘이 하위 패턴을 더 잘 파악할 수 있는 형태로 변환하는 기술입니다. 이 과정에는 기 …
피처 추출은 원시 데이터를 예측 모델이 더 잘 이해할 수 있는 피처 세트로 변환하여 모델의 정확도를 높이는 기술입니다. 이 기법은 데이터의 차원을 줄이고 노이즈 …
해시 트릭이라고도 불리는 피처 해싱은 머신러닝 모델이 피처와 인덱스 간의 명시적인 매핑 테이블을 유지하지 않고도 대규모 희소 피처 공간을 처리할 수 있게 해줍니 …
이 중요한 단계는 알고리즘이 입력과 출력 간의 관계를 학습할 수 있도록 원시 데이터 포인트에 의미 있는 메타데이터를 부착하는 것입니다. 예를 들어, 이미지 내 …
데이터 탐색(탐색적 데이터 분석, EDA라고도 함)은 머신러닝 워크플로우에서 중요한 사전 단계입니다. 이 과정은 주로 시각화 도구를 사용하여 데이터의 주요 특성 …
이 방법은 기존 샘플의 수정된 버전(예: 이미지 회전, 오디오 노이즈 추가, 텍스트 동의어 교체 등)을 생성하여 훈련 데이터셋을 인위적으로 확장합니다. 이를 통 …
청킹은 검색 증강 생성(RAG) 및 기타 NLP 파이프라인에서 중요한 전처리 단계입니다. 이는 컨텍스트 윈도우에 맞도록 텍스트를 고정 크기 또는 의미적 단위(청 …
토큰화는 구조화되지 않은 텍스트를 모델이 섭취하기 적합한 구조화된 데이터로 변환하는 자연어 처리(NLP)의 중요한 전처리 단계입니다. 이는 문장을 여러 단위로 …