데이터셋: Bigcode/The Stack Dedup
term_id: datasetbigcodethe_stack_dedup
Category: basic_concepts
Definition
The Stack Dedup은 오픈 소스 코드의 거대한 저장소인 The Stack의 특수 하위 집합입니다. 이는 대규모 모델의 편향을 유발할 수 있는 중복 코드 스니펫을 제거하기 위해 엄격한 중복 제거 기술을 적용합니다.
Summary
BigCode에서 관리하며, 더 깨끗한 훈련 데이터를 위해 거의 중복되는 코드 스니펫을 제거한 The Stack 데이터셋의 중복 제거 버전입니다.
Key Concepts
- 중복 제거(Deduplication)
- 코드 LLMs
- 데이터 품질
- The Stack
Use Cases
- 코드 생성 모델 훈련
- 코딩 능력 벤치마킹
- 훈련 중복성 감소