데이터셋: Bigcode/The Stack Dedup

term_id: datasetbigcodethe_stack_dedup

Category: basic_concepts

Definition

The Stack Dedup은 오픈 소스 코드의 거대한 저장소인 The Stack의 특수 하위 집합입니다. 이는 대규모 모델의 편향을 유발할 수 있는 중복 코드 스니펫을 제거하기 위해 엄격한 중복 제거 기술을 적용합니다.

Summary

BigCode에서 관리하며, 더 깨끗한 훈련 데이터를 위해 거의 중복되는 코드 스니펫을 제거한 The Stack 데이터셋의 중복 제거 버전입니다.

Key Concepts

  • 중복 제거(Deduplication)
  • 코드 LLMs
  • 데이터 품질
  • The Stack

Use Cases

  • 코드 생성 모델 훈련
  • 코딩 능력 벤치마킹
  • 훈련 중복성 감소