Zbiór danych: Bigcode/The Stack Dedup
term_id: datasetbigcodethe_stack_dedup
Category: basic_concepts
Definition
The Stack Dedup to specjalizowany podzbiór ogromnego repozytorium otwartego kodu źródłowego o nazwie The Stack. Stosuje rygorystyczne techniki usuwania duplikatów, aby wyeliminować redundancyjne fragmenty kodu, które mogłyby zniekształcić wyniki trenowania dużych modeli językowych.
Summary
Wersja zbioru danych The Stack po usunięciu duplikatów, przygotowana przez BigCode w celu wyeliminowania niemal identycznych fragmentów kodu i uzyskania czystszych danych do trenowania.
Key Concepts
- Usuwanie duplikatów (Deduplication)
- Modele językowe dla kodu (Code LLMs)
- Jakość danych (Data Quality)
- The Stack
Use Cases
- Trenowanie modeli generujących kod
- Benchmarkowanie zdolności programistycznych
- Redukcja redundancji w procesie trenowania