Dataset:Bigcode/The Stack Dedup
term_id: datasetbigcodethe_stack_dedup
Category: basic_concepts
Definition
The Stack Dedup is een gespecialiseerde subset van The Stack, een enorme repository met opensourcecode. Het past rigoureuze deduplicatietechnieken toe om redundante codefragmenten te elimineren die grote taalmodellen kunnen vertekenen.
Summary
Een gededupliceerde versie van de Stack-dataset, samengesteld door BigCode om bijna-duplicaat codefragmenten te verwijderen voor schonere trainingsgegevens.
Key Concepts
- Deduplicatie
- Code-LLM’s
- Gegevenskwaliteit
- The Stack
Use Cases
- Het trainen van modellen voor codegeneratie
- Benchmarken van coderingscapaciteiten
- Vermindering van trainingsredundantie