Dataset: Bigcode/The Stack Dedup
term_id: datasetbigcodethe_stack_dedup
Category: basic_concepts
Definition
The Stack Dedup è un sottoinsieme specializzato di The Stack, un vasto repository di codice open source. Applica rigorose tecniche di deduplicazione per eliminare frammenti di codice ridondanti che potrebbero introdurre bias nei grandi modelli linguistici.
Summary
Una versione deduplicata del dataset The Stack, curata da BigCode per rimuovere frammenti di codice quasi duplicati e ottenere dati di addestramento più puliti.
Key Concepts
- Deduplicazione
- LLM per il codice
- Qualità dei dati
- The Stack
Use Cases
- Addestramento di modelli per la generazione di codice
- Benchmark delle capacità di codifica
- Riduzione della ridondanza nell’addestramento