Dataset: Wikipedia
term_id: datasetwikipedia
Category: basic_concepts
Definition
Wikipedia è una delle collezioni più vaste e complete di conoscenze umane disponibili in formato testuale. Nell’ambito dell’IA, funge da fonte primaria per il pre-addestramento di grandi modelli linguistici, fornendo dati diversificati e ricchi di informazioni.
Summary
La vasta raccolta di testi di Wikipedia, che funge da corpus fondamentale per il pre-addestramento dei modelli linguistici e per attività di NLP intensive di conoscenza.
Key Concepts
- Corpus di pre-addestramento
- Base di conoscenza
- Diversità linguistica
Use Cases
- Pre-addestramento di modelli linguistici di base
- Collegamento e disambiguazione di entità
- Verifica dei fatti e recupero di conoscenze