Zbiór danych: BookCorpus
term_id: datasetbookcorpus
Category: basic_concepts
Definition
BookCorpus to kolekcja tekstów pochodzących z ponad 10 000 niepublikowanych książek, zebranych z internetu. Stanowi ona fundamentalne źródło do trenowania i oceny modeli przetwarzania języka naturalnego (NLP).
Summary
Duży zbiór danych zawierający ponad 10 000 niepublikowanych książek, szeroko wykorzystywany do wstępnego trenowania modeli przetwarzania języka naturalnego.
Key Concepts
- Wstępne trenowanie NLP (NLP Pre-training)
- Korpora tekstowe (Text Corpus)
- Modele językowe (Language Models)
- Niepublikowane książki (Unpublished Books)
Use Cases
- Wstępne trenowanie modeli typu Transformer
- Ocena płynności językowej
- Analiza tekstów literackich