Datová sada: BookCorpus
term_id: datasetbookcorpus
Category: basic_concepts
Definition
BookCorpus je sbírka textů z více než 10 000 nepublikovaných knih stažených z internetu. Slouží jako základní zdroj pro trénink a vyhodnocování modelů zpracování přirozeného jazyka (NLP), zejména v oblasti porozumění textu a generování.
Summary
Velká škálovatelná datová sada obsahující více než 10 000 nepublikovaných knih, široce používaná pro předtrénování modelů zpracování přirozeného jazyka.
Key Concepts
- Předtrénování NLP
- Textový korpus
- Jazykové modely
- Nepublikované knihy
Use Cases
- Předtrénování transformátorových modelů
- Vyhodnocování plynulosti jazyka
- Analýza literárních textů