Datasett: Bookcorpus
term_id: datasetbookcorpus
Category: basic_concepts
Definition
BookCorpus er en samling tekster fra over 10 000 upubliserte bøker, skrapet fra internett. Det fungerer som en grunnleggende ressurs for å trene og evaluere modeller for naturlig språkbehandling (NLP).
Summary
Et storskala datasett som inneholder over 10 000 upubliserte bøker, mye brukt til forhåndstrening av modeller for naturlig språkbehandling.
Key Concepts
- Forhåndstrening av NLP
- Tekstkorpora
- Språkmodeller
- Upubliserte bøker
Use Cases
- Forhåndstrening av transformer-modeller
- Vurdering av språkflyt
- Analyse av litterære tekster