Dataset: Wikipedia
term_id: datasetwikipedia
Category: basic_concepts
Definition
Wikipedia er en av de største og mest omfattende samlingene av menneskelig kunnskap tilgjengelig i tekstformat. I kunstig intelligens fungerer det som en primær kilde for forhåndstrening av store språkmodeller, og gir detaljert verdenskunnskap.
Summary
Den enorme tekstsamlingen fra Wikipedia, som fungerer som en grunnleggende korpus for forhåndstrening av språkmodeller og kunnskapsintensive NLP-oppgaver.
Key Concepts
- Forhåndstrening-korpus
- Kunnskapsbase
- Lingvistisk mangfold
Use Cases
- Forhåndstrening av fundamentale språkmodeller
- Entitetskobling og desambiguering
- Faktagransking og kunnskapssøking