Dataset: Wikipedia

term_id: datasetwikipedia

Category: basic_concepts

Definition

Wikipedia er en av de største og mest omfattende samlingene av menneskelig kunnskap tilgjengelig i tekstformat. I kunstig intelligens fungerer det som en primær kilde for forhåndstrening av store språkmodeller, og gir detaljert verdenskunnskap.

Summary

Den enorme tekstsamlingen fra Wikipedia, som fungerer som en grunnleggende korpus for forhåndstrening av språkmodeller og kunnskapsintensive NLP-oppgaver.

Key Concepts

  • Forhåndstrening-korpus
  • Kunnskapsbase
  • Lingvistisk mangfold

Use Cases

  • Forhåndstrening av fundamentale språkmodeller
  • Entitetskobling og desambiguering
  • Faktagransking og kunnskapssøking