Jeu de données : Wikipédia

term_id: datasetwikipedia

Category: basic_concepts

Definition

Wikipédia est l’une des collections de connaissances humaines les plus vastes et les plus complètes disponibles au format texte. En IA, elle sert de source principale pour le pré-entraînement des grands modèles de langage, fournissant des données diversifiées et riches.

Summary

La vaste collection de textes de Wikipédia, servant de corpus fondamental pour le pré-entraînement des modèles de langage et les tâches de TAL intensives en connaissances.

Key Concepts

  • Corpus de pré-entraînement
  • Base de connaissances
  • Diversité linguistique

Use Cases

  • Pré-entraînement des modèles de langage fondamentaux
  • Liaison d’entités et désambiguïsation
  • Vérification des faits et récupération de connaissances