Dataset: Inbeddingsdata/PAQ-paren

term_id: datasetembedding_datapaq_pairs

Category: training_techniques

Definition

De PAQ (Pseudo-Answer Quality) dataset bevat miljoenen automatisch gegenereerde vraag-antwoordparen die zijn extraherend uit Wikipedia. Deze is specifiek ontwikkeld om dichte opzoekers te trainen door het verstrekken van.

Summary

Een grootschalige dataset van vraag-antwoordparen afgeleid van Wikipedia, ontworpen voor het trainen van dichte passage-opzoeking.

Key Concepts

  • Dichte passage-opzoeking
  • Negatieve steekproefneming
  • Open-domein V&A
  • Wikipedia-extractie

Use Cases

  • Het trainen van dichte opzoekers
  • Open-domein vraag-en-antwoord
  • Het benchmarken van opzoekprestaties