Zbiór danych: Dane osadzające/Paq Pairs

term_id: datasetembedding_datapaq_pairs

Category: training_techniques

Definition

Zbiór danych PAQ (Pseudo-Answer Quality) zawiera miliony automatycznie generowanych par pytanie-odpowiedź wyodrębnionych z Wikipedii. Został specjalnie zaprojektowany do trenowania gęstych retrieverów, dostarczając (providing)…

Summary

Duży zbiór danych par pytanie-odpowiedź wywodzących się z Wikipedii, zaprojektowany do treningu gęstego pobierania fragmentów tekstu (dense passage retrieval).

Key Concepts

  • Gęste pobieranie fragmentów tekstu (Dense Passage Retrieval)
  • Próbkowanie negatywne (Negative Sampling)
  • Odpowiadanie na pytania w domenie otwartej (Open-Domain QA)
  • Wyodrębnianie z Wikipedii (Wikipedia Extraction)

Use Cases

  • Trenowanie gęstych retrieverów
  • Odpowiadanie na pytania w domenie otwartej
  • Benchmarkowanie wydajności pobierania