데이터셋: 임베딩 데이터/Paq 쌍

term_id: datasetembedding_datapaq_pairs

Category: training_techniques

Definition

PAQ(Pseudo-Answer Quality) 데이터셋은 위키백과에서 추출된 수백만 개의 자동 생성된 질문-답변 쌍으로 구성되어 있습니다. 이는 밀도 있는 검색기(Dense Retriever)를 훈련시키기 위해 특별히 설계되었으며, 고품질의 부정 샘플(Negative Samples)을 제공하여 검색 모델의 성능을 향상시키는 데 사용됩니다.

Summary

밀도 있는 문서 검색(Dense Passage Retrieval) 훈련을 위해 위키백과에서 파생된 대규모 질문-답변 쌍 데이터셋입니다.

Key Concepts

  • 밀도 있는 문서 검색(Dense Passage Retrieval)
  • 부정 샘플링(Negative Sampling)
  • 오픈 도메인 질문 응답(Open-Domain QA)
  • 위키백과 추출(Wikipedia Extraction)

Use Cases

  • 밀도 있는 검색기 훈련
  • 오픈 도메인 질문 응답
  • 검색 성능 벤치마킹