데이터셋: 임베딩 데이터/Paq 쌍
term_id: datasetembedding_datapaq_pairs
Category: training_techniques
Definition
PAQ(Pseudo-Answer Quality) 데이터셋은 위키백과에서 추출된 수백만 개의 자동 생성된 질문-답변 쌍으로 구성되어 있습니다. 이는 밀도 있는 검색기(Dense Retriever)를 훈련시키기 위해 특별히 설계되었으며, 고품질의 부정 샘플(Negative Samples)을 제공하여 검색 모델의 성능을 향상시키는 데 사용됩니다.
Summary
밀도 있는 문서 검색(Dense Passage Retrieval) 훈련을 위해 위키백과에서 파생된 대규모 질문-답변 쌍 데이터셋입니다.
Key Concepts
- 밀도 있는 문서 검색(Dense Passage Retrieval)
- 부정 샘플링(Negative Sampling)
- 오픈 도메인 질문 응답(Open-Domain QA)
- 위키백과 추출(Wikipedia Extraction)
Use Cases
- 밀도 있는 검색기 훈련
- 오픈 도메인 질문 응답
- 검색 성능 벤치마킹