데이터셋: 야후 앵서스 토픽스
Definition
야후 앵서스 토픽스(Yahoo Answers Topics) 데이터셋은 더 큰 야후 앵서스 아카이브의 하위 집합으로, 명확한 주제 카테고리로 조직화된 질문과 답변 …
Terms tagged with Datasets
야후 앵서스 토픽스(Yahoo Answers Topics) 데이터셋은 더 큰 야후 앵서스 아카이브의 하위 집합으로, 명확한 주제 카테고리로 조직화된 질문과 답변 …
위키백과는 텍스트 형식으로 이용 가능한 인간 지식 중 가장 크고 포괄적인 컬렉션 중 하나입니다. 인공지능(AI) 분야에서 위키백과는 대규모 언어 모델을 사전 훈 …
TriviaQA는 오픈 도메인 질문 답변을 위해 설계된 데이터셋으로, 100만 개 이상의 질문과 해당 답변을 특징으로 합니다. 기존 모델에 도전하기 위해 제작되 …
WikiHow 데이터셋은 WikiHow 웹사이트에서 수집된 약 6만 개의 매뉴얼 형식 기사로 구성됩니다. 이 데이터셋은 추출형(abstractive) 텍스트 요 …
Helpsteer2는 NVIDIA가 공개한 선별된 데이터셋으로, 대규모 언어 모델(LLM)이 생성한 응답들의 쌍별 비교(pairwise comparisons) …
S2ORC는 시맨틱 스칼라에서 파생된 학술 자료의 포괄적인 코퍼스입니다. 다양한 과학 분야에 걸쳐 수백만 편의 논문들에 대해 전체 텍스트 내용, 메타데이터, 그 …
이 데이터셋은 현재 서비스 종료된 WikiAnswers 플랫폼에서 수집한 수백만 개의 질문-답변 쌍을 포함하고 있습니다. 주로 밀집 문서 검색(Dense …
PAQ(Pseudo-Answer Quality) 데이터셋은 위키백과에서 추출된 수백만 개의 자동 생성된 질문-답변 쌍으로 구성되어 있습니다. 이는 밀도 있는 검 …
Quora Question Pairs(QQP)는 쿼라 플랫폼에서 가져온 40만 개 이상의 질문 쌍으로 구성된 이진 분류(Binary Classification) …
이 데이터셋은 비모국어 화자를 위해 단순화된 문법과 어휘로 작성된 간단한 영어 위키백과에서 추출된 문장과 단락들로 구성됩니다. 복잡한 언어 구조를 피하므로, 임 …
문장 압축 데이터셋은 대상 문장이 원천 문장의 축약된 버전인 쌍들로 구성됩니다. 이러한 쌍들은 중복 정보를 제거하면서도 핵심 의미를 유지하도록 설계됩니다. 이 …
BookCorpus는 인터넷에서 수집한 10,000권 이상의 미출간 도서 텍스트 모음입니다. 이 데이터셋은 자연어 처리(NLP) 모델을 훈련하고 평가하기 위한 …
ELI5는 동일한 이름을 가진 레딧(Reddit) 커뮤니티에서 파생된 데이터셋입니다. 사용자가 제출한 질문과 커뮤니티 구성원들이 제공한 상세하고 단순화된 답변으 …
Altlex 데이터셋은 동일한 근본적인 의미를 공유하지만 서로 다른 어휘나 구문 구조를 사용하는 문장 쌍으로 구성됩니다. 주로 임베딩 모델 훈련에 활용됩니다. …
Flickr30K Captions은 시각적 내용을 설명하는 다섯 개의 고유한 영어 문장으로 주석이 달린 31,783장의 이미지로 구성된 널리 사용되는 벤치마크 …
The Stack Dedup은 오픈 소스 코드의 거대한 저장소인 The Stack의 특수 하위 집합입니다. …
AZFinText는 중국어 금융 텍스트 분석을 위해 특별히 선별된 대규모 주석이 달린 코퍼스입니다. 이 데이터셋에는 금융 감정이 라벨링된 뉴스 기사, 보고서, …