Tập dữ liệu: Bookcorpus
term_id: datasetbookcorpus
Category: basic_concepts
Definition
BookCorpus là bộ sưu tập văn bản từ hơn 10.000 cuốn sách chưa xuất bản, được thu thập từ internet. Nó đóng vai trò là tài nguyên nền tảng cho việc huấn luyện và đánh giá các mô hình xử lý ngôn ngữ tự nhiên (NLP).
Summary
Một tập dữ liệu quy mô lớn chứa hơn 10.000 cuốn sách chưa từng xuất bản, được sử dụng rộng rãi để tiền huấn luyện các mô hình xử lý ngôn ngữ tự nhiên.
Key Concepts
- Tiền huấn luyện NLP
- Ngữ liệu văn bản
- Mô hình ngôn ngữ
- Sách chưa xuất bản
Use Cases
- Tiền huấn luyện các mô hình Transformer
- Đánh giá độ trôi chảy của ngôn ngữ
- Phân tích văn học