Dataset:Embedding Data/Simple Wiki
term_id: datasetembedding_datasimple_wiki
Category: training_techniques
Definition
Dataset ini terdiri dari kalimat-kalimat dan paragraf yang diekstrak dari Simple English Wikipedia, yaitu versi Wikipedia yang ditulis untuk penutur bukan bahasa Inggris dengan tata bahasa dan kosakata yang disederhanakan. Dataset ini berfungsi sebagai
Summary
Sebuah dataset terkurasi yang berasal dari Simple English Wikipedia, digunakan untuk melatih dan mengevaluasi model embedding teks.
Key Concepts
- Embeddings Semantik
- Penyederhanaan Teks
- Korpus Wikipedia
- Benchmarking Model
Use Cases
- Melatih model embedding ringan
- Mengevaluasi kesamaan semantik dalam konteks sederhana
- Meningkatkan alat pemrosesan bahasa alami (NLP) agar lebih mudah diakses