Zbiór danych: Wikipedia
term_id: datasetwikipedia
Category: basic_concepts
Definition
Wikipedia jest jednym z największych i najbardziej kompleksowych zbiorów ludzkiej wiedzy dostępnych w formacie tekstowym. W sztucznej inteligencji służy jako główne źródło do wstępnego trenowania dużych modeli językowych, dostarczając szerokiego kontekstu lingwistycznego i faktograficznego.
Summary
Ogromna kolekcja tekstów z Wikipedii, służąca jako podstawowy korpus do wstępnego trenowania modeli językowych oraz zadań NLP wymagających dużej ilości wiedzy.
Key Concepts
- Korpus do wstępnego trenowania
- Baza wiedzy
- Różnorodność językowa
Use Cases
- Wstępne trenowanie modeli językowych bazowych
- Łączenie encji i rozmywanie niejednoznaczności
- Weryfikacja faktów i wyszukiwanie wiedzy