Inferensi Generasi Teks
term_id: text_generation_inference
Category: application_paradigms
Definition
Inferensi Generasi Teks (TGI) adalah kerangka kerja perangkat lunak khusus yang dirancang untuk melayani model bahasa besar (LLM) dengan latensi rendah dan throughput tinggi. TGI mengoptimalkan proses inferensi untuk generasi teks melalui teknik seperti batching kontinu dan paralelisme tensor.
Summary
Mesin penyiapan (serving engine) berkinerja tinggi yang dioptimalkan secara khusus untuk menerapkan model bahasa besar guna menghasilkan teks secara efisien dalam skala besar.
Key Concepts
- Batching Kontinu
- Paralelisme Tensor
- Penyiapan Latensi Rendah
- Penerapan LLM
Use Cases
- API chatbot tingkat produksi
- Layanan generasi konten waktu nyata
- Platform analisis teks throughput tinggi