Model Serving
term_id: model_serving
Category: engineering_practice
Definition
Il model serving implica l’adozione di un modello addestrato statico e il suo incapsulamento in un’infrastruttura scalabile che gestisce le richieste in entrata, esegue l’inferenza e restituisce i risultati. Le sfide principali includono la gestione della latenza, l’ottimizzazione delle risorse computazionali e la garanzia di disponibilità elevata, assicurando che il modello possa rispondere alle richieste degli utenti in tempo reale o quasi reale.
Summary
Il processo di distribuzione di modelli di machine learning addestrati in ambienti di produzione per effettuare previsioni o generare output per gli utenti finali.
Key Concepts
- Inferenza
- Ottimizzazione della latenza
- Scalabilità
- Deploy (Implementazione)
Use Cases
- Motori di raccomandazione in tempo reale
- API per la classificazione di immagini
- Servizi di elaborazione del linguaggio naturale