Model Serving

term_id: model_serving

Category: engineering_practice

Definition

Il model serving implica l’adozione di un modello addestrato statico e il suo incapsulamento in un’infrastruttura scalabile che gestisce le richieste in entrata, esegue l’inferenza e restituisce i risultati. Le sfide principali includono la gestione della latenza, l’ottimizzazione delle risorse computazionali e la garanzia di disponibilità elevata, assicurando che il modello possa rispondere alle richieste degli utenti in tempo reale o quasi reale.

Summary

Il processo di distribuzione di modelli di machine learning addestrati in ambienti di produzione per effettuare previsioni o generare output per gli utenti finali.

Key Concepts

  • Inferenza
  • Ottimizzazione della latenza
  • Scalabilità
  • Deploy (Implementazione)

Use Cases

  • Motori di raccomandazione in tempo reale
  • API per la classificazione di immagini
  • Servizi di elaborazione del linguaggio naturale