Modellservering

term_id: model_serving

Category: engineering_practice

Definition

Modellservering innebærer å ta en statisk trent modell og pakke den inn i skalerbar infrastruktur som håndterer innkommende forespørsler, utfører inferens og returnerer resultater. Nøkkelfordringer inkluderer håndtering av latens, skalerbarhet og ressursbruk.

Summary

Prosessen med å distribuere trent maskinlæringsmodell i produksjonsmiljøer for å gjøre prediksjoner eller generere resultater for sluttbrukere.

Key Concepts

  • Inferens
  • Latensoptimalisering
  • Skalerbarhet
  • Distribusjon

Use Cases

  • Sanntids anbefalingssystemer
  • API-er for bildeklassifisering
  • Tjenester for naturlig språkbehandling