Modellservering
term_id: model_serving
Category: engineering_practice
Definition
Modellservering innebærer å ta en statisk trent modell og pakke den inn i skalerbar infrastruktur som håndterer innkommende forespørsler, utfører inferens og returnerer resultater. Nøkkelfordringer inkluderer håndtering av latens, skalerbarhet og ressursbruk.
Summary
Prosessen med å distribuere trent maskinlæringsmodell i produksjonsmiljøer for å gjøre prediksjoner eller generere resultater for sluttbrukere.
Key Concepts
- Inferens
- Latensoptimalisering
- Skalerbarhet
- Distribusjon
Use Cases
- Sanntids anbefalingssystemer
- API-er for bildeklassifisering
- Tjenester for naturlig språkbehandling