Sofistikering / Ydmygelse
Definition
Sofistikering er en fejlmåde hos store sprogmodeller, hvor systemet prioriterer at behage …
Terms tagged with Evaluation
Sofistikering er en fejlmåde hos store sprogmodeller, hvor systemet prioriterer at behage …
Inden for maskinlæring refererer stabilitet til robustheden af en models ydeevne og …
MAUVE er et statistisk mål designet til at vurdere, hvor tæt outputtet fra en generativ …
Leave-one-out krydsvalidering (LOOCV) er et specifikt tilfælde af k-fold krydsvalidering, …
Datatæring er en kritisk fejl inden for maskinlæring, hvor modellen får adgang til …
LLM som dommer er en evalueringsparadigme, hvor en stor sprogmodel fungerer som en …
Inception Score (IS) er et statistisk mål, der blev introduceret til at vurdere …
FrontierMath er en specialiseret evalueringssuite oprettet til at teste grænserne for …
Dette felt involverer analyse af metrikker såsom nøjagtighed (accuracy), præcision, …
Tværgående validering er en statistisk metode, der bruges til at estimere evnen hos …
En forvirringsmatrix er en specifik tabelstruktur, der gør det muligt at visualisere …
Dette begreb refererer til den systematiske vurdering og benchmarking af forskellige …
Denne metrik kvantificerer, hvor godt et sæt af kategorier tillader en at forudsige …
Også kendt som omkostnings- eller fejlfunktion, giver tabfunktionen en skalarværdi, der …
Detektion af out-of-distribution (OOD) data identificerer input, der falder uden for …
Inden for kunstig intelligens beskriver høj kvalitet typisk data eller modeloutput, der …
En ‘holdt tilbage’ (held-out) datasæt består af eksempler, der bevidst er …
Testdatasættet er en del af data, der holdes tilbage under træningsprocessen for at …
Scores kvantificerer, hvor godt en maskinlæringsmodel performer i forhold til specifikke …
Ved evaluering af AI-modeller giver ‘samlede’ målinger et helhedsbillede af …
Inden for kunstig intelligens refererer ‘bevis’ til empiriske data, …
Inden for kunstig intelligens er et benchmark en standardiseret testsuite eller …
Et benchmark fungerer som et standardiseret referencepunkt til at sammenligne evnerne hos …
I konteksten af AI refererer analyse til den systematiske undersøgelse af data, …
Hallucinationer opstår, når generative AI-modeller producerer output, der ser plausibelt …