Ordbog · AI
Modelevaluering
Systematisk test af, hvor godt en model løser opgaven, målt på et fast sæt eksempler med kendt facit.
Evaluering er forskellen på en demo og en løsning i drift. Man samler et sæt rigtige eksempler med det rigtige svar, kører modellen på dem og måler, hvor ofte den rammer. Det gør det muligt at sammenligne modeller og prompts på tal i stedet for fornemmelser.
Sættet skal indeholde de svære tilfælde: tvetydige henvendelser, sjældne varegrupper, spørgsmål uden svar i materialet. Det er dem, der afgør, om løsningen kan stå alene, eller om et menneske skal ind over.
I praksis
Vil I se, hvordan vi arbejder med modelevaluering? Det hører til under AI.
Relaterede begreber