Ordbog · AI
RLHF
Træning med menneskelig feedback, der lærer modellen, hvilke svar der foretrækkes.
RLHF står for reinforcement learning from human feedback. Mennesker får flere svar på det samme spørgsmål og rangerer dem indbyrdes. Rangeringerne bruges til at træne en separat belønningsmodel, der lærer at forudsige, hvad mennesker foretrækker, og sprogmodellen justeres derefter, så den oftere rammer den slags svar. Det er trinnet, der gør en rå model til en brugbar assistent.
For en webshop er det sjældent noget, man selv gør, men det forklarer en del om, hvordan modellerne opfører sig. De er trænet til at give svar, mennesker kan lide, og det gør dem tilbøjelige til at være enige og til at lyde sikre på ting, de ikke ved. Stil derfor åbne spørgsmål frem for ledende, og bed om kilder, når svaret skal bruges til noget.
I praksis
Vil I se, hvordan vi arbejder med rlhf? Det hører til under AI.
Relaterede begreber