Ordbog · AI
vLLM
Server til at køre åbne modeller effektivt, når mange forespørgsler skal besvares samtidig.
vLLM er en inferensserver. Den holder en åben model i hukommelsen og besvarer forespørgsler over et API, der ligner OpenAIs, så eksisterende kode ofte kan pege et andet sted hen uden at blive skrevet om. Det, der gør den hurtig ved mange samtidige brugere, er hukommelseshåndteringen: tidligere tokens opbevares i blokke, og nye forespørgsler føjes løbende til den kørende batch i stedet for at vente.
For en webshop er det kun relevant, hvis I kører modeller selv, typisk fordi data ikke må forlade huset, eller fordi volumen gør API-priserne tunge. Serveren løser hastighed og udnyttelse, ikke drift: grafikkort, opdateringer, overvågning og nedetid skal stadig nogen tage sig af. Mål gennemløb og svartid på jeres eget trafikmønster frem for på et benchmark.
I praksis
Vil I se, hvordan vi arbejder med vllm? Det hører til under AI.
Relaterede begreber