Ordbog · AI

Multimodal

Model, der kan arbejde med flere typer input og output, for eksempel tekst, billeder og lyd i samme samtale.

Multimodale modeller kan se et billede og beskrive det, læse en tabel fra et skærmbillede eller hente data ud af en faktura. For en webshop åbner det for opgaver som kvalitetstjek af produktbilleder, automatisk alt-tekst og udtræk fra leverandørdokumenter.

Kvaliteten varierer meget mellem opgaver. Tekstgenkendelse i billeder er blevet pålidelig, mens vurdering af æstetik og detaljer stadig kræver et menneske, hvis resultatet skal offentliggøres.

I praksis

Vil I se, hvordan vi arbejder med multimodal? Det hører til under AI.

Relaterede begreber