Multimodal model

Sådan ved du om dit AI-værktøj kan læse billeder, lyd eller video, og hvad det betyder for jeres marketing.

Opdateret 15. september 2026Læsetid 5 min.Af Brian Brandt
Indhold
  1. Sådan virker multimodal model i praksis
  2. Hvorfor multimodal model betyder noget for marketingfolk
  3. Eksempel: Multimodal model hos en IT-ansvarlig der hjælper marketing
  4. Multimodal input vs. multimodal output: hvad er forskellen?
  5. Multimodal model er ikke det samme som billedgenerering eller DALL-E
  6. Sådan kommer du i gang med multimodal model
  7. Ofte stillede spørgsmål om Multimodal model

Multimodal model er en AI, der både kan tage imod og nogle gange skabe flere typer indhold end tekst, typisk billeder, lyd, tale eller video. Nogle modeller kan kun "se" (analysere et billede), andre kan kun generere (lave et billede). At en model er multimodal betyder ikke automatisk, at den gør begge dele for alle medier.

Sådan virker multimodal model i praksis

En multimodal model kombinerer evnen til at forstå flere slags input og nogle gange også at producere flere slags output. I praksis svarer det til en medarbejder, der både kan læse en mail, lytte til en optagelse og kigge på et produktfoto for at lave en kort beskrivelse. Når du giver den et billede som input, kan den for eksempel beskrive motivet, finde tekst i billedet eller vurdere kvalitet. Når den får en prompt til at generere, kan den lave et nyt billede, en lydfil eller et manuskript, hvis netop den model eller det værktøj understøtter outputtypen.

Hvorfor multimodal model betyder noget for marketingfolk

Du vil møde ordet, når du vil have AI til at læse et skærmbillede, beskrive et produktfoto, analysere et kundeserviceopkald eller transskribere et møde. Spørg altid: "Hvad kan modellen tage imod som input, og hvad kan den returnere som output?" Det er forskellen mellem at få en automatisk billedtekst og at kunne lade AI skabe nye produktbilleder til en kampagne. For marketing betyder det konkret, hvilke materialer du kan automatisere, og hvilke du stadig skal få en kollega eller et bureau til at lave.

Eksempel: Multimodal model hos en IT-ansvarlig der hjælper marketing

Mandag morgen, i virksomhedens digitale afdeling, sidder IT-ansvarlig Maria med opgaven om at gøre marketingteamets billedarkiv søgbart. Marketing har 1.200 produktbilleder og en række scannede tekniske tegninger fra 2018. Maria prøver et værktøj, der lover "billedforståelse" som input, men det viser sig at kunne genkende objekter i almindelige fotos, mens scannede tegninger giver upræcise resultater. Hun bruger også et andet modul, der lover billedgenerering for at lave varianter af produktbilleder til en A/B-test, men generationen kræver finjustering og kostbar gennemgang af rettigheder. Modstanden kommer hurtigt: billedkvalitet svinger, OCR på ældre PDF'er misser tekst, og generationen leverer ofte billeder, der kræver retouchering. Resultatet er en arbejdsgang, hvor Maria kombinerer automatisk tagging af standardfotos med manuel oprydning af scannede filer, og hvor beslutningen om at bruge genererede billeder udskydes til en senere pilot, fordi det kræver mere tid og juridisk klarhed.

Multimodal input vs. multimodal output: hvad er forskellen?

At en model kan "se" betyder, at den accepterer ikke-tekst input og kan tolke det: et foto, en lydfil eller en video. Den kan sige, hvad der er i billedet, transskribere tale eller finde scannede tal i en faktura. At en model kan "generere" betyder, at den kan skabe nyt medie, for eksempel lave en ny produktillustration, synthesize tale eller skabe en kort video. De to evner findes i forskellige kombinationer: nogle modeller kan begge dele i samme system, andre er sammensat af en forståelsesmodel plus en separat generator. Derfor er det vigtigt at spørge leverandøren: "Kan I både analysere vores filtype X og give output som Y?" En model, der analyserer billeder, er ikke nødvendigvis i stand til at lave professionelle billeder via billedgenerering.

Multimodal model er ikke det samme som billedgenerering eller DALL-E

Billedgenerering er en specifik funktion: at skabe nye billeder fra en tekstprompt eller reference, og eksempler på værktøjer er DALL-E. Multimodal model er et bredere begreb: den kan inkludere billedgenerering, men dækker også evnen til at forstå billeder, transskribere lyd og kombinere medier i ét svar. En model, der kan lave tekster med variabel "Temperatur" for kreativitet, behandler stadig typisk kun tekst ved justering af temperatur, mens kreative billedoutputs har andre indstillinger og begrænsninger. Den typiske fejl er at antage, at fordi en model kan generere billeder, så kan den også analysere alle billedtyper lige godt, eller omvendt.

Sådan kommer du i gang med multimodal model

  1. Kortlæg hvilke filtyper I vil bruge: fotos, scannede PDF'er, lydfiler eller video. Beslut jer for to konkrete opgaver til start, f.eks. automatisk billedtagging og møde-transskribering.
  2. Spørg leverandøren præcist hvad der er input og hvad der er output: kan deres model både "se" jeres scannede format og "generere" nye billeder, eller er det to forskellige moduler?
  3. Test med et lille sæt på 50 til 200 filer, inklusiv fejlene: dårlige fotos, gamle scannede dokumenter, baggrundsstøj i lyd.
  4. Bed om fejlrate-eksempler og estimer tid til manuel oprydning. Klargør ejerskab af genererede filer og rettigheder før brug i kampagner.

En multimodal model kan fylde et tomrum i arbejdsdagen... men den er ikke magi. Som en journalist med både kamera og diktafon kan den dække mere, men du skal stadig redigere og tage ansvar for kvaliteten.

Det er svært at læse sig til multimodal model. I kommer længere med en workshop, hvor I bygger på jeres egne opgaver. Valget om multimodal model er sjældent kun teknisk. Retningen sættes med AI-rådgivning.

Ofte stillede spørgsmål om Multimodal model

Kan ChatGPT se billeder?

Nogle varianter af ChatGPT og andre kommercielle tjenester understøtter billedinput, men det afhænger af modellen og den tjeneste, du bruger. Tjek leverandørens dokumentation for, hvilke filtyper der accepteres, og hvad modellen rent faktisk gør med billedet.

Er multimodal det samme som billedgenerering (f.eks. DALL-E)?

Nej. Billedgenerering er én funktion, hvor modellen skaber nye billeder fra en tekstprompt. Multimodal betyder, at modellen arbejder med flere medietyper som input og/eller output, og billedgenerering kan være en del af det, men er ikke altid inkluderet.

Kan vi bruge multimodal AI uden udviklere?

Ja, flere færdige værktøjer og platforme giver multimodal funktionalitet via brugervenlige grænseflader. Men for komplekse arbejdsgange eller integration med jeres systemer vil en teknisk person ofte være nødvendig.

Koster multimodal funktionalitet mere?

Ofte ja. Modeller og tjenester, der håndterer billeder, video eller lyd, kan være dyrere end rene tekstmodeller og kan kræve ekstra tid til opsætning og kvalitetssikring. Spørg om pris per filtype og om omkostninger til datarensning og manuel gennemgang.

Brian Brandt

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.

Relaterede ord i AI-ordbogen

Mangler der et ord, eller er der noget der er forkert?

Skriv til brian@aihero.dk eller ring på 28 35 84 54. Ordbogen bliver bedre af det.

Tilbage til ordbogen

AI, der kommer i drift. Én mail om måneden.

Brian skriver om, hvad der reelt virker med AI i danske virksomheder, set fra gulvet hos dem, der bruger det hver dag. Ingen hype, ingen nyhedsstrøm.

  • Konkrete eksempler: hvad der virkede, hvad det kostede, og hvad der gik galt
  • Værktøjer jeg selv bruger, testet i praksis, før de nævnes
  • Ét brev om måneden. Ikke mere. Afmeld når du vil.

Du får en mail, hvor du bekræfter din tilmelding. Vi deler aldrig din adresse, privatlivspolitik.