Visuelt & multimodalt innhold
Søk er ikke bare tekst. Se hvordan dere optimaliserer bilder, video og infografikk for Google, Google Lens og AI-flatene som leser flere formater.
Søk har sluttet å være ren tekst. Folk peker kameraet mot en jakke og spør hvor de kan kjøpe den. De laster opp et bilde av en ødelagt del og spør hvordan de fikser den. De søker i YouTube fordi de vil se hvordan noe gjøres, ikke lese om det. Og AI-assistentene tar imot bilde og spørsmål i samme forespørsel.
Det er dette som menes med multimodalt søk: én forespørsel som kombinerer flere formater. For dere som jobber med SEO betyr det at bilder, video og grafikk ikke er pynt på siden. De er innhold som kan hentes, forstås og siteres på egne premisser.
Hva multimodalt søk faktisk er
Grunnlaget ble lagt med Googles Multitask Unified Model, MUM, som ble presentert i 2021. Modellen er både flerspråklig og multimodal: den forstår minst 75 språk, og den kan behandle informasjon fra ulike formater samtidig.

Målet var å redusere antall søk som trengs for å komme til svaret. Et sammensatt spørsmål krever i snitt rundt åtte søk før brukeren er fornøyd. Modellene som kom etter, både Googles egne og de generative assistentene, jobber mot samme mål: løse hele oppgaven i én runde.

Det praktiske resultatet ser dere i Google Lens: bilde og spørsmål kombinert gir bedre svar enn hver av dem alene. Mekanikken og flatene rundt visuelt søk går vi gjennom i guiden om visuelt søk.
Grunnarbeidet på bilder
Bilde-SEO er ikke komplisert, men det blir sjelden gjort ordentlig. Fem ting bærer nesten hele effekten.
Alt-teksten er den viktigste enkeltdelen. Den beskriver innholdet i bildet for skjermlesere og for maskiner som ikke ser det. Skriv hva bildet faktisk viser, ikke en liste med keywords. Detaljene ligger i guiden om alt-tagger.
Filnavnet skal si noe. joggesko-maraton-test.webp gir kontekst. IMG_4821.jpg gir ingenting.
Konteksten rundt bildet teller mer enn mange tror. Søkemotoren bruker overskriften, avsnittet og bildeteksten til å avgjøre hva bildet handler om. Et bilde som står alene mellom to urelaterte avsnitt, mister mesteparten av verdien.
Format og komprimering avgjør hastigheten. Lagre i WebP eller AVIF der det er mulig, og i komprimert JPG ellers. Bruk de dimensjonene bildet faktisk vises i. Skal produktbildet være 400 × 400 piksler, er det ingen grunn til å laste opp 3 000 piksler bredt. Tunge bilder er en av de vanligste årsakene til dårlige Core Web Vitals.
Strukturerte data og bilde-sitemap gjør bildene lettere å finne. Merk opp produkter, oppskrifter og bilder etter schema-typene som passer, og la sitemapet inkludere bildene. Oversikten ligger i guiden om strukturerte data.
Video: eget søkeunivers
Video er en søkeflate i seg selv, ikke bare et format på siden. YouTube er verdens nest største søkemotor, og videoresultater tar stadig mer plass i Googles vanlige resultatside.

Det viktigste valget tas før dere publiserer: hvor skal videoen ligge? Vil dere maksimere visninger, er YouTube riktig, fordi plattformen selv distribuerer. Vil dere ha trafikk og leads til nettstedet, skal videoen ligge hos dere, med YouTube som eventuell sekundær distribusjon.
Deretter er det håndverk: presis tittel og beskrivelse, en thumbnail som holder det den lover, videoer som er korte nok til å bli sett ferdig, en transkripsjon som gir søkemotorene tekst å lese, jevn publisering, og VideoObject-oppmerking. Google ser ikke en video og forstår innholdet. Teksten rundt den er det som gjør jobben. Hele oppskriften ligger i guiden om videooptimalisering.
Infografikk og datavisualisering
Grafikk gjør kompliserte poeng lette å oppfatte, og den er formatet folk oftest viser til. Egne tall i visuell form er blant de mest pålitelige måtene å tjene redaksjonelle lenker på.
Fellen er å legge all substansen inn i bildefilen. En AI-assistent som skal svare på et spørsmål, leser ikke tallene i grafikken deres. Den leser teksten rundt. Skriv derfor hovedtallene også i brødtekst eller tabell, og bruk grafikken til å gjøre dem forståelige. Verktøyene og kjørereglene finner dere i guiden om infografikk.
Hvorfor dette betyr mer nå enn før
Da MUM ble lansert, var konklusjonen vår at SEO ikke var i ferd med å forsvinne, men å skifte form. Det har holdt stikk. Fire endringer har festet seg:
- Spørsmålet har endret seg fra "hva må vi gjøre for å rangere" til "hva leter målgruppen etter". Formatet er en del av svaret, og det avgjøres samtidig med innholdet.
- Teamene ble bredere. Et fullverdig SEO-arbeid trenger strateg, tekstforfatter, designer, videoprodusent og utvikler. Ikke nødvendigvis fem personer, men fem kompetanser.
- Teknisk SEO ble viktigere. Indeksering, crawlbarhet og strukturerte data er det som gjør at innholdet i det hele tatt kan hentes av en modell.
- Bunnen av trakten ble avgjørende. Når toppen av kundereisen besvares direkte i søkeresultatene og i AI-svarene, er det de kommersielle sidene som må konvertere de besøkende som faktisk kommer inn.
Fem grep som virker
Fem steg vi bruker selv:
- Kartlegg hvilke formater målgruppen deres faktisk søker i. Se på hvilke resultattyper som ligger øverst på de viktigste søkene deres.
- Rydd i bildene: alt-tekst, filnavn, format og størrelse på de sidene som betyr mest kommersielt.
- Merk opp med strukturerte data, både for produkter, bilder og video.
- Lever samme tema i flere formater. Én grundig guide kan bli en video, en grafikk og et sett bilder som alle henter trafikk hver for seg.
- Dekk hele emnet, ikke ett keyword. Det er der både klassisk search og AI-flatene henter autoritet fra.
Skal noen produsere det visuelle innholdet med dere, dekker multimodalt innhold den jobben. Vil dere først se hvor dere står, ber dere om en gratis SEO-analyse.
