Måling av AI-synlighet
Måling av AI-synlighet estimerer hvor ofte et merke eller en side vises i svarene til en svarsmotor, vanligvis ved å samle et fast sett med spørsmål og telle sitater eller merkevareomtaler. Det er vanskeligere enn rangsporing fordi overflaten er ustabil: å sende inn et identisk spørsmål på nytt gir bare en Jaccard-overlapping på 0,50 til 0,61 i de anbefalte merkene, og å parafrasere det samme kjøpsspørsmålet reduserer enigheten til mellom 0,135 og 0,288[1]. Et tall fra én kjøring er ikke sammenlignbart med et tall fra en annen.
Hvorfor én avlesning ikke er nok
Ustabiliteten er delvis mekanisk. Produksjonsinferens-endepunkter er ikke-deterministiske selv ved temperatur 0, fordi serverbelastning endrer batchstørrelsen og batchstørrelse-avhengige numeriske kjerner sender identiske forespørsler ned forskjellige flytpunktbaner[2]. Det er delvis søkeoverflaten. En empirisk studie av 11 500 spørringer på tvers av Google Søk, AI-oversikter og Gemini Flash 2.5 fant en AI-oversikt på 51,5 % av spørringene, basert på kilder med under 0,2 Jaccard-likhet med de organiske resultatene, og målbart mindre konsistent over to kjøringer av samme spørring[3]. Leverandøren Profound sporet 10 000 tilfeldig samplede spørsmål over 14 dager våren 2026, mot ChatGPT, Perplexity og Copilot, og rapporterte stabile resultater, med dag-i-uken-variasjon liten i forhold til forskjellene mellom motorene[4]. Et målepaper fra 2026 trekker den motsatte konklusjonen fra samme oppførsel: svar varierer på tvers av kjøringer, spørsmål og tid, så en engangsobservasjon er upålitelig og synlighet hører hjemme i en rapport som en distribusjon snarere enn et enkeltpunktsresultat[5].
Gapet tallene viser
En studie av mer enn 100 000 spørsmålssvar som dekker over 100 merker mellom mars og mai 2026, fant at ved et merkes første synlighetskjøring dukket globale husholdningsnavn opp i 73 % av relevante AI-svar, etablerte mellomstore og regionale merker i 44 %, og nisje- og småmerker i 11 %[6]. Det samme arbeidet fant at et merkes målte sentiment endrer seg mellom kjøringer omtrent 6,7 ganger oftere enn om merket i det hele tatt blir nevnt[7], så tilstedeværelsessporing er langt mer stabil enn tonesporing og bør rapporteres separat fra den.
En revisjon av omtrent 37 000 kommersielle anbefalingskjøringer plasserer feilen nederst på prominensstigen snarere enn jevnt fordelt over den: blant spesialist- og regionale merker dukket 48 % til 52 % aldri opp i noen kjøring av settet[8]. Et synlighetsprogram for et merke i det båndet måler fravær, og trenger nok kjøringer til å skille det fra samplingsstøy.
Fabrikkerte sitater øker med kjennskap
Måling må også ta hensyn til sitater som ikke eksisterer. En per-enhet biasstudie av 100 ungarske B2B-enheter, ved bruk av 1 400 prøvekjøringer over 2 062 kilder, fant at velkjente tier 1-merker produserte en fabrikkert sitatrate på 52,69 % mot 37,87 % for obskure tier 3-enheter (p = 1,67e-11)[9]. Modellens kjennskap til et merke gir selvsikre feil sitater snarere enn færre av dem, så en synlighetsscore trenger per-enhet kalibrering før den kan settes ved siden av et annet merkes. Sitatnøyaktighet dekker selve feilmodusen.
Språk og modell endrer begge svaret
En studie på 12 språk av 66 merker på tvers av tre modeller og 35 640 svar fant at overgang fra en engelsk spørring til et merkes hjemmemarkedsspråk økte anbefalingsandelen med 0,80 for lokale mestere, men bare 0,15 for globale multinasjonale selskaper. Svarstabiliteten varierte mer med hvilken modell som ble spurt enn med hvilket språk som ble brukt, med en eta-kvadrat på 0,32 mot 0,01[10]. Et program som sampler én modell på ett språk, har målt den kombinasjonen og ingenting bredere, noe som er det praktiske argumentet bak flerspråklig GEO.
Hva prøvene sier driver sitering
Et kontrollert eksperiment med 252 000 forsøk på tvers av seks modeller, som testet 18 innholdsfaktorer med merkevarenavn anonymisert slik at innholdseffekter kunne skilles fra posisjonsbias, fant at tematisk relevans og posisjon i den hentede listen var de sterkeste prediktorene for å bli sitert først[11]. Det grunnleggende GEO-papiret rapporterte at innholdsendringer kunne øke synligheten med opptil 40 %, med effektiviteten av strategiene varierende på tvers av domener[12]. Begge resultatene argumenterer for å måle per motor og per marked snarere enn å publisere ett synlighetstall; SEO og GEO dekker hvor mye av det som overlapper med rangsporing.
Data
Vis tallene (3)
| Punkt | % |
|---|---|
| Globale merker | 73 |
| Etablerte mellomstore merker | 44 |
| Nisje- og småmerker | 11 |
Referanser (12)
- Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline Arkiv
- Defeating Nondeterminism in LLM Inference Arkiv
- How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews Arkiv
- What AI Engines Actually Search For
- Don't Measure Once: Measuring Visibility in AI Search (GEO)
- Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines Arkiv
- Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines Arkiv
- Prominence-Stratified Failure Modes in Retrieval-Augmented Commercial Recommendation: A 37,000-Run Audit
- Per-Entity Bias Mapping for AI Visibility: Why Brand Mentions Require Entity-Specific Calibration Arkiv
- The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages Arkiv
- What Gets Cited: Competitive GEO in AI Answer Engines Arkiv
- GEO: Generative Engine Optimization Arkiv
Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.