Måling af AI-synlighed
Måling af AI-synlighed estimerer, hvor ofte et brand eller en side vises i svarene fra en svaremotor, normalt ved at sample et fast sæt prompter og tælle citater eller brandomtaler. Det er sværere end rangsporing, fordi overfladen er ustabil: genindsendelse af en identisk prompt returnerer kun en Jaccard-overlap på 0,50 til 0,61 i de anbefalede brands, og parafrasering af det samme købsspørgsmål reducerer overensstemmelsen til mellem 0,135 og 0,288[1]. Et tal fra én kørsel kan ikke sammenlignes med et tal fra en anden.
Hvorfor én aflæsning ikke er nok
Ustabiliteten er delvist mekanisk. Produktionsinferens-endepunkter er ikke-deterministiske selv ved temperatur 0, fordi serverbelastning ændrer batchstørrelsen, og batchstørrelsesafhængige numeriske kerner sender identiske anmodninger ned ad forskellige flydende-komma-stier[2]. Det er delvist søgeoverfladen. En empirisk undersøgelse af 11.500 forespørgsler på tværs af Google Søgning, AI Overviews og Gemini Flash 2.5 fandt en AI Overview på 51,5 % af forespørgslerne, baseret på kilder med under 0,2 Jaccard-lighed med de organiske resultater, og målbart mindre konsistent på tværs af to kørsler af den samme forespørgsel[3]. Leverandøren Profound sporede 10.000 tilfældigt samplede prompter over 14 dage i foråret 2026 mod ChatGPT, Perplexity og Copilot og rapporterede stabile resultater, hvor variationen på ugedage var lille i forhold til forskellene mellem motorerne[4]. En måleartikel fra 2026 drager den modsatte konklusion fra den samme adfærd: svar varierer på tværs af kørsler, prompter og tid, så en enkelt observation er upålidelig, og synlighed hører hjemme i en rapport som en fordeling snarere end et enkeltpunktsresultat[5].
Det gab, tallene viser
En undersøgelse af mere end 100.000 prompt-svar, der dækker over 100 brands mellem marts og maj 2026, viste, at ved et brands første synlighedskørsel optrådte globale husholdningsnavne i 73 % af relevante AI-svar, etablerede mellemstore og regionale brands i 44 %, og niche- og små brands i 11 %[6]. Det samme arbejde fandt, at et brands målte sentiment skifter mellem kørsler cirka 6,7 gange oftere end hvorvidt brandet overhovedet nævnes[7], så tilstedeværelsessporing er langt mere stabil end tonesporing og bør rapporteres separat fra den.
En revision af cirka 37.000 kommercielle anbefalingskørsler placerer fejlen nederst på prominensstigen snarere end jævnt fordelt over den: blandt specialist- og regionale brands dukkede 48 % til 52 % aldrig op i nogen kørsel af sættet[8]. Et synlighedsprogram for et brand i det bånd måler fravær og har brug for nok kørsler til at skelne det fra samplingstøj.
Falske citater stiger med kendskab
Måling skal også tage højde for citater, der ikke eksisterer. En bias-undersøgelse pr. entitet af 100 ungarske B2B-entiteter, ved hjælp af 1.400 prøvekørsler over 2.062 kilder, fandt, at velkendte tier 1-brands producerede en rate af falske citater på 52,69 % mod 37,87 % for obskure tier 3-entiteter (p = 1,67e-11)[9]. Modelfamiliaritet med et brand giver selvsikre forkerte citater snarere end færre af dem, så en synlighedsscore kræver kalibrering pr. entitet, før den kan sættes ved siden af et andet brands. Citatnøjagtighed dækker selve fejltypen.
Sprog og model ændrer begge svaret
En undersøgelse på 12 sprog af 66 brands på tværs af tre modeller og 35.640 svar viste, at en overgang fra en engelsk forespørgsel til et brands hjemmemarkedssprog øgede anbefalingsandelen med 0,80 for lokale mestre, men kun 0,15 for globale multinationale selskaber. Svarstabiliteten varierede mere med hvilken model, der blev spurgt, end med hvilket sprog, der blev brugt, med en eta-kvadreret på 0,32 mod 0,01[10]. Et program, der sampler én model på ét sprog, har målt den kombination og intet bredere, hvilket er det praktiske argument bag flersproget GEO.
Hvad prøverne siger driver citering
Et kontrolleret eksperiment med 252.000 forsøg på tværs af seks modeller, der testede 18 indholdsfaktorer med anonymiserede brandnavne, så indholdseffekter kunne adskilles fra positionsbias, fandt, at topisk relevans og position på den hentede liste var de stærkeste forudsigere for at blive citeret først[11]. Det grundlæggende GEO-papir rapporterede, at indholdsændringer kunne øge synligheden med op til 40 %, med strategiernes effektivitet varierende på tværs af domæner[12]. Begge resultater taler for at måle pr. motor og pr. marked snarere end at offentliggøre ét synlighedstal; SEO og GEO dækker, hvor meget af det der overlapper med rangsporing.
Data
Vis tallene (3)
| Punkt | % |
|---|---|
| Globale brands | 73 |
| Etablerede mellemstore brands | 44 |
| Niche- og små brands | 11 |
Referencer (12)
- Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline Arkiv
- Defeating Nondeterminism in LLM Inference Arkiv
- How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews Arkiv
- What AI Engines Actually Search For
- Don't Measure Once: Measuring Visibility in AI Search (GEO)
- Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines Arkiv
- Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines Arkiv
- Prominence-Stratified Failure Modes in Retrieval-Augmented Commercial Recommendation: A 37,000-Run Audit
- Per-Entity Bias Mapping for AI Visibility: Why Brand Mentions Require Entity-Specific Calibration Arkiv
- The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages Arkiv
- What Gets Cited: Competitive GEO in AI Answer Engines Arkiv
- GEO: Generative Engine Optimization Arkiv
Sidst opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.