Mätning av AI-synlighet
Mätning av AI-synlighet uppskattar hur ofta ett varumärke eller en sida visas i svaren från en svarsmotor, vanligtvis genom att sampla en fast uppsättning uppmaningar och räkna citat eller varumärkesomnämningar. Det är svårare än rankningsspårning eftersom ytan är instabil: att skicka in en identisk uppmaning igen ger endast en Jaccard-överlappning på 0.50 till 0.61 i de rekommenderade varumärkena, och att parafrasera samma köpfråga sänker överensstämmelsen till mellan 0.135 och 0.288[1]. Ett nummer från en körning är inte jämförbart med ett nummer från en annan.
Varför en läsning inte räcker
Instabiliteten är delvis mekanisk. Produktionsinferens-slutpunkter är icke-deterministiska även vid temperatur 0, eftersom serverbelastningen ändrar batchstorleken och batchstorleksberoende numeriska kärnor skickar identiska förfrågningar längs olika flyttalsvägar[2]. Det är delvis sökyta. En empirisk studie av 11 500 sökfrågor över Google Sök, AI Overviews och Gemini Flash 2.5 fann en AI Overview på 51.5% av sökfrågorna, med källor som hade under 0.2 Jaccard-likhet med de organiska resultaten, och märkbart mindre konsekventa över två körningar av samma sökfråga[3]. Leverantören Profound spårade 10 000 slumpmässigt samplade uppmaningar under 14 dagar våren 2026, mot ChatGPT, Perplexity och Copilot, och rapporterade stabila resultat, med variationer under veckodagarna som var små jämfört med skillnaderna mellan motorerna[4]. Ett mätpapper från 2026 drar den motsatta slutsatsen från samma beteende: svar varierar över körningar, uppmaningar och tid, så en engångsobservation är opålitlig och synlighet hör hemma i en rapport som en distribution snarare än ett enpunktsresultat[5].
Gapet som siffrorna visar
En studie av mer än 100 000 prompt-svar som täckte över 100 varumärken mellan mars och maj 2026 fann att vid ett varumärkes första synlighetskörning dök globala hushållsnamn upp i 73% av relevanta AI-svar, etablerade medelstora och regionala varumärken i 44%, och nischade och små varumärken i 11%[6]. Samma arbete fann att ett varumärkes uppmätta sentiment skiftar mellan körningar ungefär 6.7 gånger oftare än om varumärket nämns överhuvudtaget[7], så närvarospårning är mycket stabilare än tonspårning och bör rapporteras separat från den.
En granskning av ungefär 37 000 kommersiella rekommendationskörningar placerar felet längst ner på framträdandestegen snarare än jämnt fördelat över den: bland specialist- och regionala varumärken dök 48% till 52% aldrig upp i någon körning av uppsättningen[8]. Ett synlighetsprogram för ett varumärke i det bandet mäter frånvaro och behöver tillräckligt många körningar för att skilja det från samplingsbrus.
Fabricerade citat ökar med förtrogenhet
Mätningen måste också ta hänsyn till citat som inte existerar. En partiskhetsstudie per entitet av 100 ungerska B2B-entiteter, med 1 400 testsökningar över 2 062 källor, fann att välkända varumärken i nivå 1 producerade en frekvens av fabricerade citat på 52.69% jämfört med 37.87% för obskyra entiteter i nivå 3 (p = 1.67e-11)[9]. Modellens förtrogenhet med ett varumärke ger säkra felaktiga citat snarare än färre av dem, så en synlighetspoäng behöver per-entitetskalibrering innan den kan jämföras med ett annat varumärkes. Citatnoggrannhet täcker själva felfunktionen.
Språk och modell ändrar båda svaret
En studie på 12 språk av 66 varumärken över tre modeller och 35 640 svar fann att övergång från en engelsk fråga till ett varumärkes hemspråk ökade rekommendationsandelen med 0.80 för lokala mästare men endast 0.15 för globala multinationella företag. Svarsstabiliteten varierade mer med vilken modell som tillfrågades än med vilket språk som användes, med en eta-kvadrat på 0.32 mot 0.01[10]. Ett program som samplar en modell på ett språk har mätt den kombinationen och inget bredare, vilket är det praktiska argumentet bakom flerspråkig GEO.
Vad proverna säger driver citat
Ett kontrollerat experiment med 252 000 försök över sex modeller, som testade 18 innehållsfaktorer med anonymiserade varumärkesnamn så att innehållseffekter kunde separeras från positionsbias, fann att ämnesrelevans och position i den hämtade listan var de starkaste prediktorerna för att citeras först[11]. Det grundläggande GEO-pappret rapporterade att innehållsförändringar kunde öka synligheten med upp till 40%, med strategiernas effektivitet varierande mellan domäner[12]. Båda resultaten talar för att mäta per motor och per marknad snarare än att publicera en synlighetssiffra; SEO och GEO täcker hur mycket av det som överlappar med rankningsspårning.
Data
Visa siffrorna (3)
| Punkt | % |
|---|---|
| Globala varumärken | 73 |
| Etablerade medelstora varumärken | 44 |
| Nisch- och små varumärken | 11 |
Referenser (12)
- Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline Arkiv
- Defeating Nondeterminism in LLM Inference Arkiv
- How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews Arkiv
- What AI Engines Actually Search For
- Don't Measure Once: Measuring Visibility in AI Search (GEO)
- Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines Arkiv
- Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines Arkiv
- Prominence-Stratified Failure Modes in Retrieval-Augmented Commercial Recommendation: A 37,000-Run Audit
- Per-Entity Bias Mapping for AI Visibility: Why Brand Mentions Require Entity-Specific Calibration Arkiv
- The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages Arkiv
- What Gets Cited: Competitive GEO in AI Answer Engines Arkiv
- GEO: Generative Engine Optimization Arkiv
Senast uppdaterad 2026-09-04. Skriven och underhållen av Baseline Labs.