Träningsdata kontra hämtning
Ett AI-svar bygger på två lagringsutrymmen: parametrarna som fastställts under träningen och dokument som hämtats vid svarstidpunkten. Vikterna innehåller en ögonblicksbild av webben som slutar vid ett klipp. Anthropic listar ett pålitligt kunskapsklipp i maj 2026 för Claude Opus 5[1], och Microsoft dokumenterar GPT-5 som tränad på data fram till den 30 september 2024[2]. Hämtning lägger till vad motorn kan hämta under förfrågan och tillhandahåller länkarna som visas som citat. Vilket lagringsutrymme som svarar på en given fråga avgör om ett varumärke återkallas, citeras eller saknas.
Två minnen
Parametriskt minne är vad en modell producerar utan verktyg: fakta komprimerade till vikter under träningen. Icke-parametriskt minne är en uppsättning dokument som hämtas vid frågetidpunkten och placeras i prompten, arrangemanget bakom hämtningsförstärkt generering. De misslyckas på olika sätt. En modell som reciterar från vikter kan inte visa en källa, och en hämtad sida kan citeras korrekt av en modell som aldrig såg den under träningen. Produktionsmotorer bär båda och bestämmer per fråga om de ska söka[3].
Kunskapsklipp
Leverantörer publicerar datumet. Anthropic listar ett pålitligt kunskapsklipp i juni 2026 för Claude Fable 5.1, maj 2026 för Claude Opus 5, januari 2026 för Claude Sonnet 5 och februari 2025 för Claude Haiku 4.5[1], och behandlar den siffran som skild från träningsdataklippet, och publicerar paret för varje modell i sin Transparency Hub snarare än i jämförelsetabellen[4]. Microsoft dokumenterar GPT-4.1 som tränad fram till den 31 maj 2024[5], GPT-5 till den 30 september 2024[2], GPT-5.5 till december 2025[6] och GPT-5.6 till juni 2026[7], ett gap som har minskat från ungefär elva månader till ungefär en. Det publicerade datumet är en övre gräns snarare än en beskrivning av vad en modell vet, eftersom effektiva klipp avviker från rapporterade när gamla sidor återkommer i nya genomsökningar och deduplicering missar nära dubbletter[8].
När en motor hämtar
Hämtning är ett verktygsanrop, och på de flesta plattformar bestämmer modellen. OpenAI dokumenterar att modellen väljer om den ska söka baserat på prompten, med tool_choice inställt på obligatoriskt när anroparen vill ha en sökning varje gång[3]. Google beskriver samma beteende för grundning[9]. Perplexity levererar motsatt standard och grundar varje svar[10]. En fråga om ett etablerat, väl täckt ämne kanske därför aldrig når en crawler, medan en fråga om veckans priser alltid gör det. Vad motorn gör efter att den bestämt sig för att söka behandlas i frågeutbredning.
Återkallande från vikter, citat från hämtning
Popularitet avgör vilket lagringsutrymme som svarar. På PopQA, en sond med 14 000 frågor, svarar modeller om välkända entiteter från vikter ensamma och misslyckas på den långa svansen, och skalan minskar inte gapet[11]; hämtningsförstärkta modeller slår modeller som är storleksordningar större där, medan oassisterade modeller håller stånd på populära entiteter[12]. En studie från 2025 av vision-språkmodeller pekar åt andra hållet: finjusterade modeller förlitar sig mer på memorerad träningsdata än hämtningsförstärkta, och svarar på WebQA-testuppsättningen med 72% mot 52%[13]. De två resultaten mäts på olika modaliteter och olika riktmärken. Ett mycket diskuterat varumärke kan nämnas utan att någon sida hämtas, och ett obskyrt kan citeras utan att kommas ihåg. Citatkvalitet är en tredje fråga: en granskning av fyra generativa sökmotorer fann att 51,5% av meningarna helt stöddes av deras citat[14] och 74,5% av citaten stödde meningen de satt på[15].
Varför båda är viktiga för GEO
De två vägarna kräver olika arbete. Närvaro vid träningstidpunkten kommer från att man skrivs om i hela korpusen som en crawler sveper, vilket är anledningen till att varumärkesomnämnanden på tredjepartswebbplatser räknas även om de inte har någon länk. Närvaro vid hämtningstidpunkten kommer från att man kan hämtas och citeras under förfrågan, vilket är vad AI-crawlers och innehållsaktualitet styr. Endast det andra är testbart inom ett kvartal: GEO-bench-studien mätte synlighetsvinster på upp till 40% från att skriva om källsidor[16], medan en träningskörning är fast och nästa är månader bort.
Referenser (16)
- Modellöversikt - Claude Docs Arkiv
- Foundry-modeller som säljs av Azure - Microsoft Learn Arkiv
- Webbsökning - OpenAI API-guider Arkiv
- Modellöversikt - Claude Docs Arkiv
- Foundry-modeller som säljs av Azure - Microsoft Learn Arkiv
- Foundry-modeller som säljs av Azure - Microsoft Learn Arkiv
- Foundry-modeller som säljs av Azure - Microsoft Learn Arkiv
- Dated Data: Tracing Knowledge Cutoffs in Large Language Models Arkiv
- Grundning med Google Sök - Gemini API-dokumentation Arkiv
- Perplexity API-översikt Arkiv
- When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories Arkiv
- When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories Arkiv
- Quantifying Memorization and Parametric Response Rates in Retrieval-Augmented Vision-Language Models
- Evaluating Verifiability in Generative Search Engines Arkiv
- Evaluating Verifiability in Generative Search Engines Arkiv
- GEO: Generative Engine Optimization Arkiv
Senast uppdaterad 2026-09-04. Skriven och underhållen av Baseline Labs.