Skip to content

Træningsdata versus genfinding

Koncept inden for AI-søgning og SEO
I bevægelse Nogle fakta her ændrer sig over måneder og kontrolleres igen månedligt.Gennemgået 2026-09-04

Et AI-svar trækker på to lagre: parametrene, der er fastsat under træning, og dokumenter, der hentes på svarstidspunktet. Vægte bærer et øjebliksbillede af internettet, der stopper ved en grænse. Anthropic angiver en pålidelig vidensgrænse på maj 2026 for Claude Opus 5[1], og Microsoft dokumenterer GPT-5 som trænet på data op til den 30. september 2024[2]. Genfinding tilføjer, hvad motoren kan hente under anmodningen, og leverer de links, der vises som citater. Hvilket lager der besvarer en given forespørgsel, afgør, om et brand huskes, citeres eller er fraværende.

To hukommelser

Parametrisk hukommelse er, hvad en model producerer uden værktøjer: fakta komprimeret til vægte under træning. Ikke-parametrisk hukommelse er et sæt dokumenter, der hentes på forespørgselstidspunktet og placeres i prompten, arrangementet bag retrieval-augmented generation. De fejler forskelligt. En model, der reciterer fra vægte, kan ikke vise en kilde, og en hentet side kan citeres nøjagtigt af en model, der aldrig har set den under træning. Produktionsmotorer bærer begge og beslutter pr. forespørgsel, om de skal søge[3].

Vidensgrænser

Leverandører offentliggør datoen. Anthropic angiver en pålidelig vidensgrænse på juni 2026 for Claude Fable 5.1, maj 2026 for Claude Opus 5, januar 2026 for Claude Sonnet 5 og februar 2025 for Claude Haiku 4.5[1], og behandler dette tal som adskilt fra træningsdata-cutoffet, idet de offentliggør parret for hver model i deres Transparency Hub snarere end i sammenligningstabellen[4]. Microsoft dokumenterer GPT-4.1 som trænet til den 31. maj 2024[5], GPT-5 til den 30. september 2024[2], GPT-5.5 til december 2025[6] og GPT-5.6 til juni 2026[7], et hul, der er lukket fra cirka elleve måneder til omkring én. Den offentliggjorte dato er en øvre grænse snarere end en beskrivelse af, hvad en model ved, da effektive cutoffs afviger fra rapporterede, når gamle sider gentages i nye crawls, og deduplikering overser næsten-dubletter[8].

Når en motor henter

Genfinding er et værktøjskald, og på de fleste platforme beslutter modellen. OpenAI dokumenterer, at modellen vælger, om den skal søge baseret på prompten, med tool_choice indstillet til påkrævet, når den, der kalder, ønsker en søgning hver gang[3]. Google beskriver den samme adfærd for forankring[9]. Perplexity sender den modsatte standard og forankrer hvert svar[10]. Et spørgsmål om et afgjort, veldækket emne når derfor muligvis aldrig en crawler, mens et spørgsmål om denne uges priser altid gør. Hvad motoren gør, efter den beslutter at søge, er dækket i query fan-out.

Genkaldelse fra vægte, citat fra genfinding

Popularitet afgør, hvilket lager der svarer. På PopQA, en 14.000-spørgsmålsundersøgelse, svarer modeller om velkendte enheder fra vægte alene og fejler på den lange hale, og skala lukker ikke hullet[11]; retrieval-augmented modeller slår modeller, der er ordener af størrelse større der, mens uassisterede modeller holder stand på populære enheder[12]. En undersøgelse fra 2025 af vision-sprogmodeller peger den anden vej: finjusterede modeller er mere afhængige af memorerede træningsdata end retrieval-augmented modeller, og besvarer WebQA-testsættet med 72% mod 52%[13]. De to resultater måles på forskellige modaliteter og forskellige benchmarks. Et meget diskuteret brand kan nævnes uden at nogen side hentes, og et obskurt brand kan citeres uden at blive husket. Citatkvalitet er et tredje spørgsmål: en revision af fire generative søgemaskiner fandt, at 51,5% af sætningerne var fuldt understøttet af deres citater[14] og 74,5% af citaterne understøttede den sætning, de sad på[15].

Hvorfor begge dele er vigtige for GEO

De to veje kræver forskelligt arbejde. Tilstedeværelse under træning kommer fra at blive skrevet om på tværs af det korpus, en crawler gennemsøger, hvilket er grunden til, at brandomtaler på tredjepartswebsteder tæller, selv hvor de ikke indeholder et link. Tilstedeværelse under genfinding kommer fra at være hentbar og citerbar under anmodningen, hvilket er det, AI-crawlere og indholdsfriskhed styrer. Kun det andet kan testes inden for et kvartal: GEO-bench-undersøgelsen målte synlighedsgevinster på op til 40% fra omskrivning af kildesider[16], mens en træningskørsel er fast, og den næste er måneder væk.

Referencer (16)
  1. Oversigt over modeller - Claude Docs Arkiv
    Dokumentation Udgivet 2026-09-04 Hentet 2026-09-04
  2. Foundry-modeller solgt af Azure - Microsoft Learn Arkiv
    Dokumentation Udgivet 2026-08-26 Hentet 2026-09-04
  3. Websøgning - OpenAI API-guider Arkiv
    Dokumentation Udgivet 2026-09-04 Hentet 2026-09-04
  4. Oversigt over modeller - Claude Docs Arkiv
    Dokumentation Udgivet 2026-09-04 Hentet 2026-09-04
  5. Foundry-modeller solgt af Azure - Microsoft Learn Arkiv
    Dokumentation Udgivet 2026-08-26 Hentet 2026-09-04
  6. Foundry-modeller solgt af Azure - Microsoft Learn Arkiv
    Dokumentation Udgivet 2026-08-26 Hentet 2026-09-04
  7. Foundry-modeller solgt af Azure - Microsoft Learn Arkiv
    Dokumentation Udgivet 2026-08-26 Hentet 2026-09-04
  8. Daterede data: Sporing af vidensgrænser i store sprogmodeller Arkiv
    Akademisk Udgivet 2024-03-19 Hentet 2026-09-04
  9. Forankring med Google Søgning - Gemini API-dokumenter Arkiv
    Dokumentation Udgivet 2026-09-04 Hentet 2026-09-04
  10. Perplexity API-oversigt Arkiv
    Dokumentation Udgivet 2026-09-04 Hentet 2026-09-04 Enkeltkilde
  11. Hvornår man ikke skal stole på sprogmodeller: Undersøgelse af effektiviteten af parametriske og ikke-parametriske hukommelser Arkiv
    Akademisk Udgivet 2022-12-20 Hentet 2026-09-04
  12. Hvornår man ikke skal stole på sprogmodeller: Undersøgelse af effektiviteten af parametriske og ikke-parametriske hukommelser Arkiv
    Akademisk Udgivet 2022-12-20 Hentet 2026-09-04
  13. Kvantificering af memorisering og parametriske svarrater i retrieval-augmented vision-sprogmodeller
    Akademisk Udgivet 2025-02-19 Hentet 2026-09-04 Enkeltkilde
  14. Evaluering af verificerbarhed i generative søgemaskiner Arkiv
    Akademisk Udgivet 2023-04-19 Hentet 2026-09-04
  15. Evaluering af verificerbarhed i generative søgemaskiner Arkiv
    Akademisk Udgivet 2023-04-19 Hentet 2026-09-04
  16. GEO: Generativ søgemaskineoptimering Arkiv
    Akademisk Udgivet 2023-11-16 Hentet 2026-09-04

Sidst opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.

George
Online
0%