EnglishSvenska
AI searchSwedenAI crawlers
Skrivet av · Huvudutvecklare
GEO · Svenska marknaden

Svenska är 0,61 % av träningsdatan. Sedan blockerade svenska medier sökbotarna också.

Fyra av tio svenskar använder AI-verktyg, och över hälften av dem frågar hellre en chattbot än Google. Frågan de sällan ställer sig är var svaret kommer ifrån. Det svenska underlaget är tunt från början, och de svenska sajter som skulle kunna fylla luckan har till stor del stängt dörren. Resultatet är att AI:n gärna svarar dig på svenska, men bygger svaret på något annat.

George, Baseline Labs maskot

Noll komma sextioen procent

CulturaX är ett av de städade flerspråkiga textbergen som används för att träna språkmodeller: 6,3 biljoner tokens fördelat på 167 språk. Engelska står för 2 846 970 578 793 tokens, alltså 45,13 % av alltihop. Svenska står för 38 486 181 494 tokens. Det är 0,61 %.

Kvoten är ungefär 74 till 1. För varje svensk mening modellen har sett har den sett omkring sjuttiofyra engelska. Det gör inte svenska till ett lågresursspråk i samma mening som färöiska, men det avgör vad modellen har läst mest om när den ska säga något om bolån, försäkringar eller vilken robotdammsugare som är bäst i test.

45,13%
av CulturaX är engelska
0,61%
av CulturaX är svenska
74×
mer engelsk text än svensk

"Men svenska Wikipedia är ju enormt"

Det stämmer, och det är det bästa motargumentet mot hela tesen. Svenska Wikipedia har 2 626 776 artiklar och är den femte största utgåvan i världen, före franska och långt före vad tio miljoner invånare rimligen borde producera.

Anledningen är en bot. Lsjbot, byggd av Sverker Johansson, massproducerade artiklar om arter och geografiska objekt. När svenska Wikipedia passerade en miljon artiklar 2013 hade boten skrivit 454 000 av dem, alltså nästan hälften av hela beståndet. Samma bot ligger bakom att cebuano, ett språk i Filippinerna, i dag har den näst största Wikipedian med 6,1 miljoner artiklar.

Volym är alltså inte samma sak som djup. En stubbe om en skalbagge är en artikel i statistiken men inte mycket att grunda ett svar på. Sverige har mängd men inte nödvändigtvis den sortens innehåll en modell lutar sig mot när någon frågar om en bransch.

2,6 milj
artiklar på svenska Wikipedia
5:e
största Wikipedia-utgåvan
454 000
artiklar skrivna av en enda bot till 2013

14 av 23 svenska nyhetssajter blockerar OpenAI:s sökbot

Det tunna underlaget skulle kunna kompenseras av att svenska medier syns i svaren. Vi läste därför robots.txt hos 24 svenska nyhets- och affärssajter den 5 augusti 2026. En gick inte att hämta. Av de 23 återstående blockerar 14 stycken OAI-SearchBot rakt av.

Det är den viktiga siffran, för OAI-SearchBot är inte träningsboten. Det är den bot som hämtar sidor när ChatGPT ska svara på en fråga just nu. Blockerar du den finns du inte som källa i svaret, oavsett hur bra ditt innehåll är.

SajtÄgareGPTBot (träning)OAI-SearchBot (svar)PerplexityBot
svt.seSVTBlockeradTillåtenTillåten
aftonbladet.seSchibstedTillåtenTillåtenBlockerad
svd.seSchibstedTillåtenTillåtenBlockerad
dn.seBonnier NewsBlockeradBlockeradBlockerad
expressen.seBonnier NewsBlockeradBlockeradBlockerad
di.seBonnier NewsBlockeradBlockeradBlockerad
sydsvenskan.seBonnier NewsBlockeradBlockeradBlockerad
nyteknik.seNy Teknik NewsBlockeradBlockeradBlockerad
omni.seSchibstedTillåtenTillåtenTillåten

En detalj värd att notera: Aftonbladet och SvD blockerar uttryckligen Google-Extended, CCBot, ClaudeBot och PerplexityBot, men har ingen egen regel för GPTBot alls. Den släpps alltså in av bara farten, via *-regeln. Det ser mindre ut som en linje och mer som en lista någon fyllt i vid ett tillfälle.

Mönstret följer ägarskap. Bonniers titlar stänger allt: DN, Expressen, Di, Sydsvenskan och HD blockerar både tränings- och hämtningsbotar, och Ny Teknik gör samma sak utanför den koncernen. Schibsteds titlar släpper in OpenAI men stänger ute Perplexity. Och SVT gör den distinktion som faktiskt är genomtänkt: träningsbotarna nekas, svarsbotarna välkomnas. SVT var den enda sajten i urvalet som uttryckligen tillät samtliga tre hämtningsbotar.

14 av 23
blockerar OpenAI:s hämtningsbot helt
18 av 23
blockerar träningsboten GPTBot
1 av 23
tillåter uttryckligen alla svarsbotar

Att blockera träning och att försvinna ur svaren är två olika saker

Det här är den dyraste missuppfattningen i branschen just nu, och den är lätt att göra. GPTBot, CCBot och Google-Extended samlar text till träning. Att stänga dem är ett rimligt förhandlingsbeslut om upphovsrätt och kostar dig ingenting i synlighet.

OAI-SearchBot, ChatGPT-User och PerplexityBot gör något helt annat. De hämtar sidan i samma sekund som en användare ställer en fråga, för att kunna citera den. Blockerar du dem har du inte skyddat ditt material, du har bara sett till att någon annan får svara i ditt ställe. Vi har skrivit mer om varför "blockera alla AI-botar" numera kostar dig synlighet.

De flesta av de fjorton sajterna ovan har med största sannolikhet fattat ett medvetet beslut om träningsdata och sedan tagit hämtningsbotarna på köpet. Effekten är densamma oavsett avsikt: när någon frågar ChatGPT om svensk ekonomi finns Dagens industri inte i rummet.

Vi byggde en egen modell, och storleken säger allt

Sverige har inte ignorerat problemet. AI Sweden byggde tillsammans med RISE och WASP GPT-SW3, i sex storlekar från 126 miljoner till 40 miljarder parametrar, uttryckligen för att kunna generera text på svenska och nordiska språk.

Det intressanta är skalan. Hela träningsmängden är 320 miljarder tokens, och den ska räcka till svenska, norska, danska, isländska, engelska och programkod tillsammans. Enbart den engelska delen av CulturaX är 2,85 biljoner tokens, alltså närmare nio gånger så mycket text för ett enda språk. Siffran säger mindre om GPT-SW3 än om vad ett litet språk har att arbeta med.

Vad det betyder om du driver ett svenskt företag

Slutsatsen är inte att ge upp. Den är att den svenska luckan är en öppning, eftersom få fyller den.

  1. Kontrollera din egen robots.txt först. Öppna den och leta efter OAI-SearchBot, ChatGPT-User och PerplexityBot. Om någon av dem har Disallow: / har du gjort dig osynlig i AI-svaren utan att nödvändigtvis mena det. Det tar fem minuter att rätta.
  2. Skriv det svenska underlaget som saknas. När 0,61 % av texten är på ditt språk är varje ordentlig svensk sida om din bransch oproportionerligt värdefull. Konkreta siffror, priser, jämförelser och årtal, inte marknadsföringsprosa.
  3. Räkna med att engelska källor konkurrerar om svenska frågor. Din konkurrent i AI-svaret är inte alltid ett annat svenskt företag. Det kan lika gärna vara en internationell sajt som råkar ha skrivit mer utförligt om ämnet.
  4. Börja med ChatGPT. Som vi visat tidigare äger ChatGPT den svenska AI-sökmarknaden med bred marginal. Där syns effekten först.

Det första steget är att veta hur du nämns i dag, och på vilket språk källorna bakom svaret är skrivna. De flesta svenska företag har aldrig kollat.

Se hur AI beskriver ditt varumärke

Frågor vi får om det svenska källäget

Betyder 0,61 % att AI:n är dålig på svenska?
Nej. Moderna modeller överför kunskap mellan språk, så svenskan i sig är oftast god. Det som påverkas är vilka källor och vilka fakta modellen har sett mest av. Språket i svaret kan vara felfritt medan innehållet bygger på en engelsk sida om en annan marknad.
Ni mätte robots.txt, men har ni mätt hur ofta .se-sajter faktiskt citeras?
Inte ännu, och vi säger det hellre rakt ut än antyder något vi inte mätt. Vår mätning här gäller vilka botar 23 svenska sajter släpper in, inte den slutliga citatandelen i svaren. Citatandelen för svenska frågor är nästa studie vi vill göra, och den finns såvitt vi vet inte publicerad någonstans i dag.
Bör jag släppa in träningsbotarna också?
Det är ett affärsbeslut, inte ett tekniskt. Att blockera GPTBot och Google-Extended kostar dig ingen synlighet i dagens AI-svar. Att blockera OAI-SearchBot gör det. Vill du hålla emot på upphovsrättsfronten kan du göra det utan att försvinna, precis som SVT gör.
Går er robots-mätning att göra om?
Ja, och det är meningen. Vi hämtade /robots.txt från 24 domäner den 5 augusti 2026 och tolkade grupperade User-agent-block med exakt agentnamn före jokertecknet *. Sveriges Radio svarade inte vid hämtningen och räknas därför inte. Robots-filer ändras, så siffrorna gäller det datumet.

Källor: CulturaX (Hugging Face), List of Wikipedias (Wikimedia Meta), Lsjbot, WASP, AI Sweden, GPT-SW3 40B modellkort och Svenskarna och internet 2025 (Internetstiftelsen). Robots.txt-mätningen är Baseline Labs egen, gjord 2026-08-05.

George
Online
0%