Svenska är 0,61 % av träningsdatan. Sedan blockerade svenska medier sökbotarna också.
Fyra av tio svenskar använder AI-verktyg, och över hälften av dem frågar hellre en chattbot än Google. Frågan de sällan ställer sig är var svaret kommer ifrån. Det svenska underlaget är tunt från början, och de svenska sajter som skulle kunna fylla luckan har till stor del stängt dörren. Resultatet är att AI:n gärna svarar dig på svenska, men bygger svaret på något annat.
Noll komma sextioen procent
CulturaX är ett av de städade flerspråkiga textbergen som används för att träna språkmodeller: 6,3 biljoner tokens fördelat på 167 språk. Engelska står för 2 846 970 578 793 tokens, alltså 45,13 % av alltihop. Svenska står för 38 486 181 494 tokens. Det är 0,61 %.
Kvoten är ungefär 74 till 1. För varje svensk mening modellen har sett har den sett omkring sjuttiofyra engelska. Det gör inte svenska till ett lågresursspråk i samma mening som färöiska, men det avgör vad modellen har läst mest om när den ska säga något om bolån, försäkringar eller vilken robotdammsugare som är bäst i test.
"Men svenska Wikipedia är ju enormt"
Det stämmer, och det är det bästa motargumentet mot hela tesen. Svenska Wikipedia har 2 626 776 artiklar och är den femte största utgåvan i världen, före franska och långt före vad tio miljoner invånare rimligen borde producera.
Anledningen är en bot. Lsjbot, byggd av Sverker Johansson, massproducerade artiklar om arter och geografiska objekt. När svenska Wikipedia passerade en miljon artiklar 2013 hade boten skrivit 454 000 av dem, alltså nästan hälften av hela beståndet. Samma bot ligger bakom att cebuano, ett språk i Filippinerna, i dag har den näst största Wikipedian med 6,1 miljoner artiklar.
Volym är alltså inte samma sak som djup. En stubbe om en skalbagge är en artikel i statistiken men inte mycket att grunda ett svar på. Sverige har mängd men inte nödvändigtvis den sortens innehåll en modell lutar sig mot när någon frågar om en bransch.
14 av 23 svenska nyhetssajter blockerar OpenAI:s sökbot
Det tunna underlaget skulle kunna kompenseras av att svenska medier syns i svaren. Vi läste därför robots.txt hos 24 svenska nyhets- och affärssajter den 5 augusti 2026. En gick inte att hämta. Av de 23 återstående blockerar 14 stycken OAI-SearchBot rakt av.
Det är den viktiga siffran, för OAI-SearchBot är inte träningsboten. Det är den bot som hämtar sidor när ChatGPT ska svara på en fråga just nu. Blockerar du den finns du inte som källa i svaret, oavsett hur bra ditt innehåll är.
| Sajt | Ägare | GPTBot (träning) | OAI-SearchBot (svar) | PerplexityBot |
|---|---|---|---|---|
| svt.se | SVT | Blockerad | Tillåten | Tillåten |
| aftonbladet.se | Schibsted | Tillåten | Tillåten | Blockerad |
| svd.se | Schibsted | Tillåten | Tillåten | Blockerad |
| dn.se | Bonnier News | Blockerad | Blockerad | Blockerad |
| expressen.se | Bonnier News | Blockerad | Blockerad | Blockerad |
| di.se | Bonnier News | Blockerad | Blockerad | Blockerad |
| sydsvenskan.se | Bonnier News | Blockerad | Blockerad | Blockerad |
| nyteknik.se | Ny Teknik News | Blockerad | Blockerad | Blockerad |
| omni.se | Schibsted | Tillåten | Tillåten | Tillåten |
En detalj värd att notera: Aftonbladet och SvD blockerar uttryckligen Google-Extended, CCBot, ClaudeBot och PerplexityBot, men har ingen egen regel för GPTBot alls. Den släpps alltså in av bara farten, via *-regeln. Det ser mindre ut som en linje och mer som en lista någon fyllt i vid ett tillfälle.
Mönstret följer ägarskap. Bonniers titlar stänger allt: DN, Expressen, Di, Sydsvenskan och HD blockerar både tränings- och hämtningsbotar, och Ny Teknik gör samma sak utanför den koncernen. Schibsteds titlar släpper in OpenAI men stänger ute Perplexity. Och SVT gör den distinktion som faktiskt är genomtänkt: träningsbotarna nekas, svarsbotarna välkomnas. SVT var den enda sajten i urvalet som uttryckligen tillät samtliga tre hämtningsbotar.
Att blockera träning och att försvinna ur svaren är två olika saker
Det här är den dyraste missuppfattningen i branschen just nu, och den är lätt att göra. GPTBot, CCBot och Google-Extended samlar text till träning. Att stänga dem är ett rimligt förhandlingsbeslut om upphovsrätt och kostar dig ingenting i synlighet.
OAI-SearchBot, ChatGPT-User och PerplexityBot gör något helt annat. De hämtar sidan i samma sekund som en användare ställer en fråga, för att kunna citera den. Blockerar du dem har du inte skyddat ditt material, du har bara sett till att någon annan får svara i ditt ställe. Vi har skrivit mer om varför "blockera alla AI-botar" numera kostar dig synlighet.
De flesta av de fjorton sajterna ovan har med största sannolikhet fattat ett medvetet beslut om träningsdata och sedan tagit hämtningsbotarna på köpet. Effekten är densamma oavsett avsikt: när någon frågar ChatGPT om svensk ekonomi finns Dagens industri inte i rummet.
Vi byggde en egen modell, och storleken säger allt
Sverige har inte ignorerat problemet. AI Sweden byggde tillsammans med RISE och WASP GPT-SW3, i sex storlekar från 126 miljoner till 40 miljarder parametrar, uttryckligen för att kunna generera text på svenska och nordiska språk.
Det intressanta är skalan. Hela träningsmängden är 320 miljarder tokens, och den ska räcka till svenska, norska, danska, isländska, engelska och programkod tillsammans. Enbart den engelska delen av CulturaX är 2,85 biljoner tokens, alltså närmare nio gånger så mycket text för ett enda språk. Siffran säger mindre om GPT-SW3 än om vad ett litet språk har att arbeta med.
Vad det betyder om du driver ett svenskt företag
Slutsatsen är inte att ge upp. Den är att den svenska luckan är en öppning, eftersom få fyller den.
- Kontrollera din egen robots.txt först. Öppna den och leta efter
OAI-SearchBot,ChatGPT-UserochPerplexityBot. Om någon av dem harDisallow: /har du gjort dig osynlig i AI-svaren utan att nödvändigtvis mena det. Det tar fem minuter att rätta. - Skriv det svenska underlaget som saknas. När 0,61 % av texten är på ditt språk är varje ordentlig svensk sida om din bransch oproportionerligt värdefull. Konkreta siffror, priser, jämförelser och årtal, inte marknadsföringsprosa.
- Räkna med att engelska källor konkurrerar om svenska frågor. Din konkurrent i AI-svaret är inte alltid ett annat svenskt företag. Det kan lika gärna vara en internationell sajt som råkar ha skrivit mer utförligt om ämnet.
- Börja med ChatGPT. Som vi visat tidigare äger ChatGPT den svenska AI-sökmarknaden med bred marginal. Där syns effekten först.
Det första steget är att veta hur du nämns i dag, och på vilket språk källorna bakom svaret är skrivna. De flesta svenska företag har aldrig kollat.
Se hur AI beskriver ditt varumärke
Frågor vi får om det svenska källäget
GPTBot och Google-Extended kostar dig ingen synlighet i dagens AI-svar. Att blockera OAI-SearchBot gör det. Vill du hålla emot på upphovsrättsfronten kan du göra det utan att försvinna, precis som SVT gör./robots.txt från 24 domäner den 5 augusti 2026 och tolkade grupperade User-agent-block med exakt agentnamn före jokertecknet *. Sveriges Radio svarade inte vid hämtningen och räknas därför inte. Robots-filer ändras, så siffrorna gäller det datumet.Källor: CulturaX (Hugging Face), List of Wikipedias (Wikimedia Meta), Lsjbot, WASP, AI Sweden, GPT-SW3 40B modellkort och Svenskarna och internet 2025 (Internetstiftelsen). Robots.txt-mätningen är Baseline Labs egen, gjord 2026-08-05.