Citationsnoggrannhet
Citationsnoggrannhet är andelen AI-genererade svar vars attribueringar namnger rätt källa och leder till en fungerande sida. Ett Tow Center-test från 2025 av åtta verktyg över 1 600 frågor returnerade felaktiga svar på mer än 60 % av dem[1], med verktygsspecifika frekvenser från 37 % till 94 %[2]. Två felltyper räknas separat: att namnge fel utgivare och att ange en URL som är fabricerad eller död[3].
Tow Centers tester
The Tow Center for Digital Journalism genomförde två kontrollerade tester. Det första, i november 2024, matade ChatGPT med 200 ordagranna citat från 10 artiklar från vardera 20 utgivare och bad den att identifiera källan. Den returnerade delvis eller helt felaktiga attribueringar 153 gånger och medgav att den inte kunde svara vid 7 tillfällen[4]. Det andra, i mars 2025, upprepade designen över åtta chattbottar, för 20 utgivare gånger 10 artiklar gånger 8 verktyg, eller totalt 1 600 frågor[5]. Perplexity var minst felaktig med 37 %, Grok-3 mest felaktig med 94 %[2]. Betalda nivåer svarade mer korrekt än gratisnivåer och hade ändå en högre felfrekvens, eftersom de ersatte vägran med självsäkra felaktiga svar[6].
Omnämnandenoggrannhet kontra länknoggrannhet
Ett svar kan tillskriva ett faktum till rätt utgivare och ändå ge läsaren en trasig länk, så de två mäts separat. Grok-3 producerade 154 citat som ledde till felsidor av 200 svar[3]. Ett separat fel namnger en verklig sida som är fel kopia: verktyg citerade syndikerade återpubliceringar på aggregatorwebbplatser och, i ett fall, en plagierad kopia av en New York Times-artikel[7].
Replikationer
En studie från 2025 av 22 public service-medieorganisationer i 18 länder och 14 språk bedömde mer än 3 000 assistentsvar. Den fann ett betydande problem i 45 %, allvarliga källproblem i 31 % och stora noggrannhetsproblem i 20 %[8]. Resultaten höll över språk och territorier[8]. Gemini fick sämst resultat, med betydande problem i 76 % av sina svar[9].
AI-översikter
Googles AI-översikter granskas för påståendets trovärdighet snarare än artikelidentifiering. En akademisk granskning av 55 393 trendande frågor delade upp översikterna i 98 020 atomära påståenden och fann att 11,0 % inte stöddes av de citerade sidorna, med utelämnande som den dominerande felltypen[10]. Nära 30 % av de citerade domänerna förekommer aldrig i de första sidresultaten bredvid översikten[11], så citatpoolen är inte den rankningsuppsättning. En utvärdering från 2026 av cirka 4 000 faktiska frågor fann att 91 % av översikterna innehöll rätt svar medan endast 39 % var både korrekta och fullt stödda av sina källor[12].
Data
Visa siffrorna (2)
| Punkt | % |
|---|---|
| Innehåller det korrekta svaret | 91 |
| Korrekt och fullt stödd | 39 |
Referenser (12)
- Jazwinska och Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska och Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska och Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska och Chandrasekar, How ChatGPT Misrepresents Publisher Content, Tow Center for Digital Journalism
- AI Search Has a Citation Problem
- Jazwinska och Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska och Chandrasekar, How ChatGPT Misrepresents Publisher Content, Tow Center for Digital Journalism Arkiv
- News Integrity in AI Assistants, European Broadcasting Union och BBC Arkiv
- News Integrity in AI Assistants, European Broadcasting Union och BBC Arkiv
- Xu, Iqbal och Montgomery, Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact, arXiv:2605.14021 Arkiv
- Xu, Iqbal och Montgomery, Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact, arXiv:2605.14021 Arkiv
- Oumi, Study finds half of AI Overviews untrustworthy Arkiv
Senast uppdaterad 2026-09-04. Skriven och underhållen av Baseline Labs.