Nøjagtighed af citater
Nøjagtighed af citater er den andel af AI-genererede svar, hvis tilskrivninger navngiver den korrekte kilde og henviser til en fungerende side. En Tow Center-test fra 2025 af otte værktøjer over 1.600 forespørgsler returnerede forkerte svar på mere end 60 % af dem[1], med individuelle værktøjsrater fra 37 % til 94 %[2]. To fejlmåder tælles separat: navngivning af den forkerte udgiver og angivelse af en URL, der er fabrikeret eller død[3].
Tow Center-testene
Tow Center for Digital Journalism udførte to kontrollerede tests. Den første, i november 2024, fodrede ChatGPT med 200 ordrette citater fra 10 artikler fra hver af 20 udgivere og bad den om at identificere kilden. Den returnerede delvist eller helt forkerte tilskrivninger 153 gange og indrømmede, at den ikke kunne svare i 7 tilfælde[4]. Den anden, i marts 2025, gentog designet på tværs af otte chatbots, for 20 udgivere gange 10 artikler gange 8 værktøjer, eller 1.600 forespørgsler i alt[5]. Perplexity var mindst forkert med 37 %, Grok-3 mest forkert med 94 %[2]. Betalte niveauer besvarede flere prompts korrekt end gratis, og scorede stadig en højere fejlrate, fordi de erstattede afvisninger med selvsikre forkerte svar[6].
Nøjagtighed af omtale kontra nøjagtighed af link
Et svar kan tilskrive en kendsgerning til den korrekte udgiver og stadig give læseren et ødelagt link, så de to måles separat. Grok-3 producerede 154 citater, der førte til fejlsider ud af 200 svar[3]. En separat fejl navngiver en rigtig side, der er den forkerte kopi: værktøjer citerede syndikerede genudgivelser på aggregator-sider og, i et tilfælde, en plagieret kopi af en New York Times-artikel[7].
Replikationer
En undersøgelse fra 2025 udført af 22 public service-medieorganisationer på tværs af 18 lande og 14 sprog vurderede mere end 3.000 assistentsvar. Den fandt et betydeligt problem i 45 %, alvorlige kildeproblemer i 31 % og store nøjagtighedsproblemer i 20 %[8]. Resultaterne holdt på tværs af sprog og territorier[8]. Gemini scorede dårligst, med betydelige problemer i 76 % af sine svar[9].
AI Overviews
Googles AI Overviews revideres for påstandens troværdighed snarere end artikelidentifikation. En akademisk revision af 55.393 trending forespørgsler opdelte oversigterne i 98.020 atomare påstande og fandt 11,0 % uden støtte fra de citerede sider, med udeladelse som den dominerende fejl[10]. Tæt på 30 % af de citerede domæner vises aldrig i førstesideresultaterne ud over oversigten[11], så citeringspuljen er ikke det rangerende sæt. En evaluering fra 2026 over omkring 4.000 faktuelle spørgsmål fandt, at 91 % af oversigterne indeholdt det korrekte svar, mens kun 39 % var både korrekte og fuldt understøttet af deres kilder[12].
Data
Vis tallene (2)
| Punkt | % |
|---|---|
| Indeholder det korrekte svar | 91 |
| Korrekt og fuldt understøttet | 39 |
Referencer (12)
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, How ChatGPT Misrepresents Publisher Content, Tow Center for Digital Journalism
- AI Search Has a Citation Problem
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, How ChatGPT Misrepresents Publisher Content, Tow Center for Digital Journalism Arkiv
- News Integrity in AI Assistants, European Broadcasting Union and BBC Arkiv
- News Integrity in AI Assistants, European Broadcasting Union and BBC Arkiv
- Xu, Iqbal og Montgomery, Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact, arXiv:2605.14021 Arkiv
- Xu, Iqbal og Montgomery, Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact, arXiv:2605.14021 Arkiv
- Oumi, Study finds half of AI Overviews untrustworthy Arkiv
Senest opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.