Nøyaktighet i siteringer
Nøyaktighet i siteringer er andelen av AI-genererte svar der attribusjonene navngir riktig kilde og løses til en fungerende side. En test fra Tow Center i 2025 av åtte verktøy over 1600 spørsmål returnerte feil svar på mer enn 60 % av dem[1], med feilrater per verktøy fra 37 % til 94 %[2]. To feilmoduser telles separat: navngivning av feil utgiver, og oppgivelse av en URL som er fabrikkert eller død[3].
Tow Center-testene
Tow Center for Digital Journalism utførte to kontrollerte tester. Den første, i november 2024, matet ChatGPT 200 ordrette sitater hentet fra 10 artikler fra hver av 20 utgivere og ba den identifisere kilden. Den returnerte delvis eller helt feil attribusjoner 153 ganger og innrømmet at den ikke kunne svare ved 7 anledninger[4]. Den andre, i mars 2025, gjentok designet på tvers av åtte chatroboter, for 20 utgivere ganger 10 artikler ganger 8 verktøy, eller totalt 1600 spørsmål[5]. Perplexity var minst feil med 37 %, Grok-3 mest feil med 94 %[2]. Betalte nivåer svarte riktigere på flere spørsmål enn gratisnivåene og hadde likevel en høyere feilrate, fordi de erstattet avslag med selvsikre feil svar[6].
Nøyaktighet i omtaler kontra nøyaktighet i lenker
Et svar kan tilskrive et faktum til riktig utgiver og likevel gi leseren en ødelagt lenke, så de to måles separat. Grok-3 produserte 154 siteringer som førte til feilsider ut av 200 svar[3]. En separat feil navngir en ekte side som er feil kopi: verktøy siterte syndikerte republiseringer på aggregator-sider og, i ett tilfelle, en plagiert kopi av en New York Times-artikkel[7].
Replikasjoner
En studie fra 2025 utført av 22 offentlige medieselskaper i 18 land og 14 språk vurderte mer enn 3000 assistentsvar. Den fant et betydelig problem i 45 %, alvorlige kildeproblemer i 31 % og store nøyaktighetsproblemer i 20 %[8]. Resultatene holdt seg på tvers av språk og territorier[8]. Gemini scoret dårligst, med betydelige problemer i 76 % av svarene[9].
AI-oversikter
Googles AI-oversikter revideres med hensyn til påstandens troverdighet snarere enn artikkelidentifikasjon. En akademisk revisjon av 55 393 trendende spørsmål delte oversiktene inn i 98 020 atomiske påstander og fant at 11,0 % ikke ble støttet av de siterte sidene, med utelatelse som den dominerende feilen[10]. Nærmere 30 % av de siterte domenene vises aldri i førstesideresultatene ved siden av oversikten[11], så siteringspoolen er ikke rangeringssettet. En evaluering fra 2026 over omtrent 4000 faktaspørsmål fant at 91 % av oversiktene inneholdt riktig svar, mens bare 39 % var både riktige og fullt ut støttet av kildene sine[12].
Data
Vis tallene (2)
| Punkt | % |
|---|---|
| Inneholder riktig svar | 91 |
| Riktig og fullt støttet | 39 |
Referanser (12)
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, How ChatGPT Misrepresents Publisher Content, Tow Center for Digital Journalism
- AI Search Has a Citation Problem
- Jazwinska og Chandrasekar, AI Search Has A Citation Problem, Tow Center for Digital Journalism Arkiv
- Jazwinska og Chandrasekar, How ChatGPT Misrepresents Publisher Content, Tow Center for Digital Journalism Arkiv
- News Integrity in AI Assistants, European Broadcasting Union og BBC Arkiv
- News Integrity in AI Assistants, European Broadcasting Union og BBC Arkiv
- Xu, Iqbal og Montgomery, Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact, arXiv:2605.14021 Arkiv
- Xu, Iqbal og Montgomery, Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact, arXiv:2605.14021 Arkiv
- Oumi, Studie finner at halvparten av AI-oversiktene er upålitelige Arkiv
Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.