Innholdslisensavtaler
Innholdslisensavtaler er betalte avtaler der en utgiver eller plattform lar et AI-selskap bruke materialet sitt til modelltrening, for visning i genererte svar, eller begge deler. Kjøpere inkluderer OpenAI, Google, Meta, Microsoft, Amazon og Perplexity, og rapporterte verdier varierer fra $10 millioner fordelt på fem nyhetsredaksjoner gjennom Lenfest Institute[1] til mer enn $250 millioner over fem år for News Corp[2]. Rundt et dusin krav mot OpenAI er innlevert siden slutten av 2023, så markedet bygges av kontrakt og søksmål samtidig[3]. Hvorvidt en lisens kjøper sitering er et separat spørsmål: Google knytter kvalifisering til indeksering snarere enn til kontrakter[4], og en publisert revisjon av lisensierte utgivere fant ingen attribusjonsfordel[5].
Hva pengene kjøper
To forskjellige rettigheter er til salgs, ofte i samme kontrakt. Treningsrettigheter dekker inntak av et arkiv i en modells vekter. Visningsrettigheter dekker oppsummering av live-artikler og lenking til dem i et svarprodukt, som er den delen som kan returnere trafikk. Under Associated Press-avtalen med Google vil AP "levere en strøm av sanntidsinformasjon for å ytterligere forbedre nytten av resultater vist i Gemini-appen"[6]. Nines avtale med Microsoft lar "Microsoft Copilot bruke journalistikken sin i sanntid når den lager AI-svar"[7], og Metas Reuters-avtale er formulert på samme måte[8]. En tredje form betaler per bruk i stedet for per arkiv: signerte utgivere under Perplexitys program "vil kunne dele inntektene generert av interaksjoner der innholdet deres refereres"[9].
Rapporterte verdier
De fleste avtaler offentliggjør ingenting. Av de som lekker et tall, ble News Corps OpenAI-avtale rapportert til "mer enn $250 millioner over fem år"[2], dens senere Meta-avtale til "opptil $50 millioner per år i minst tre år"[10], og New York Times-avtalen med Amazon til "$20 millioner til $25 millioner per år"[11]. Mer konkrete tall kommer fra innleveringer. Reddit fortalte SEC i februar 2024 at de hadde "inngått visse datalisensavtaler med en samlet kontraktsverdi på $203,0 millioner og vilkår som varierer fra to til tre år"[12]. Inntektslinjen disse kontraktene ligger i, gikk fra $15,2 millioner i 2023 til $140,0 millioner i 2025[13], og $143,7 millioner i fremtidige inntekter var fortsatt under kontrakt ved utgangen av 2025[14].
Hvorfor avtalene eksisterer
Det kommersielle presset for å lisensiere kommer fra at det åpne nettet stenger. En longitudinell revisjon av samtykkeprotokollene bak de vanlige treningskorporaene fant at, når man teller Terms of Service-gjennomsøkingsrestriksjoner snarere enn robots.txt alene, er hele 45 % av C4-korpuset nå begrenset[15]. En crawler som bare leser filen, undervurderer hva nettstedets egne vilkår forbyr, og en kontrakt er det som lukker dette gapet.
Proveniens i de eksisterende korporaene er svak i den andre retningen. En revisjon som sporet mer enn 1800 tekstdatasett, fant lisensutelatelse over 70 % og lisensfeilrater over 50 % på mye brukte datasettvertssteder[16], så en kjøper kan ikke ut fra offentlige registre alene fastslå hva et samlet korpus noensinne hadde tillatelse til å inneholde. Se AI-crawlere for hvordan restriksjonene uttrykkes.
Kjøper en lisens sitering
En kontrakt er ikke et rangeringssignal. Googles veiledning for utgivere sier at "for å være kvalifisert til å vises som en støttende lenke i AI-oversikter eller AI-modus, må en side være indeksert og kvalifisert til å vises i Google Søk"[4], noe som setter gjennomsøking og indeksering foran enhver kommersiell avtale. Tow Center testet 200 sitater fra 20 publikasjoner i ChatGPT og fant at det "returnerte delvis eller helt feilaktige svar ved hundre og femtitre anledninger"[17]. Lisensierte utgivere ble ikke spart: New York Post og The Atlantic "har lisensavtaler med OpenAI og tillot tilgang til alle crawlerne, men innholdet deres ble ofte sitert unøyaktig eller feilrepresentert"[5]. En revisjon fra 2026 av siteringer for 44 Web3-bedrifter fant at eksponeringen var skjev mot "allerede fremtredende stemmer"[18].
Tilgang solgt som rørleggerarbeid
Noen lisensieringer selger levering snarere enn tillatelse. Wikimedia Enterprise selger API-er, øyeblikksbilder og sanntidsstrømmer av Wikipedia-innhold, beskrevet som "Bygget for AI, søk og kunnskapsgrafer"[19]. Innholdet er allerede gratis å gjenbruke under en Creative Commons-lisens, så det kjøperne betaler for er røret og servicenivået, ikke retten.
Lisensier eller saksøk
De samme utgiverne vises på begge lister. Rundt seks saker er anlagt mot Perplexity, og en føderal dommer avviste i stor grad et forslag om å avvise Reddits sak, og sa at Reddit plausibelt hadde hevdet at Perplexity "konspirerte med minst en av de tre dataskraperne for å omgå tilgangskontroller og skaffe Reddits materiale"[20].
Data
Vis tallene (3)
| Punkt | $m |
|---|---|
| 2023 | 15.2 |
| 2024 | 114.7 |
| 2025 | 140 |
Referanser (20)
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-funksjoner og nettstedet ditt - Google Search Central Arkiv
- Hvordan ChatGPT Search (mis)representerer utgiverinnhold - Columbia Journalism Review Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
- Reddit, Inc. Form S-1 registreringserklæring Arkiv
- Reddit, Inc. Form 10-K, disaggregering av inntekter etter kilde Arkiv
- Reddit, Inc. Form 10-K, inntektsnotat Arkiv
- Samtykke i krise: Den raske nedgangen i AI-datakommunen
- Data Provenance Initiative: En storstilt revisjon av datasettlisensiering og attribusjon i AI
- Hvordan ChatGPT Search (mis)representerer utgiverinnhold - Columbia Journalism Review Arkiv
- Når oppmerksomhet blir eksponering i generativt søk Arkiv
- Wikimedia Enterprise Arkiv
- AI-avtaler med utgivere: full liste - Press Gazette Arkiv
Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.