Aftaler om indholdslicensering
Aftaler om indholdslicensering er betalte aftaler, hvor en udgiver eller platform lader et AI-firma bruge dets materiale til modeltræning, til visning i genererede svar eller begge dele. Købere inkluderer OpenAI, Google, Meta, Microsoft, Amazon og Perplexity, og rapporterede værdier spænder fra $10 mio. fordelt på fem nyhedsredaktioner gennem Lenfest Institute[1] til mere end $250 mio. over fem år for News Corp[2]. Omkring et dusin krav mod OpenAI er blevet indgivet siden slutningen af 2023, så markedet bygges af kontrakt og af retssager på samme tid[3]. Hvorvidt en licens køber citation er et separat spørgsmål: Google knytter berettigelse til indeksering snarere end til kontrakter[4], og en offentliggjort revision af licenserede udgivere fandt ingen fordel ved attribution[5].
Hvad pengene køber
To forskellige rettigheder er til salg, ofte i samme kontrakt. Træningsrettigheder dækker indtagelse af et arkiv i en models vægte. Visningsrettigheder dækker opsummering af live-artikler og linkning til dem i et svarprodukt, hvilket er den halvdel, der kan returnere trafik. Under Associated Press' aftale med Google vil AP "levere et feed af realtidsinformation for at hjælpe med at forbedre brugbarheden af resultater vist i Gemini-appen"[6]. Nines aftale med Microsoft lader "Microsoft Copilot bruge sin journalistik i realtid, når den skaber AI-svar"[7], og Metas Reuters-aftale er formuleret på samme måde[8]. En tredje form betaler pr. brug i stedet for pr. arkiv: underskrevne udgivere under Perplexitys program "vil kunne dele de indtægter, der genereres af interaktioner, hvor deres indhold refereres"[9].
Rapporterede værdier
De fleste aftaler offentliggør intet. Af dem, der lækker et tal, blev News Corps OpenAI-aftale rapporteret til "mere end $250 mio. over fem år"[2], dens senere Meta-aftale til "op til $50 mio. pr. år i mindst tre år"[10], og New York Times' aftale med Amazon til "$20 mio. til $25 mio. pr. år"[11]. Mere faste tal kommer fra indberetninger. Reddit fortalte SEC i februar 2024, at det havde "indgået visse datalicensaftaler med en samlet kontraktværdi på $203,0 mio. og vilkår, der spænder fra to til tre år"[12]. Indtægtslinjen, som disse kontrakter sidder i, gik fra $15,2 mio. i 2023 til $140,0 mio. i 2025[13], og $143,7 mio. i fremtidige indtægter var stadig under kontrakt ved udgangen af 2025[14].
Hvorfor aftalerne eksisterer
Det kommercielle pres for at licensere kommer fra, at det åbne web lukker. En longitudinel revision af samtykkeprotokollerne bag de almindelige træningskorpora viste, at, hvis man tæller Terms of Service-crawlingrestriktioner snarere end robots.txt alene, er hele 45% af C4-korpusset nu begrænset[15]. En crawler, der kun læser filen, undervurderer, hvad webstedets egne vilkår forbyder, og en kontrakt er det, der lukker det hul.
Proveniens i de eksisterende korpora er svag i den anden retning. En revision, der sporede mere end 1.800 tekstdatasæt, fandt licensudeladelse over 70% og licensfejlprocenter over 50% på udbredte datasæt-hostingsteder[16], så en køber kan ikke alene ud fra den offentlige registrering fastslå, hvad et samlet korpus nogensinde fik lov til at indeholde. Se AI-crawlere for, hvordan restriktionerne udtrykkes.
Køber en licens citation
En kontrakt er ikke et rangeringssignal. Googles vejledning til udgivere siger, at "for at være berettiget til at blive vist som et understøttende link i AI Overviews eller AI Mode, skal en side være indekseret og berettiget til at blive vist i Google Søgning"[4], hvilket sætter crawling og indeksering foran enhver kommerciel aftale. Tow Center testede 200 citater fra 20 publikationer i ChatGPT og fandt, at det "returnerede delvist eller helt ukorrekte svar ved hundrede og treoghalvtreds lejligheder"[17]. Licenserede udgivere blev ikke skånet: New York Post og The Atlantic "har licensaftaler med OpenAI og muliggjorde adgang til alle crawlerne, men deres indhold blev ofte citeret unøjagtigt eller misrepræsenteret"[5]. En revision fra 2026 af citater for 44 Web3-virksomheder fandt, at eksponeringen var skæv mod "allerede fremtrædende stemmer"[18].
Adgang solgt som VVS
Nogle licenser sælger levering snarere end tilladelse. Wikimedia Enterprise sælger API'er, snapshots og realtidsstreams af Wikipedia-indhold, beskrevet som "Bygget til AI, søgning og vidensgrafer"[19]. Indholdet er allerede gratis at genbruge under en Creative Commons-licens, så det, køberne betaler for, er røret og serviceniveauet, ikke retten.
Licens eller sagsøg
De samme udgivere optræder på begge lister. Omkring seks sager er blevet anlagt mod Perplexity, og en føderal dommer afviste stort set et forslag om at afvise Reddits sag og sagde, at Reddit plausibelt havde anført, at Perplexity "konspirerede med mindst en af de tre dataskrabere for at omgå adgangskontroller og opnå Reddits materiale"[20].
Data
Vis tallene (3)
| Punkt | $m |
|---|---|
| 2023 | 15.2 |
| 2024 | 114.7 |
| 2025 | 140 |
Referencer (20)
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-funktioner og dit websted - Google Search Central Arkiv
- Hvordan ChatGPT Search (mis)repræsenterer udgiverindhold - Columbia Journalism Review Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
- Reddit, Inc. Form S-1 registreringserklæring Arkiv
- Reddit, Inc. Form 10-K, opdeling af indtægter efter kilde Arkiv
- Reddit, Inc. Form 10-K, indtægtsnote Arkiv
- Samtykke i krise: Den hurtige tilbagegang af AI Data Commons
- The Data Provenance Initiative: En storstilet revision af datasætlicensering og attribution i AI
- Hvordan ChatGPT Search (mis)repræsenterer udgiverindhold - Columbia Journalism Review Arkiv
- Når opmærksomhed bliver eksponering i generativ søgning Arkiv
- Wikimedia Enterprise Arkiv
- AI-aftaler med udgivere: fuld liste - Press Gazette Arkiv
Senest opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.