Sommeren i Norden er snart over, og mens vi hadde ferie skjedde det mye på personvernfronten i EU. De har jo ferie litt senere. Det har vært så mye å skrive om at jeg har delt nyhetsbrevet for august i to. Her er først en del svært viktige nye retningslinjer fra EDPB – og så kommer det et brev til om kort tid med flere interessante avgjørelser. Men aller først – hva må vi vite om anonymisering fremover – hva er viktig med AI Act og AI omnibus og kan man trene AI på data fra internett nå?
Tror du at dine data er anonyme? Nye retningslinjer fra EDPB
7. juli 2026 publiserte EDPB sitt nye utkast til retningslinjer 02/2026 om anonymisering. Ved første øyekast kan det se ut som en teknisk oppdatering; en oppfriskning av retningslinjen fra artikkel 29-arbeidsgruppen fra 2014, med ny terminologi og oppdaterte vurderingskriterier. Men siden 2014 har det skjedd store endringer innen jus, personvern, teknologi, EU-domstolens rettspraksis og vi har fått kunstig intelligens. Alt dette spiller inn i de nye retningslinjene. De er på høring frem til 30. oktober 2026. Det er verdt å lese dem nøye – og meld inn kommentarer hvis du har noen.
Anonymitet er relativt – og det endrer alt
Det begrepet i retningslinjene som har fått mest oppmerksomhet, er det personvernspesialister kaller «relativ identifiserbarhet». Ideen springer direkte ut fra EU-domstolens dom fra 2025 i saken EDPS mot SRB, og EDPB bygger den nå inn i et fullstendig rammeverk. Informasjon kan være anonym for noen aktører, men ikke for andre. Det samme datasettet kan samtidig være personopplysninger for den organisasjonen som sitter på nøkkelen til reidentifisering, og reelt anonymt for en mottaker som ikke har noen realistisk mulighet til å knytte det til noen enkeltperson.
For eksempel kan informasjon entydig knyttes til en person, men bare én organisasjon kan faktisk identifisere denne personen. I dette tilfellet vil informasjonen anses som personopplysninger i organisasjonen, men den kan anses som anonym for alle andre. Den praktiske implikasjonen er betydelig: hvis du deler data med en mottaker som reelt sett ikke kan reidentifisere dem, kan det hende at GDPR ganske enkelt ikke gjelder for hva de gjør med dem. Det kreves ingen rettslig grunnlag. Ingen rettigheter for den registrerte. Ingen slettingsplikt. De kan i prinsippet bruke den til å trene AI-modeller.
Men før du tenker at dette løser alt, les videre. Retningslinjene inneholder nemlig viktige unntak.
Unntak for databehandlere
Ta et datasett og del det med en mottaker som behandler det etter dine instruksjoner. Dette kan typisk være en leverandør, en SaaS-leverandør eller en AI-partner som opererer under en databehandlingsavtale. Denne mottakeren er en databehandler. I henhold til retningslinjene identifiseres databehandleren med den behandlingsansvarlige. Hvis den behandlingsansvarlige kan gjenidentifisere enkeltpersoner i datasettet, er dataene også personopplysninger for databehandleren.
Med andre ord: relativ identifiserbarhet gjelder når data overføres til en uavhengig behandlingsansvarlig. Det gjelder ikke for databehandlere. (Her kan man spekulere i om dette er en direkte konsekvens av SRB-dommen, der mange antok at mottakeren var en egen behandlingsansvarlig, ikke en databehandler – selv om dette ikke fremgikk klart av dommen.)
En databehandler er altså bundet av den behandlingsansvarliges perspektiv, uavhengig av om databehandleren selv har noen realistiske muligheter til å reidentifisere noen.
Hvorfor er dette viktig? Fordi den eksisterende praksisen med å likestille databehandlere med behandlingsansvarlige vil fortsette.
To tilnærminger, én svært høy terskel
Retningslinjene angir at anonymitet kan vurderes på to måter: den kontekstuelle tilnærmingen, som tar hensyn til forskjellene i evner mellom de som kan identifisere den registrerte, og en mer forenklet tilnærming.
Den kontekstuelle tilnærmingen er den faktiske rettslige standarden, slik vi kjenner den i dag. Relevante enheter som kan identifisere enkeltpersoner, kan omfatte uautoriserte og ondsinnede aktører, herunder uredelige ansatte, undersøkende journalister, innenlandske og utenlandske etterretningstjenester, uetiske selskaper og nettkriminelle.
Det forventes at du vurderer om noen av dem, ved hjelp av midler det er rimelig sannsynlig at de vil bruke, kan reidentifisere enkeltpersoner fra datasettet ditt. Dette er i praksis en krevende oppgave.
I teorien er en forenklet tilnærming en snarvei: gå ut fra "worst case". Hvis "worst case" skjer – og opplysningene ikke kan reidentifiseres – så er de anonyme. Da trenger man ikke å gjøre ytterligere vurderinger. Men utfordringen er at et slikt scenario antakelig ikke er veldig sannsynlig. Jeg tror de fleste fremdeles må gjøre en kontekstuell vurdering.
Nye begreper på identifikasjonsanalysen
De velkjente kriteriene som ofte har vært brukt – "singling out" (utpeking), "linkability" (koblingsbarhet) og "inferens" – er erstattet av nye begreper.
Nå skrives det om "No Record Isolation"(«Ingen isolering»), «No Linkage» («Ingen kobling») og «No Inference» («Ingen inferens»). De nye formuleringene gjenspeiler bedre hvordan moderne reidentifisering fungerer.
«No Inference»-kriteriet er spesielt viktig. I en tid hvor AI-inferensangrep kan avgjøre om dataene til en bestemt person var inkludert i treningsdatasettet til en modell, har dette kriteriet reell betydning. En organisasjon som har trent en modell på personopplysninger og publisert den, kan ikke bare erklære resultatet anonymt uten videre. Inferensrisikoen følger dataene. Dette er så viktig at jeg har valgt å ta med litt tekst fra EDPB, se para 82:
[..]inference could also be drawn from data that has been aggregated to represent correlations between elements of the original information, rather than that information itself. This would, in particular, be the case for AI models or synthetic data. Specific inferences can be made by querying or prompting the given data with additional information to elicit new information about a particular individual. Where such an inference is also meaningful, this would be a violation of the No Inference criterion.
Konsekvensene av dette kan synes svært store – hvem kan unngå dette? - og jeg tror dette vil skape stort engasjement.
Anonymisering krever et rettslig grunnlag – og har alltid gjort det
Det å anonymisere noe er også en behandling av personopplysninger. Da må man ha et gyldig rettslig grunnlag for å anonymisere. Hvis datasettet ditt inneholder helseopplysninger, arbeidsrelaterte opplysninger eller annen informasjon i spesielle kategorier, trenger du også hjemmel i artikkel 9. Ingen av disse kravene er nye. I praksis blir de imidlertid ofte oversett. Det er lurt å sørge for at personvernerklæringer angir at personopplysninger vil bli behandlet for å produsere anonyme data som deretter faller utenfor GDPRs virkeområde.
Anonymisering er en prosess
Dette er noe som jeg tror ikke så veldig mange har forholdt seg til. Anonymisering er ikke en engangsforeteelse.
Sannsynligheten for reidentifisering øker vanligvis over tid på grunn av fremskritt i teknologien og teknikkene som brukes til reidentifisering, samt økt tilgjengelighet av tilleggsinformasjon. Hvis sannsynligheten for identifisering øker til et nivå som ikke lenger er ubetydelig, bør de tidligere anonyme opplysningene igjen betraktes som personopplysninger, og enheten vil være ansvarlig for all behandling av disse personopplysningene.
Hva betyr dette i praksis? En sikkerhetshendelse kan føre til en ny vurdering av anonymiteten dersom vurderingen av anonymiteten var avhengig av at visse opplysninger ble holdt konfidensielle. Med andre ord: et datainnbrudd hos en tredjepart, som er helt uten tilknytning til din organisasjon, kan umiddelbart forvandle et datasett du anså som anonymt til personopplysninger. Dette er en risiko mange organisasjoner ennå ikke har tatt med i beregningen i sin beredskapsplanlegging.
Hva dette betyr for din organisasjon
EDPBs nye retningslinjer forvandler anonymisering fra en teknisk engangsprosess til noe som ligner en løpende forpliktelse. Spørsmålet er ikke lenger bare om dataene dine er anonymisert. Det handler om hvorvidt du kontinuerlig kan påvise at de forblir det, i lys av teknologisk utvikling, ny tilleggsinformasjon og stadig mer avanserte evner hos alle aktører i kjeden som kan få tilgang til dem. Dette krever dokumentasjon, periodisk revurdering og et klart overblikk over hva databehandlerne og tredjeparts mottakere gjør med dataene du deler med dem.
Noen praktiske utgangspunkt som er verdt å vurdere:
- Gjennomgå eksisterende datasett som er beskrevet som «anonyme» eller «anonymiserte» opp mot det nye rammeverket
- Gjennomgå SaaS- og leverandørkontrakter som inneholder klausuler om produktforbedring eller AI-opplæring basert på «anonymiserte» kundedata
- Bekreft at anonymiseringsprosessene i seg selv har et dokumentert rettslig grunnlag i henhold til artikkel 6, og unntak i henhold til artikkel 9 der det er aktuelt.
- Innlem periodiske risikovurderinger av reidentifisering i kalenderen for compliance
- Hvis du har innspill til retningslinjene, avsluttes høringen 30. oktober 2026.
Du finner EDPBs retningslinjer her.
Pseudonymer, offentlige fora og grensene for anonymisering
Når vi snakker om anonymisering, illustrerer dette eksemplet hvor relativt begrepet kan være i praksis.
En østerriksk person la ut et innlegg om sin ADHD-diagnose på et offentlig tilgjengelig nettforum. Vedkommende brukte et pseudonym. Fra de fleste lesernes perspektiv var innlegget helt anonymt. Men én leser visste nøyaktig hvem som sto bak: vedkommende gjenkjente pseudonymet og videresendte innlegget til en felles kontakt via WhatsApp som koblet pseudonymet til den registrerte personens virkelige identitet.
Den registrerte klaget til den østerrikske datatilsynsmyndigheten og hevdet at vedkommendes helseopplysninger var blitt offentliggjort uten tillatelse. Datatilsynsmyndigheten avviste klagen. Begrunnelsen var basert på artikkel 9 nr. 2 bokstav e i GDPR, som tillater behandling av opplysninger i spesielle kategorier når den registrerte åpenbart har offentliggjort disse opplysningene. Datatilsynsmyndigheten konkluderte med at det å aktivt legge ut en diagnose på et offentlig tilgjengelig forum utgjorde nettopp en slik bevisst og entydig handling for å offentliggjøre opplysningene.
Den registrerte tok et bevisst valg om å legge ut sensitiv helseinformasjon på et offentlig tilgjengelig forum. Det faktum at vedkommende brukte et pseudonym, endrer ikke dette; informasjonen ble reelt gjort tilgjengelig for allmennheten. Saken understreker at pseudonymitet og anonymitet ikke er det samme, og fungerer som en advarsel om begrensningene ved pseudonymitet som personvernstrategi. Beskyttelsen som et pseudonym gir, er alltid bare så sterk som det svakeste leddet i kjeden av personer som kan gjenkjenne det.
Du kan lese mer om saken her.
Kostbar bot da «pseudonym» ikke var «anonym»
Nok en sak om anonymitet har kommet fra CNIL. Den 26. mai 2026 ila CNIL IQVIA Operations France en bot på 5 millioner euro for en rekke brudd knyttet til to helsedatavarehus som samlet inn data fra omtrent 14 000 apotek og flere tusen leger, og som dekket helseforløpet til titalls millioner pasienter over hele Frankrike.
Anonymiseringsargumentet som ikke holdt vann
Da CNIL gjorde tilsyn om hvordan personopplysninger ble brukt, henviste IQVIA til EU-domstolens SRB-dom og hevdet at dataene i selskapets datalager var anonyme, og at GDPR derfor ikke gjaldt.
CNIL avviste dette fullstendig. Hver pasient ble tildelt en unik identifikator som sporet behandlingsforløp over tid, og omfanget av innsamlede data var betydelig: diagnoser, symptomer, resepter, allergier, vekt, høyde, sosioøkonomisk status og mer. Reidentifisering ved hjelp av rimelige midler var mulig, særlig ved å krysshenvise til offentlig tilgjengelige data.
Det er også verdt å merke seg at før SRB-dommen hadde IQVIA aldri bestridt at de behandlet personopplysninger. De hadde aktivt søkt om og fått godkjenning fra CNIL for datavarehusene. Å deretter hevde at dataene var anonyme, var ikke helt heldig.
Utover anonymiseringsspørsmålet avdekket tilsynet flere avvik: det var ingen systemer for å oppdage unormal tilgang, ingen multifaktorautentisering, pasienter ikke informert om at dataene deres ble overført, og apotekprogramvare overførte kundedata til IQVIA selv der pasientene hadde nektet dette.
For enhver organisasjon som oppbevarer store datasett om helse eller atferd, er budskapet klart: pseudonymisering er et risikoreduserende tiltak, ikke en juridisk omklassifisering.
Du kan lese mer om saken her.
AI-lovens regler om åpenhet er TREDD i kraft – hva betyr det i praksis?
2. august 2026 trådte åpenhetsforpliktelsene i EUs AI-lov formelt tredd i kraft. Spørsmålet er ikke lenger «er vi klare?», men «overholder vi kravene?» Det er ikke hele forordningen som er i kraft – de viktigste forpliktelsene for AI-systemer med høy risiko ligger fortsatt frem i tid – men reglene som trådte i kraft denne måneden er reelle og umiddelbare.
Norge er ikke direkte bundet av fristen 2. august, men AI-loven er EØS-relevant og reglene vil komme her også. Tidspunktet for den formelle innlemmelsen i EØS-regelverket er imidlertid fortsatt uklart. For organisasjoner som opererer i eller driver virksomhet med EU, gjelder forordningen uavhengig av hvor organisasjonen har sitt hjemsted. Reglene har tredd i kraft, og risikoen er reell.
Hvem må egentlig opplyse om hva?
Kjernen i åpenhetsreglene er artikkel 50(1) i AI-loven. Plikten er i utgangspunktet enkel: AI-systemer som samhandler direkte med mennesker, må utformes slik at brukerne blir informert om at de snakker med en maskin, med mindre dette allerede er åpenbart. Chatbots, virtuelle assistenter og automatiserte kundeserviceverktøy faller alle klart innenfor virkeområdet.
Men her blir det interessant. Artikkel 50(1) gjelder for leverandører, ikke brukere/distributør. En leverandør er den enheten som utvikler et AI-system og bringer det på markedet eller tar det i bruk under eget navn eller varemerke. En bruker er en organisasjon som bruker et ferdig utviklet system til egne formål. Hvis en organisasjon har innlemmet en chatbot fra en tredjepart under denne tredjepartens merkevare, er den generelt sett en bruker, og opplysningsplikten hviler først og fremst på leverandøren som har utviklet systemet.
Det avgjørende ordet er «generelt». Tenk på dette scenarioet: et selskap bestiller en chatbot fra en ekstern utvikler, gir den et navn og tar den i bruk under sitt eget varemerke og sin egen visuelle identitet. I henhold til artikkel 3 nr. 3 i AI-loven omfatter en leverandør enhver som får utviklet et AI-system og tar det i bruk under eget navn eller varemerke. Artikkel 3 nr. 11 gjør det klart at «å ta i bruk» omfatter å levere et system til selskapets eget bruk. Resultatet er at selskapet kan ha krysset grensen fra distributør til leverandør, og dermed selv påtar seg opplysningsplikten i artikkel 50 nr. 1. En liten attribusjonsmerking fra den underliggende utvikleren vil neppe endre denne konklusjonen dersom den dominerende merkevareprofileringen er selskapets egen.
Spørsmålet man må stille seg er derfor ikke «har vi bygget dette?», men ganske ofte: «hvem sitt navn står på det?»
To støttedokumenter - Code of Practice og the Commission guidelines
Det er lagt frem to tilleggsdokumenter sammen med forordningen. En retningslinje for åpenhet rundt AI-generert innhold ble publisert 10. juni. Det er frivillig å slutte seg til retningslinjen, men organisasjoner som følger den, kan vise til dette som bevis på at de oppfyller artikkel 50. De som ikke slutter seg til retningslinjen, må på egen hånd dokumentere at de oppfyller kravene.
Retningslinjene består av to hoveddeler: én for leverandører, med fokus på maskinlesbar merking og påvisning av AI-generert innhold, og én for brukere/distributører, som omhandler merking av deepfakes og AI-manipulert tekst, inkludert veiledning om plassering og interne etterlevelsesprosesser. Den 20. juli publiserte EU-kommisjonen sine egne retningslinjer for gjennomføringen av artikkel 50, som avklarer omfanget av forpliktelsene og dekker aspekter som retningslinjen ikke omhandler.
Du finner retningslinjen her, og Kommisjonens retningslinjer her.
Distributører slipper heller ikke unna
Selv om artikkel 50(1) retter seg mot leverandører, har distributører sine egne forpliktelser i henhold til artikkel 50. Når en distributør bruker et AI-system til å generere eller manipulere innhold som utgjør en deepfake, er opplysningsplikt påkrevd. Det samme gjelder AI-generert eller manipulert tekst om saker av allmenn interesse som ikke har vært gjenstand for menneskelig gjennomgang. "Human review" er, I henhold til Commission Guidelines punkt 6.2.3 som minimum å faktasjekke korrektheten av innholdet. Og dette skal gjøres av noen med relevant kunnskap – en kontroll som ikke har noen realitet, vil ikke telle.
Dette er en bestemmelse med åpenbare implikasjoner for alle som bruker AI i kommunikasjon, offentlige anliggender eller informasjonssammenhenger. Brukere som benytter systemer for følelsesgjenkjenning eller biometrisk kategorisering, må også varsle de berørte personene – og dette er ikke så sjelden som man kan tro, i mange land er det ikke uvanlig å ha følelsesgjenkjenning i kundesentre for å henvise spesielt sinte kunder til medarbeidere som er opplært til å håndtere dem. Så vidt jeg vet, er dette (ennå?) ikke vanlig i Skandinavia.
Maskinlesbar merking: det usynlige laget
Artikkel 50(2) i AI-forordningen krever at leverandører av AI-systemer som genererer syntetisk lyd, bilder, video eller tekst, skal sette inn maskinlesbar merking i sine "utdata".
Dette er tekniske signaturer som automatiserte deteksjonssystemer kan identifisere, de trenger ikke å være synlige for mennesker. Forordningen foreskriver ikke én bestemt teknikk; tillatte metoder inkluderer vannmerker, metadatamerking, kryptografiske metoder og fingeravtrykk. Formålet er å sikre at AI-generert innhold forblir sporbart etter at det har blitt delt, beskåret eller fratatt sin opprinnelige kontekst, noe som forklarer hvorfor plikten påligger leverandørene snarere enn brukerne.
Viktige tiltak som må være på plass nå
Her er en praktisk oppsummering av hva reglene om åpenhet krever fra og med 2. august:
- Informasjon om chatboter: AI-systemer som kommuniserer direkte med enkeltpersoner, må tydelig informere brukerne om at de snakker med en maskin ved første kontaktpunkt, med mindre dette allerede er åpenbart
- AI-generert tekst om saker av allmenn interesse: Aktører som publiserer AI-generert eller manipulert tekst om temaer av allmenn interesse uten menneskelig redaksjonell gjennomgang, må opplyse om at innholdet er AI-generert
- Biometrisk og følelsesgjenkjenning: Enkeltpersoner må informeres når de er gjenstand for systemer for følelsesgjenkjenning eller biometrisk kategorisering
- Maskinlesbar vannmerking: Leverandører må legge inn maskinlesbare merker i AI-generert innhold, slik at det teknisk sett kan identifiseres som sådant
- Status som leverandør eller distributør: Organisasjoner som driver merkevarebaserte AI-grensesnitt, bør avklare hvilken kategori de tilhører, da dette direkte avgjør omfanget av deres forpliktelser
- Merking av deepfakes: Brukere som benytter AI til å generere eller manipulere bilder, lyd eller video som kan forveksles med ekte innhold, må merke dette innholdet som kunstig generert eller manipulert
Digital Omnibus: en revidert tidsplan
En annen utvikling som fortjener oppmerksomhet i seg selv: 27. juli 2026 trådte EUs «Digital Omnibus» om AI i kraft, noe som endrer AI-loven på flere viktige punkter. De viktigste datoene for den bredere reguleringen ser nå slik ut:
- 2. august 2026: Åpenhetsforpliktelsene trer i kraft.
- 2. desember 2026: Merkingsforpliktelser gjelder for AI-systemer som allerede var på markedet før 2. august.
- 2. desember 2027: Hovedkravene til samsvar for frittstående AI-systemer med høy risiko, inkludert de som brukes i arbeidslivet og utdanningssektoren.
- 2. august 2028: AI-systemer med høy risiko som er integrert i regulerte produkter.
Digital Omnibus-pakken klargjør også forholdet mellom AI-loven og GDPR. Poenget er at AI-loven ikke erstatter GDPR. Videre unngås noe dobbeltarbeid – det står at hvis det er gjennomført en DPIA etter GDPR artikkel 35 i GDPR, så kan en FRIA etter AI-loven vise til DPIA'en. Her tenker jeg det vil bli skrevet en del fremover om hvorvidt en FRIA må inneholde mer enn en DPIA.
Pakken innfører også et nytt forbud mot AI-systemer som er utviklet for å generere intime bilder uten samtykke.
Du finner Digital Omnibus her.
En merknad fra Hellas
Til slutt, en detalj som bare må nevnes. Hellas er for tiden i ferd med å innføre AI-loven i nasjonal lovgivning, og et endringsforslag i siste øyeblikk til lovutkastet vil gjøre fjerning av deepfake-merker, inkludert usynlige vannmerker, til en straffbar handling som kan medføre fengselsstraff. Til sammenligning har Tysklands gjennomføring overhodet ingen straff for brudd på åpenhetsreglene. Irland og Spania åpner for bøter.
AI-loven gir medlemslandene handlingsrom til å fastsette straffer, forutsatt at de er effektive, forholdsmessige og avskrekkende. Man kan undre seg over om forfatterne av AI-loven hadde fengselsstraff i tankene da de skrev «avskrekkende». Det er imidlertid et nyttig eksempel på hvor forskjellig den samme forskriften kan tolkes i ulike rettskulturer, og en påminnelse om at etter hvert som de nasjonale implementeringene kommer på plass, vil «EU-AI-loven» ikke se helt lik ut i alle land.
Du kan lese mer om åpenhetsreglene her og om straffene i Hellas her.
Trening av AI med data fra det åpne nettet – EDPB forteller endelig hva som kreves
7. juli var en travel dag i EDPB. I tillegg til retningslinjene for anonymisering som er omtalt over, sendte EDPB også retningslinje 03/2026 om webscraping på høring. Den er relevant for alle som utvikler eller kjøper treningsdata hentet fra nettet. Man kan sende inn kommentarer frem til 30. oktober 2026.
Retningslinjene er overraskende pragmatiske og mer konkrete enn uttalelsen fra 2024. Vi får et konkret eksempel på lovlig dataskraping og de foreslår en løsning på problemet med spesielle datakategorier som faktisk fungerer.
Samtykke er ut, berettiget interesse er inn
Berettiget interesse benyttes som kjent ofte ved utvikling av generativ AI og tre kumulative vilkår være oppfylt: en berettiget interesse må forfølges av den behandlingsansvarlige eller av en tredjepart; behandlingen av personopplysninger må være nødvendig for dette formålet; og de registrertes interesser eller grunnleggende rettigheter må ikke veie tyngre enn den behandlingsansvarliges berettigede interesse – en avveiingstest.
Når det gjelder det første vilkåret, kan en interesse anses som legitim dersom den er lovlig, klart og presist formulert, reell og aktuell, og ikke spekulativ. «Vi kan komme til å trenge treningsdata på et tidspunkt» er ikke tilstrekkelig.
Når det gjelder nødvendighet, kan det være avgjørende å innskrenke innsamlingskriteriene for å utelukke unødvendige personopplysninger, i stedet for å skrape en stor del av internett, for å sikre at nødvendighetsvilkåret er oppfylt. Bruk av pseudonymiserte eller syntetiske data kan være en annen, mindre inngripende måte å oppnå det samme formålet på.
Avveiingstesten er der det meste av det operative arbeidet ligger. Man må vektlegge om et nettsted selv har angitt grenser for hva som kan gjøres. Dette kan skje gjennom at nettstedet har filer som robot.txt- (en fil som sier at teksten ikke skal indekseres av crawlere) eller ai.txt-filer (tilsvarende robot.txt, men myntet på AI), eller CAPTCHA (en test som innebærer at kun mennesker skal kunne aksessere en side, typisk "velg alle bilder som inneholder lyskryss"). Dersom de registrerte er klar over at et nettsted har slike tiltakene er det mindre sannsynlig at de kan forvente at en skrapende enhet skal behandle deres personopplysninger – og avveiningen blir vanskeligere.
Retningslinjene har et konkret eksempel som kan være praktisk (om enn med svært mange kriterier): en organisasjon som utelukkende bruker data fra fritt og offentlig tilgjengelige nettkilder, der de registrerte åpenbart har gjort innholdet offentlig tilgjengelig, utelukker opphavsrettsbeskyttet innhold, iverksetter sikkerhetstiltak for å begrense lagring og gjengivelse av data, begrenser generering av problematisk innhold gjennom tekniske eller kontraktsmessige tiltak, legger til rette for utøvelsen av de registrertes rettigheter når reidentifisering er mulig, og tydelig angir datakilder i en offentlig tilgjengelig personvernerklæring. I et slikt tilfelle mener EDPB at avveiingstesten kan anses som oppfylt.
Problemet med spesielle kategorier – og løsningen fra søkemotorene
Særlige kategorier personopplysninger har gjort mange AI-treningsprosjekter juridisk utfordrende, og retningslinjene tar denne gangen tak i det veldig direkte. En behandlingsansvarlig vil ofte behandle spesielle kategorier av personopplysninger som vedkommende ikke hadde til hensikt å samle inn.
Nå henviser EDPB til EU-domstolens dom fra 2019 i saken GC m.fl. (C-136/17), som opprinnelig ble avsagt i sammenheng med søkemotorer. Domstolen anerkjente at de spesifikke trekkene ved behandlingen som utføres av operatøren av en søkemotor, kan ha innvirkning på omfanget av operatørens ansvar og forpliktelser, og at forbudet i artikkel 9 nr. 1 i GDPR gjelder «innenfor rammen av hans ansvar, fullmakter og evner». Ansvaret ble altså lempet.
EDPB mener at en lignende begrunnelse kan anvendes på tilfeldig innsamling av spesielle kategorier av personopplysninger i sammenheng med webscraping for opplæring av en AI-modell, selv om den ikke bør betraktes som et generelt unntak fra kravene i artikkel 9 og 10 i GDPR.
For at dette skal gjelde, må man vise at den konkrete behandlingsaktiviteten har relevante likheter med behandlingen i en søkemotor; behandlingen omfatter kun tilfeldige og gjenværende opplysninger i spesielle kategorier, ikke bevisst innsamling; at det er vanskelig eller umulig å vurdere på forhånd om skraping vil fange opp slike opplysninger; og den behandlingsansvarlige iverksetter tiltak innenfor rammen av sitt ansvar, sine fullmakter og evner for å forhindre spredning av disse opplysningene.
Hva betyr dette i praksis? Tiltakene må omfatte hele livssyklusen: å definere presise kriterier og filtre før innsamling for å forhindre at opplysninger i spesielle kategorier blir samlet inn; å slette opplysninger som identifiseres etter innsamling så snart som mulig; å anvende tiltak mot utvinningsangrep og utdatafiltre under modellutvikling; og å kontinuerlig overvåke utdata etter implementering, der «modellavlæring» anses som et langsiktig risikoreduserende tiltak etter hvert som teknologien utvikler seg.
Dette er ikke et generelt unntak. Den behandlingsansvarlige må kunne påvise, i tråd med ansvarlighetsprinsippet, at forholdene er relevante for dennes spesifikke behandlingsaktivitet, og at de vedtatte tiltakene er relevante og effektive. Litt mer å dokumentere der, altså. Men om det gjør at man faktisk kan bruke data fra nett, så er det nok mange som vil gjøre dette.
Hva som må være på plass
Noen praktiske punkter hentet direkte fra retningslinjene:
- Nettsteder som tydelig motsetter seg skraping gjennom robotautentisering, robots.txt- eller ai.txt-filer eller CAPTCHA, bør ekskluderes fra innsamlingen
- Før innsamling bør organisasjoner vurdere å bruke syntetiske data i stedet for personopplysninger, om det ikke går, så må man definere presise innsamlingskriterier
- Der det viser seg umulig å informere de registrerte individuelt, eller der dette ville kreve en uforholdsmessig stor innsats, må den behandlingsansvarlige gjøre informasjon offentlig tilgjengelig, vanligvis gjennom en personvernerklæring som oppgir datakategorier, rettslig grunnlag og, der det er mulig, de spesifikke kildene som er skrapet
- Hvis du kjøper et ferdig hentet datasett i stedet for å hente dataene selv, overføres ikke dine egne forpliktelser som behandlingsansvarlig fra selgeren. Den som har hentet inn dataene, er i prinsippet ikke ansvarlig for gjenbruk av dataene. Du påtar deg dine egne forpliktelser i henhold til artikkel 6 og artikkel 9 for din egen trening
Du kan lese mer om saken her.
Viktig tysk dom: Når AI-en tar feil, hvem er da ansvarlig?
Søkemotorer har lenge hatt en viss juridisk beskyttelse som de fleste innholdsutgivere ikke har. Den tradisjonelle begrunnelsen er enkel: en søkemotor skaper ikke innhold, den finner det. Google viser deg til en nettside; hvis den nettsiden inneholder noe ærekrenkende, er det ikke Google som sier det. En tysk regionaldomstol har nå avgjort at denne begrunnelsen ikke gjelder for AI-oversikter, og konsekvensene strekker seg langt utover Tysklands grenser.
Langsretten i München utstedte et midlertidig forbud mot Google etter at selskapets «AI Overview»-funksjon feilaktig koblet to München-baserte forleggere med svindel, abonnementsfeller og tvilsomme forretningsmetoder. AI-systemet hadde blandet sammen informasjon om reelt problematiske selskaper med saksøkerne, og trukket sammenhenger som ikke kom frem av noen av kildene. Da forleggerne sendte Google et krav om "cease and desist", noe Google ikke gjorde og saken gikk til retten.
Googles egne ord
Kjernen i kjennelsen er et skille som høres enkelt ut, men som har stor betydning. Et tradisjonelt søkeresultat lister opp kilder og siterer dem direkte. En AI-oversikt omskriver, vurderer og syntetiserer. Den uttrykker seg med egne ord og etter sin egen struktur. I dette tilfellet innledet oversikten med en selvsikre påstanden om at et av selskapene «er kjent for tvilsomme forretningsmetoder», for deretter å konstruere sin egen fortelling komplett med sammendrag, røde flagg og tips til brukerne. Ingenting av dette språket forekom i noen av de underliggende kildene.
Retten konkluderte med at dette var Googles egne uttalelser, ikke innhold fra tredjeparter som Google bare hadde gjort søkbart. Fordi Google alene har innflytelse over AI-ens resultater og algoritmene som driver den, bærer Google alene ansvaret for det den produserer. Den eksisterende rettspraksisen som beskytter tradisjonelle søkemotorer mot ansvar – utviklet av Tysklands forbundsdomstol nettopp fordi søkemotorer bare peker på eksternt innhold – gjelder ikke når AI-en genererer nye og uavhengige påstander på egen hånd.
Google hevdet at brukerne ganske enkelt kunne sjekke kildene selv og at de burde vite at de ikke skal stole blindt på AI-generert innhold. Retten lot seg ikke imponere. En uttalelse som er selvstendig og forståelig i seg selv, blir ikke juridisk ufarlig bare fordi en grundig leser teoretisk sett kunne motbeviset den gjennom videre undersøkelser. Retten trakk en parallell til presselovgivningen: en utgiver er ansvarlig for en overskrift som står for seg selv, selv om hele artikkelen gir et mer nyansert bilde. Googles argument, bemerket retten, ville dessuten i stor grad undergravet formålet med funksjonen; hvis oversikten er upålitelig, hva er egentlig poenget med den?
Hvorfor dette har betydning utover München
Google ble pålagt å dekke åtti prosent av saksomkostningene. Men den bredere betydningen av dommen ligger et annet sted. En analyse viser at Googles AI-oversikter gir riktige svar i omtrent nittien prosent av tilfellene. I den skalaen Google opererer i, utgjør de resterende ni prosentene likevel et enormt volum av feilaktige svar som genereres hver time. Hvis en betydelig andel av disse feilene gjelder identifiserbare personer eller organisasjoner, er ansvarsrisikoen i hele bransjen betydelig.
Dommen er ikke endelig, og Google har gitt uttrykk for at de vurderer avgjørelsen. Om begrunnelsen vil holde stand i en ankesak, og om domstoler i andre jurisdiksjoner vil følge logikken til domstolen i München, gjenstår å se. Men retningen er klar: AI-systemer som genererer egne påstander, i stedet for bare å vise frem andres, vil i stadig større grad bli behandlet som opphavsmenn til disse påstandene. For enhver organisasjon som tar i bruk AI-funksjoner som oppsummerer, syntetiserer eller kommenterer informasjon fra tredjeparter, er dette en utvikling det er verdt å følge nøye med på.
Du kan lese mer om saken her.
