Hvem læser dine chats med AI-companion? Sådan fungerer moderation egentlig

Privatliv og sikkerhed

Det meste af det, du skriver til en AI-companion, læses ikke af noget menneske. Noget gør, og reglerne for hvornår står som regel gemt i en privatlivspolitik. Her er, hvordan lagene hænger sammen.

Vi kan modtage en provision for links på denne side. Det ændrer aldrig en karakter.

"Moderation" lyder som én ting. I companion-apps er det mindst fire, der arbejder i forskellige tempi og involverer forskellige mennesker.

De fire lag

Fire lag af moderation i AI-companion-apps: filtre på hver besked, automatisk markering af samtaler, menneskelig gennemgang af markeret indhold og retslige krav eller krav fra politiet

Hvert lag ser mindre indhold, men ser det mere detaljeret.

1. Filtre i realtid. Hver besked, du sender, og hvert svar, modellen skriver, kan blive tjekket af automatiske klassifikatorer, før det vises. De fanger forbudte kategorier - alt med mindreårige, visse voldelige emner, signaler om selvskade - og enten blokerer beskeden, blødgør svaret eller viser en advarsel. Det er her, afvisninger og krisekort kommer fra; vores artikel om indholdsfiltre forklarer, hvorfor de nogle gange udløses midt i en scene.

2. Markering på samtaleniveau. Særskilt kan systemer score hele samtaler eller konti for mønstre: gentagne forsøg på at omgå et filter, chikane, tegn på, at en mindreårig bruger en voksenapp. En markering er ikke en straf; det er en note om, at et menneske måske kigger.

3. Menneskelig gennemgang. Medarbejdere i trust og safety, ofte hos underleverandører, gennemgår en brøkdel af markerede samtaler, brugeranmeldelser og klager. Nogle virksomheder tager også stikprøver af almindelige samtaler for at tjekke kvalitet eller træne modeller. Det er det lag, privatlivspolitikker beskriver med vendinger som "to improve our services" eller "to enforce our terms".

4. Retslige krav. Domstole, politi og myndigheder kan anmode om data med retslige afgørelser. Virksomheder svarer i overensstemmelse med deres politik og lokal lovgivning.

Hvad der typisk udløser et menneskeligt blik

UdløserHvorfor
Indhold med mindreårigeRetlig pligt i de fleste lande; ofte anmeldt videre
Signaler om selvskade eller selvmordKriseprotokoller kræves nu ved lov i flere amerikanske delstater
Trusler mod rigtige personerMulig skade i den virkelige verden
Din egen anmeldelse eller supportsagDu har bedt nogen om at kigge
Gentagne forsøg på at omgå filtreHåndhævelse af vilkårene
Tilfældige kvalitetsstikprøverProduktforbedring, hvis politikken tillader det

Hvad de nye love tilføjer

Amerikanske love om companion-chatbots, begyndende med New York i 2025 og Californien i 2026, kræver, at apps opdager udtryk for selvmordstanker og selvskade og henviser brugerne til kriseservices. Californien kræver også, at virksomheder aflægger rapport om deres protokoller. I praksis betyder det mere automatisk overvågning af de mest følsomme samtaler, ikke mindre. Detaljerne står i love om AI-companions i USA.

Sådan læser du politikken for det

Søg i privatlivspolitikken og vilkårene efter:

  • "review", "moderate", "human" - om mennesker læser samtaler, og hvorfor.
  • "contractors" eller "service providers" - om gennemlæserne arbejder for en anden.
  • "improve", "train" - om almindelige chats tages som stikprøver.
  • "law enforcement", "legal process", "court order" - hvornår data udleveres, og om der kræves en retskendelse.

En omhyggelig politik nævner udløserne og siger, at gennemlæsere kun ser samtaler, når det er nødvendigt. En vag politik, der lader medarbejdere tilgå "alt indhold til ethvert forretningsformål", fortæller dig også noget. Vores fire privatlivstjek dækker resten af dokumentet.

Praktiske konklusioner

  • Skriv, som om en gennemlæser kan læse det, for i et lille antal tilfælde gør en.
  • Hold andres identificerende oplysninger ude af chats, især i eksplicitte scener - en gennemlæser, der læser en markeret samtale, ser dem også.
  • Hvis et filter fejler i fiktion, løser en note uden for rollen det som regel; at diskutere i rollen kan give flere markeringer.
  • Hvis du frem for alt går op i, hvem der kan læse dine chats, er den eneste opsætning, hvor ingen andre kan, en companion, der kører på din egen computer - se kør en AI-companion lokalt.

Moderation er ikke det samme som overvågning. For langt størstedelen af samtalerne kigger ingenting og ingen ud over det automatiske filter. Men det er politikken, ikke appens varme, der afgør undtagelserne - og det er værd at kende dem, før du får brug for det.

Ofte stillede spørgsmål

Læser medarbejdere mine chats med AI-kæresten?

Som regel ikke rutinemæssigt, men de fleste apps forbeholder sig retten. Medarbejdere ser typisk samtaler, der er markeret af automatiske systemer, anmeldt, indgår i en supporthenvendelse eller er udtaget som stikprøve til at forbedre produktet. Privatlivspolitikken bør sige, hvilket der gælder.

Hvad sker der, hvis jeg bliver markeret?

De fleste markeringer fører til ingenting, du lægger mærke til, eller til en blokeret besked eller en advarsel. Gentagne eller alvorlige overtrædelser kan føre til suspension af kontoen. Indhold med mindreårige eller reelle trusler kan blive anmeldt til myndighederne.

Kan politiet få mine chats med AI-companion?

De kan anmode virksomheden om dem, og virksomheder efterkommer gyldige retslige krav. Mozillas gennemgang fra 2024 fandt, at de fleste producenter af romantiske chatbots sagde, at de kunne dele data med myndigheder, nogle gange uden en retskendelse. Gå ud fra, at alt, der er gemt, kan blive udleveret.