Tester og tall

Slik har vi testet modellen

Vi har testet modellen på norske tekster den aldri er blitt trent på, på både bokmål og nynorsk. Her er hovedtallene og de viktigste begrensningene.

Hovedtallene

Hva testene viser

Svært presis<1 av 30 000menneskeskrevne tekster blir merket som KI

Testet på et stort utvalg norske tekster skrevet før ChatGPT, som vi vet er skrevet av mennesker. For pressemeldinger og annen profesjonell sakprosa var tallet rundt 1 av 10 000.

Vi oppdager99,8 %av KI-skrevne tekster

Tekster fra de mest brukte KI-tjenestene, bestilt slik folk faktisk bruker dem.

Vi oppdager88 %av tekster omskrevet med KI

Menneskeskrevne tekster som en KI har skrevet om eller «forbedret».

Også nye modeller99,3 %av tekster fra KI-modeller den aldri har sett

Nye modeller tester vi før de kommer med i treningen.

Slik har vi testet

Tre regler vi har fulgt

Testtekstene er holdt utenfor

Modellen har aldri sett tekstene vi måler den på, og samme skribent havner ikke både i trening og test.

Grensen er satt på egne data

Grensen mellom «menneske» og «KI» er satt på andre tekster enn dem vi tester på.

Realistiske KI-tekster

KI-tekstene er bestilt slik folk faktisk bruker chatboter, og ikke med én pen mal.

Bokmål og nynorsk

Bokmål og nynorsk i samme modell

Du trenger ikke si fra hvilken skriftform teksten er på. Feilalarmene er omtrent like sjeldne på nynorsk som på bokmål, og KI-tekstene oppdages like godt.

Norsk offentlighet

KI-tekst er blitt vanlig på kort tid

Vi har kjørt debattinnlegg fra eksterne skribenter i norske aviser og forslag på Stortinget gjennom modellen. Før ChatGPT ble nesten ingen merket. I år ser over en tredel ut til å være skrevet med KI.

Vi publiserer ikke resultater for enkeltpersoner eller partier.

Andel tekster som merkes som KI, per år.

Begrensninger

Det modellen ikke klarer

  • Delvis KI-skrevet tekstI testene våre fant modellen rundt fire av fem tekster der en KI hadde skrevet en del av teksten, for eksempel midtpartiet i et debattinnlegg. Er KI-delen liten, under en firedel av teksten, blir den ofte ikke oppdaget.
  • Språkvask og oversettelseTekst som bare er språkvasket eller oversatt med KI, regnes som menneskelig. Noen slike tekster merkes likevel.
  • Korte teksterUnder 100 ord gir vi ikke noe svar, og korte tekster krever et sterkere signal før vi sier KI.
  • Bevisst omskrivingDen som skriver om en KI-tekst for at den ikke skal bli oppdaget, vil av og til lykkes. Et svar er en indikasjon, ikke et bevis.

Det vi holder for oss selv

Åpne om testene, lukket om oppskriften

Vi forteller ikke hvilke tekster modellen er trent på eller nøyaktig hvor grensene går. En detektor som viser oppskriften sin, er lettere å komme rundt.

Prøv selv

Den beste testen er dine egne tekster. Lim gjerne inn noe du selv skrev før 2022, og se om modellen tar feil. Logg inn, så får du 2 000 ord gratis hver uke.