Er det mer KI-slafs i debattinnlegg nå for tiden? Her har du en svært enkel html-fil du kan åpne i nettleseren din som lar deg lime inn en tekst - f.eks. et debattinnlegg - så får du ut en liste med setninger med et typisk trekk ved tekster generert av språkmodeller: setninger med mønsteret ikke X, men Y. Du kan også bruke versjonen som ligger på nettsidene mine: http://jilltxt.net/ikke-men.html.
Filen 'ikke-men.html' åpnes i en nettleser. Koden er stort sett generert ved hjelp av ChatGPT. Filen 'urler_debattinnlegg' er en liste med URLer man kan bruke. Disse er tatt fra Aftenpostens samleside [https://www.aftenposten.no/emne/debatten-om-asle-tojes-tekst Debatten om Asle Tojes tekst]. I tillegg er det et par URLer til debattinnlegg skrevet før 2022 til sammenligning. Filen 'leserinnlegg_metadata.yaml' har analyser av debattinnleggene generert av 'ikke-men.html'. Yaml-formatet er brukt fordi det både er lett for mennesker å lese og det er strukturert så kan brukes til visualiseringer osv.
Filene er utgitt med MIT-lisens og kan fritt gjenbrukes. Hvis du bygger videre på idéen så setter vi pris på at du forteller oss om det, om du bruker datasettet setter vi pris på at du siterer oss.