AAItekstdetector.nl
Gids

Waarom geven twee AI-detectors verschillende uitslagen?

Bijgewerkt: 2026-06-16·AItekstdetector.nl

Je kopieert dezelfde alinea naar GPTZero: 45% AI. Dan naar Originality.ai: 78% AI. Naar Copyleaks: 32% AI. Wat is er aan de hand? Geen van de detectors liegt — ze werken gewoon fundamenteel anders. Hun trainingsdata, methoden en afstemmingen zijn niet identiek, dus uitslagen divergeren.

AanbevolenVergelijk GPTZero met andere detectors op dezelfde tekst
GPTZero →

Verschillende detectietechnieken: perplexiteit vs. classifiers

Niet alle AI-detectors gebruiken dezelfde benadering. De twee grote families zijn:

Perplexiteit-gebaseerde detectie

GPTZero is het bekendste voorbeeld. Het meet perplexiteit (hoe "verrast" een taalmodel is door de tekst) en burstiness (hoe consistent de schrijfstijl is). De logica:

  • AI-gegenereerde tekst is vaak zeer consistent in moeilijkheidsgraad — predictabel voor taalmodellen, dus lage perplexiteit
  • Menselijke schrijvers variëren meer in stijl en inhoud — minder predictabel, dus hogere perplexiteit
  • Burstiness: mensen schrijven soms een heel moeilijke zin, dan ineens een simpele. AI gaat meer geleidelijk

Voordeel: het vereist geen trainingsdata van AI-gegenereerde teksten; het gebruikt alleen openbare taalmodellen. Nadeel: veel false positives (vooral voor formulae, wetenschappelijke teksten, en herschreven AI-content).

Classifier-gebaseerde detectie

Originality.ai, Winston AI en Copyleaks trainen eigen neurale netwerken op grote datasets van menselijke en AI-gegenereerde teksten. Dit zijn eigenlijk kleine machine-learning-modellen die zeggen: "Op basis van deze tduizenden trainingsvoorbeelden lijkt dit meer op AI of meer op mens."

Voordeel: potentieel nauwkeuriger, omdat ze op echte voorbeelden geleerd hebben. Nadeel: de trainingsdata bepaalt alles — je model is zo goed als je trainingsset. En: updates zijn nodig als AI-modellen verbeteren.

Trainingsdata verschilt: welke modellen, welke teksten

Zelfs als twee detectors beide classificatie gebruiken, kunnen hun trainingssets heel anders zijn:

  • Welke AI-modellen? Traineer je op GPT-3.5 gegenereerde teksten, of op GPT-4, Claude, Gemini en LLaMA? Elk model heeft een ander "handschrift". Newer modellen zijn vaak moeilijker te detecteren
  • Welke menselijke teksten? Reddit-posts, Wikipedia, nieuwsartikelen, student-essays? De dataset bepaalt wat "menselijk" betekent voor de detector
  • Welke versies? OpenAI werkt constant aan verbetering. ChatGPT-4o schrijft anders dan ChatGPT-4 turbo. Een detector getraind op oude versies werkt minder goed op nieuwe outputs
  • Hoe vers is de training? Als een detector met data van 2023 is getraind, en jij test hem op 2026-teksten, zal hij minder accuraat zijn

Dit verklaart veel divergentie. Stel: Detector A is getraind op 60% ChatGPT-3.5 en 40% menselijke essays. Detector B is getraind op 40% GPT-4, 40% Claude, 20% menselijk. Dezelfde tekst (die van Claude afkomstig is) zal Detector B beter herkennen, omdat Claude veel in zijn trainingsdata zat.

Drempelwaarden: waar een detector "AI" zegt

Stel de interne score van beide detectors is 0,7 (op schaal 0–1, dus 70% AI). Maar:

  • Detector A zegt: "Alles boven 0,65 is AI" → uitslag: 70% AI
  • Detector B zegt: "Alles boven 0,85 is AI" → uitslag: 0% AI

Dit is geen verschil in de onderliggende score, maar in de afstelling van wat "AI" betekent. Detectoren stellen drempels af op basis van:

  • Testresultaten op hun eigen validatie-set (wat minimaliseert false positives?)
  • Gebruikscontext (een docent wil minder vals-positieven, een content-verificateur accepteert meer onzekerheid)
  • Bedrijfsvoorkeur (conservatiever is safer voor reputatie)

Er is geen universeel consensus over wat "50% AI" of "80% AI" betekent. Die getallen zijn relatief.

Wanneer detectors het oneens zijn: wat zegt dat?

Als detector A zegt "85% AI" en B zegt "20% AI", zijn drie dingen mogelijk:

  1. Menselijke herschrijving: de tekst is AI-gegenereerd, maar daarna flink door een mens bewerkt. A detecteert nog wat restsporen, B niet
  2. Vertalingen of parafrase: AI-tekst die via Google Translate is gegaan, of handmatig herschreven. Dit verstoort detectie ernstig
  3. Hybrid-tekst: enkele alinea's zijn AI, andere zijn echt menselijk. Detector A gewichtte AI-gedeelten zwaarder, B las het als overwegend menselijk
  4. Valse positief van de ene kant: detector A ziet patronen in stijl die toevallig lijken op AI (formeel, grammaticaal correct), maar werkelijk menselijk zijn. Of omgekeerd
  5. Trainingsdata-bias: A trainde op AI-teksten die veel lijken op deze tekst; B niet

Praktisch betekent dit: grote discrepantie = hoog risico op misjudging. Als twee serieuze tools het massaal oneens zijn, is het waarschijnlijk lastig in te classificeren content, en zou je voorzichtig moeten zijn met definitieve conclusies.

Praktisch voorbeeld: AI + menselijke bewerking

Stel je genereert met ChatGPT: "Kunstmatige intelligentie transformeert de samenleving met exponentiële snelheid. Toepassingen reiken van geneeskunde tot landbouw, elk domein ondervindt paradigmawisselingen."

Je leest dit terug, vindt "paradigmawisselingen" raar, en herschrijft: "Kunstmatige intelligentie transformeert de maatschappij razendsnel. De impact reikt van geneeskunde tot landbouw — bijna elk vakgebied verandert fundamenteel."

  • GPTZero: detecteert de originele structuur nog (vergelijkbare perplexiteit), zegt 60% AI
  • Originality.ai: de trainingsdata herkent het als hybrid (half gewijzigd, half AI-structuur), zegt 45% AI
  • Winston AI: nadruk op woordkeuze ("transformeert", "reikt", "domein" zijn relatief neutraal en menselijk), zegt 25% AI

Alle drie zijn technisch niet verkeerd — het hangt af van hoe je detectie definieert. Is iets "AI" als het oorspronkelijk van AI afkomstig is, ook al is het bewerkt? Of als de uiteindelijke tekst grotendeels menselijk lijkt?

Tabel: detectiemethodes van bekende tools

Een snelle overzicht:

ToolMethodeSterkteZwakte
GPTZeroPerplexiteit + BurstinessGeen trainingsdata nodig, snelVeel false positives, slecht op herschreven tekst
Originality.aiEigen classifier (OpenAI teksten)Gericht op ChatGPT-detectie, consistente scoringTrainingsdata alleen ChatGPT, slechter voor andere modellen
Winston AIEigen classifier (multi-model)Getraind op GPT, Claude, Gemini; breder spectrumMinder transparantie over trainingsdata-versies
CopyleaksEigen classifier + externe modelsIntegratie met plagiaatdetectie, schaalbaarMinder gespecialiseerd op pure AI-detectie
TurnitinEigen classifier + plagiaatdataVeel data over studentenwerk, contextueelPrimair voor educational use, niet universeel

Aanbeveling: gebruik meerdere detectors

Gegeven deze verschillen, is de pragmatische aanpak:

  • Run 2–3 detectors parallel. Als alle drie zeggen "90% AI", is het waarschijnlijk echt AI. Als ze spreiden van 20% tot 80%, is het twijfelachtig
  • Kijk naar patroon, niet naar één uitslag. Als twee tools zeggen 70%+ AI en één zegt 30%, weeg je zwaarder op de meerderheid
  • Controleer context. Is de schrijver normaal gesproken deze stijl, of opeens volledig anders? Dat kan AI verraden, ook als scores divergeren
  • Vertrouw op consensus, niet op precisie. Je hoeft niet te weten of het exact 65% of 75% AI is; je wilt weten of het "waarschijnlijk AI" is

Waarom geen enkele uitslag absoluut is

Het onderliggende probleem: AI-generatie en menselijk schrijven liggen op een spectrum, geen discrete categorie"en. Er is geen natuurkundige grens waar "100% mens" overgaat in "100% AI". Het meeste real-world content is hybrid.

Dit is waarom detectors kunnen divergeren, en waarom alle percentages met voorzichtigheid moeten worden genomen. Een score van "80% AI" betekent niet "dit is zeker AI"; het betekent "op basis van statistische signalen, schat dit model 80% waarschijnlijkheid in voor AI-herkomst." Dat is nuttig, maar niet absoluut.

Tegelijkertijd: consensus onder meerdere onafhankelijke detectors is een sterker signaal. Als meerdere tools het eens zijn, steeg jouw vertrouwen aanzienlijk.

Veelgestelde vragen

Welke AI-detector is het nauwkeurigst?

Geen enkele — ze zijn allemaal onvolmaakt en contextueel. GPTZero is snel en transparant over metrieken, Originality.ai is vooral goed voor ChatGPT-detectie, Winston AI dekent een breder spectrum. Beste praktijk: gebruik minstens twee tools en vergelijk de scores.

Als twee detectors het oneens zijn, wie heeft gelijk?

Waarschijnlijk allebei, op hun manier. Ze gebruiken verschillende methoden op verschillende trainingsdata. Maak het gemiddelde, of zoek naar consensus van meer tools. Als je veel geld of risico hebt, zoek naar expert-review in plaats van puur detector-scores.

Waarom zegt GPTZero iets anders dan Originality.ai?

GPTZero gebruikt perplexiteit (universeel model), Originality.ai een eigen classifier getraind op ChatGPT-teksten. Ze kijken letterlijk naar andere signalen. GPTZero is breder, Originality.ai specialistischer voor OpenAI-output.

Kan een detector verbeteren door updates?

Ja. Tools updaten hun modellen naarmate AI-output evolueert (GPT-3.5 naar GPT-4, enzovoort). Detectors van 2023 werken minder goed op 2026-content. Zorg dat je tool regelmatig geüpdatet.

Lees ook