Ratgeber zur KI-Erkennung
Ist Winston AI zuverlässig?
Winston AI meldet sehr starke Ergebnisse für sein aktuelles Modell, und die zwei unabhängigen Studien auf dieser Seite fanden auf ihren eigenen Datensätzen ebenfalls gute Leistungen. Das macht keinen Detektor für jeden Text richtig. Winston nennt seinen Human Score eine Vorhersage und keine Messung davon, wie viel eines Dokuments KI-geschrieben ist, und die eigene Dokumentation nennt die Grenzen: kurze Proben, stark bearbeiteter oder übersetzter Text, Listen, Code und Tabellen liefern schwache Signale. Länge, Dokumenttyp und Modellversion entscheiden, wie viel ein Ergebnis wert ist. Wenn die Folge zählt, behandle den Wert als ein Signal, vergleiche denselben Abschnitt mit einem zweiten Detektor und lies die markierten Stellen selbst. Der KI-Detektor von AI-2-Human liefert dir diese zweite Lesart.

Was ist Winston AI?
Winston AI ist ein Detektor für KI-Inhalte. Du fügst einen Text ein oder lädst ein Dokument hoch und erhältst einen Human Score plus eine KI-Prognosekarte, die zeigt, welche Abschnitte das Ergebnis Richtung KI verschoben haben. Winston listet außerdem die einflussreichsten Abschnitte und eine Erklärungsebene, die du öffnen kannst. Das Produkt umfasst Plagiatsprüfungen und eine API, weshalb es Schulen, Verlage und Forschungsteams nutzen, nicht nur einzelne Schreibende.
Wie genau ist Winston AI also?
Es gibt keine einzelne Genauigkeitszahl für jeden Text. Sagbar ist etwas Engeres: Winston meldet für sein aktuelles Modell sehr starke Ergebnisse auf dem eigenen englischen Evaluationsset, ein unabhängiger begutachteter Vergleich setzte es in einem kleinen Test auf demselben Datensatz auf Platz eins, und eine angewandte Studie aus der medizinischen Ausbildung zeigte, dass es KI-geschriebene Motivationsschreiben von klassischer menschlicher Literatur trennte. Beide unabhängigen Datensätze sind klein und beschreiben die damals verfügbare Modellversion.
Winstons Dokumentation rahmt Genauigkeit genauso. Sie erklärt, starke Detektoren könnten sehr genau sein, während die Genauigkeit dennoch nach Detektor, Modellversion, Datensatz, Textlänge und Dokumenttyp variiert, und empfiehlt, einen Detektor über unabhängige Forschung zusammen mit transparenter interner Evaluation zu beurteilen statt über eine einzelne Zahl. Dieselbe Seite endet mit dem wichtigsten Satz: Kein KI-Detektor darf als automatisches Schuldurteil gelten.
- Modellversion: Luka, Curia und das heutige Modell sind verschiedene Systeme, und Winston datiert jeden Bericht.
- Datensatz: 10.000 englische Proben, ein Vergleich mit 24 Texten und 25 Motivationsschreiben messen Unterschiedliches.
- Länge: Winston nennt Länge den wichtigsten Faktor, und kurze Proben geben dem Modell weniger Grundlage.
- Dokumenttyp: Langprosa funktioniert am besten, Listen, Code, Transkripte und Standardtext liefern wenig Signal.
- Bearbeitung und Übersetzung: starkes Umschreiben, Humanizer oder Übersetzen verändern die Muster, die das Modell liest.
- Metrik: Genauigkeit, Sensitivität und Falsch-Treffer-Quote sind verschiedene Zahlen, eine Siegquote ist wieder etwas anderes.
Was die Evaluation des aktuellen Winston-Modells berichtet
Die jüngste große Version ist Modell 4.0 mit dem Namen Curia. Winston meldet 99,95% Gesamtgenauigkeit der Klassifikation auf einem englischen Datensatz mit 10.000 Proben, ein R² von 0,9908 bei der Schätzung des KI-Anteils und 99,97% Genauigkeit bei menschlichem Schreiben, was einer Quote falscher Treffer von 0,03% entspricht. Die veröffentlichte Curia-Evaluation ist auf den 5. Februar 2025 datiert und umfasst 10.000 menschliche und maschinelle Proben aus unterschiedlichen Quellen und Stilen.
Die vorherige Version, Modell 3.0 mit dem Namen Luka, dokumentierte 10.000 Texte, gleichmäßig aufgeteilt zwischen menschlichem Schreiben vor 2021 und KI-Text, mit mindestens 600 Zeichen pro Probe. Winston meldet 99,98% Genauigkeit bei der KI-Erkennung, 99,50% bei menschlichem Text und 99,74% Gesamtgenauigkeit, dazu die Genauigkeit nach Kategorie: 100% bei Essays und Abschlussarbeiten, medizinischen Arbeiten, Filmkritiken, Reden, Wikipedia-Artikeln und Rezepten, 99,56% bei Nachrichten und Blogs und zwischen 98,05% und 99,15% bei Fan-Fiction, Reddit-Beiträgen, Gedichten und Stack-Overflow-Antworten.
Winston AI: Bibliothek zu Forschung und Validierung (auf Englisch)
Was unabhängige Forschung über Winston AI sagt
Das wichtigste unabhängige Ergebnis ist eine begutachtete Studie, die 2026 in Information Research von Forschenden der Universität J.J. Strossmayer in Osijek erschien. Die Arbeit Verification of AI-generated content analysierte 24 Texte von drei erfahrenen Autorinnen und Autoren auf Englisch und Kroatisch, je zur Hälfte menschlich und KI-generiert, und prüfte sie mit vier Detektoren: Winston AI, Originality.ai, ZeroGPT und Smodin. In der standardisierten Genauigkeitstabelle erzielte Winston mit 99% den höchsten Durchschnitt, vor Originality.ai mit 98% sowie ZeroGPT und Smodin mit 91%.
Information Research: Verifikation KI-generierter Inhalte (2026, auf Englisch)
Das ist aussagekräftige und zugleich kleine Evidenz. 24 Texte von drei Autoren in zwei Sprachen sind ein Vergleich auf demselben Datensatz, kein Produktionsbenchmark, und die Arbeit nennt weder eine Versionskennung pro Detektor noch eine Sensitivität pro Tool. Das Ergebnis stützt, dass Winston auf diesem Testset stark ist. Es belegt nicht, dass Winston bei deinem Dokument zu 99% genau ist.
Die zweite unabhängige Studie kommt aus der medizinischen Ausbildung. Sie erschien 2025 in Cureus, fragte, ob Weiterbildungsprogramme KI-Nutzung in Motivationsschreiben erkennen können, und analysierte im November 2023 25 Textproben von je rund 700 Wörtern mit drei Detektoren: GPTZero, Undetectable AI und Winston AI. Enthalten waren fünf KI-generierte Motivationsschreiben, fünf menschliche von vor ChatGPT, fünf danach geschriebene und fünf Auszüge aus klassischen Romanen als Kontrolle. KI-Texte wurden mit hohen Raten als KI erkannt, klassische Literatur meist als menschlich gelesen, und die echten Schreiben ergaben gemischte Resultate: Über die drei Tools hinweg schienen menschliche Schreiben in der Vor-ChatGPT-Gruppe zu 64% bis 100% aus KI-Inhalt zu bestehen, in der Nach-ChatGPT-Gruppe zu 3% bis 100%.
Cureus: Können Weiterbildungsprogramme KI-Nutzung erkennen? (2025, auf Englisch)
Diese Studie ist die ehrlichste Illustration des Problems. Gleiche Länge, ähnliches Thema, dieselben Detektoren, und eine Spanne, die bis zu einem vollständigen falschen Treffer auf echt menschlichem Text reicht. Die Autorinnen und Autoren warnen, dass ein schlechter Einsatz validierter Tools ehrlichen Bewerbenden schaden kann. Winstons Bibliothek dokumentiert außerdem einen Forschungsfall: Forschende von Yale, der Northeastern University, der Chinese University of Hong Kong und der City University of Hong Kong nutzten Winston AI, um mehr als 1,1 Millionen US-Verbraucherbeschwerden zu analysieren. Das belegt Forschungseinsatz, ist aber keine Genauigkeitsmessung und keine Prozentzahl.
Was bedeutet der Human Score von Winston AI?
Der Human Score reicht von 0% bis 100% und schätzt, wie stark das gesamte Dokument verifiziertem menschlichem Schreiben ähnelt. Nahe 100% ähnelt es stark menschlichem Text, nahe 0% stark KI-generiertem Text. In der Mitte ist das Ergebnis weniger eindeutig, und Winston nennt die Gründe: gemischte Autorschaft, starke Bearbeitung, zu wenig Text, übersetztes Material oder eine Schreibweise, die das Modell in keine Richtung deutlich drückt.
Der Wert ist das Hauptergebnis und zugleich eine Vorhersage, keine Messung. Winston sagt das direkt: Wenn er 20% menschlich liest, heißt das nicht, dass genau 80% der Wörter von einer KI stammen. Ein niedriger Wert zählt also keine maschinengeschriebenen Wörter und sagt nichts darüber, wer sie getippt hat.
Winston AI: Wie interpretiert man Ergebnisse eines Textscans? (auf Englisch)
Was ist die KI-Prognosekarte?
Die Prognosekarte teilt das Dokument in kleinere Abschnitte und färbt sie ein, um zu zeigen, welche Passagen menschlicher oder KI-ähnlicher wirken. Winston nennt fünf Bänder für markierten Text: 0 bis 20 als KI-generiert, 20 bis 40 als wahrscheinlich KI, 40 bis 60 als unsicher, 60 bis 80 als überwiegend menschlich und 80 bis 100 als menschlich geschrieben.
Winston sagt deutlich, wie sie zu nutzen ist. Die Karte dient dazu, prüfenswerte Passagen zu finden, und Satzwerte beruhen auf viel kleineren Proben als der Dokumentwert, dürfen also nicht allein gelesen oder zu einem Fazit gemittelt werden. Formale Sprache, wiederholte Formulierungen, Standardtexte, Zitate und ein plötzlicher Stilwechsel können eine markierte Passage beeinflussen. Die nützliche Frage ist, ob das Muster des ganzen Dokuments zu deinen Schreibbelegen passt, nicht ob ein Satz markiert wurde.
Kann Winston AI menschlichen Text als KI markieren?
Ja. Ein falscher Treffer ist menschliches Schreiben, das als KI-generiert gelesen wird, und Winston erkennt an, dass Erkennung eine Vorhersageaufgabe ist, in der beides möglich ist. Die veröffentlichte Curia-Evaluation nennt eine Quote falscher Treffer von 0,03%, entsprechend 99,97% korrekt als menschlich erkannter verifizierter Texte auf 10.000 englischen Proben, die Luka-Evaluation meldete 0,50% auf 5.000 verifizierten menschlichen Texten. Das sind Anbieterevaluationen auf anbieterdefinierten Datensätzen, also ein Bericht und keine Garantie.
Winston AI: Falsch-Treffer-Quote und Genauigkeit bei menschlichem Text (auf Englisch)
Die Aufschlüsselung nach Kategorien sagt mehr als der Durchschnitt, weil sie zeigt, wo sich das Risiko konzentriert. In der Luka-Evaluation wurden menschliche Essays und Abschlussarbeiten, medizinische Arbeiten, Filmkritiken, Reden, Wikipedia-Artikel und Rezepte mit 100% Genauigkeit als menschlich erkannt, Nachrichten und Blogs lagen bei 99,56%, Stack-Overflow-Antworten bei 98,05%. Winston weist darauf hin, dass keine separaten Quoten pro Schreibgruppe oder Kategorie veröffentlicht werden, sodass ein Genre nahe publizierter Prosa im gut funktionierenden Teil der Tabelle liegt und eine kurze, unkonventionelle Probe nicht.
Die Risikofaktoren werden in Detektor-Dokumentationen einheitlich beschrieben, und Winstons Liste ist konkret: kurze Ausschnitte, Listen, Transkripte, übersetzter Text, juristische Standardformeln, Tabellen und formelhaftes Schreiben liegen näher an der Grenze. Nichts davon belegt KI-Nutzung, und einiges entsteht durch sorgfältiges, gut organisiertes menschliches Schreiben.
Kann Winston AI KI-generierten Text übersehen?
Ja. Ein falscher Negativtreffer ist KI-generiertes Schreiben, das als menschlich gelesen wird, und Winston dokumentiert drei Situationen. Stark bearbeitete Maschinenentwürfe können Richtung menschlich rutschen: Winston erklärt, bedeutende menschliche Bearbeitung könne den KI-Wert auch bei KI-Originalen senken. Übersetzter Text ist die zweite, weil Übersetzung die Schreibmuster so verändert, dass Ergebnisse weniger verlässlich werden. Die dritte ist gemischte Autorschaft, bei der menschliche Entwürfe und maschinelle Hilfe zu einem Mittelwert verschmelzen, der keinen Teil gut beschreibt.
Paraphrasierer und Humanizer liegen in derselben Zone, und Winston ist ungewöhnlich offen. Die Dokumentation erklärt, KI-Text durch einen Paraphrasierer oder Humanizer erziele häufig einen höheren Human Score als unveränderte KI-Ausgabe, Winston sei speziell auf humanisierte Inhalte trainiert, und starkes Umschreiben könne dennoch die Sicherheit des Modells senken. Die Schlussfolgerung entspricht dieser Übersicht: Ein mäßig erhöhter Human Score bei paraphrasiertem Inhalt beweist nicht, dass ein Mensch geschrieben hat.
Warum Winston-AI-Ergebnisse schwanken können
Zwei Personen können denselben Text prüfen und unterschiedliche Ergebnisse sehen, und zwei Detektoren können sich über ein Dokument uneinig sein. Die Erklärung liegt meist in den Bedingungen, nicht in einem Defekt.
- Modellversion: Winstons Bibliothek dokumentiert mindestens zwei Generationen mit unterschiedlichen Zahlen.
- Länge: Winston nennt Länge den wichtigsten Faktor, kurze Proben liefern unsicherere Vorhersagen.
- Dokumenttyp: Prosa funktioniert am besten, Listen, Code, Tabellen, Transkripte und Standardtext liefern wenig Signal.
- Bearbeitungshistorie: Umschreiben, Paraphrasieren und Humanizer verändern die Muster, die das Modell bewertet.
- Sprache: Winston erklärt, die Leistung variiere nach Sprache und verfügbaren Trainingsdaten.
- Übersetzung: Übersetzen verändert Syntax und Wortwahl, die Übersetzung kann anders gelesen werden als das Original.
- Gemischte Autorschaft: Ein von einer Person geschriebener und mit Assistent überarbeiteter Text hat keinen einzigen wahren Wert.
Beeinflusst die Textlänge die Genauigkeit von Winston AI?
Winston nennt Länge den wichtigsten Faktor seiner Ergebnisse. Ein Scan braucht mindestens 500 Zeichen, und die Dokumentation empfiehlt 300 Wörter oder mehr für einen verlässlichen Wert. Kürzere Ausschnitte lassen sich prüfen, doch die Sicherheit sinkt, und der Gesamtwert bleibt verlässlicher als die Satzkarte, besonders bei kurzen Passagen.
Die praktische Regel ist Verhältnismäßigkeit. Ein vollständiger Text, in dem sich Muster über mehrere Absätze wiederholen, wiegt mehr als ein markierter Satz, und Winstons eigenes Beispiel ist deutlich: Ein Ausschnitt mit 50 Wörtern kann unsicher zurückkommen, während derselbe Inhalt mit 500 Wörtern einen viel verlässlicheren Wert ergibt. Bei einem kurzen Auszug bleibt das Ergebnis vorläufig.
Welche Textarten funktionieren mit Winston AI am besten?
Winston veröffentlicht eine Tabelle der Inhaltstypen, und sie ist die praktischste Seite der Dokumentation. Langprosa funktioniert am besten: Essays, akademische Arbeiten, Blogbeiträge und Artikel. Anschreiben, Motivationsschreiben, vollständige E-Mail-Texte, Produktbeschreibungen und Pressemitteilungen gelten als gut, mit der Einschränkung, dass kurze Proben die Sicherheit senken. Social-Media-Beiträge, Listen, Transkripte und übersetzte Inhalte gelten als eingeschränkt, und Quellcode, mathematische Formeln, juristische Standardtexte und Tabellen als ungeeignet, weil ihnen die Prosamerkmale fehlen, auf die das Modell angewiesen ist.
Winston AI: Welche Inhaltstypen kann ich prüfen? (auf Englisch)
Diese Tabelle verändert, wie eine Genauigkeitsaussage zu lesen ist. Ein Dokumenttyp aus den oberen Zeilen liefert die veröffentlichten Prozentzahlen; eine Liste, eine übersetzte Seite oder ein Transkript sind eine andere Messung mit viel schwächerem Signal, und ein Wert aus diesen Kategorien sagt mehr über das Material als über die schreibende Person. Die Seite ergänzt, dass gemischte Autorschaft gemischte Signale erzeugt und die Prognosekarte zeigt, welche Abschnitte den KI-Wert treiben.
Wie man ein Winston-AI-Ergebnis interpretiert
Winstons eigene Anleitung ist, mit dem Gesamt-Human-Score zu beginnen und dann die Prognosekarte zu nutzen: Der Dokumentwert bewertet den ganzen Text, Satzwerte sind unterstützender Kontext. Vor einer Reaktion auf ein Ergebnis lohnen diese Fragen eine Minute.
- Wie lang ist die Probe, und ist es Prosa oder strukturiertes Material?
- Ist der Gesamtwert klar menschlich, klar KI oder nahe der unsicheren Mitte?
- Welche Passagen erscheinen in der Prognosekarte, und teilen sie ein Muster?
- Wirkt der markierte Text im Kontext gelesen wirklich ungewöhnlich?
- Wurde das Dokument übersetzt, paraphrasiert oder stark bearbeitet?
- Liefert ein anderer Detektor auf demselben Text eine ähnliche Lesart?
- Gibt es Belege zum Schreibprozess, etwa Entwürfe oder einen Versionsverlauf?
Was ein Winston-AI-Ergebnis allein nicht belegen kann, sollte klar gesagt werden. Es beweist nicht, wer ein Dokument geschrieben hat, ob KI-Nutzung gegen Regeln verstieß, ob plagiiert wurde oder ob jemand in böser Absicht handelte. Winston sagt selbst, ein Ergebnis sei zu prüfende Evidenz und nicht automatischer Beweis für Fehlverhalten.
Was tun, wenn Winston AI deinen Text markiert?
Arbeite die Situation in fester Reihenfolge ab, statt reflexhaft umzuschreiben. Die folgende Sequenz dauert wenige Minuten und gilt für jeden Detektor.
- 1
Den Wert in Proportion lesen
Prüfe die Probenlänge und ob der Wert klar oder nahe der unsicheren Mitte liegt.
- 2
Die Prognosekarte lesen
Sieh nach, welche Passagen markiert wurden und ob sie ein Muster teilen.
- 3
Den Text selbst beurteilen
Frage dich, ob die markierten Stellen wirklich repetitiv oder mechanisch wirken.
- 4
Einen zweiten Detektor vergleichen
Schicke denselben Text durch ein anderes Tool und prüfe, ob die Lesarten übereinstimmen.
- 5
Prozessbelege sammeln
Suche Entwürfe, Versionsverlauf oder Quellnotizen, wenn Autorschaft infrage steht.
- 6
Nur Nötiges überarbeiten
Schreibe die Abschnitte um, die es brauchen, und prüfe Belege separat.
Manchmal ist die Sorge berechtigt. Gleichförmige Sätze, Übergänge, die nichts verbinden, und Absätze ohne Belege sollten korrigiert werden, ob ein Detektor sie bemerkt hat oder nicht. Ist ein Abschnitt wirklich mechanisch, schreibt der Humanizer von AI-2-Human eine natürlichere Fassung, und du bearbeitest sie mit deiner Stimme.
Sollten Lehrkräfte oder Arbeitgeber sich allein auf Winston AI verlassen?
Nein. Winstons Dokumentation erklärt, kein Detektor dürfe als automatisches Schuldurteil gelten, und die Cureus-Studie zu Motivationsschreiben zeigt, warum diese Formulierung wichtig ist: Bei echtem menschlichem Text ergaben die drei getesteten Detektoren KI-Werte, die bei einigen Proben bis 100% reichten. Ein Tool kann auf den Datensätzen stark sein, auf denen es validiert wurde, und ein einzelnes Dokument dennoch falsch lesen.
Wenn Autorschaft strittig ist, schlägt ein Prozess eine Zahl. Entwürfe, Revisionsverlauf, Quellnotizen, prüfbare Zitate, frühere Arbeiten derselben Person, die Vorgaben der Schule oder des Arbeitgebers und ein Gespräch über das Material wiegen mehr als eine Prozentzahl. Ein Detektor nützt am meisten, wenn er auf besprechenswerte Passagen zeigt, und am wenigsten, wenn er die Diskussion beenden soll.
Solltest du Winston AI mit einem anderen Detektor vergleichen?
Ja, besonders wenn das Ergebnis grenzwertig ist oder Folgen hat. Auch starke Detektoren nutzen unterschiedliche Modelle, Datensätze und Schwellen, sodass derselbe Abschnitt von zwei Tools unterschiedlich gelesen werden kann. Winstons Dokumentation formuliert es anders: Metriken aus verschiedenen Datensätzen seien nicht austauschbar und dürften nicht zu einem synthetischen Ranking kombiniert werden, weshalb eine Prozentzahl nie eine Frage der Autorschaft klärt.
Der Vergleich hilft in beide Richtungen. Markieren zwei Detektoren dieselbe Stelle, verdient sie eine genaue Lektüre. Widersprechen sie sich deutlich, liegt der Text nahe an einer Entscheidungsgrenze und der Wert ist weich, was man vor einer Überarbeitung wissen sollte.
Vor der Abgabe: eine praktische Checkliste
- Ich weiß, dass der Human Score von Winston AI eine Vorhersage und keine Messung ist.
- Ich habe geprüft, ob die Probe lang genug für eine Bewertung war.
- Ich habe den Gesamtwert vor den Satzmarkierungen gelesen.
- Ich habe die Prognosekarte im Kontext und nicht isoliert betrachtet.
- Ich habe den Dokumenttyp und seine Eignung für das Modell bedacht.
- Ich habe Übersetzung, Paraphrasierung oder starke Bearbeitung berücksichtigt.
- Ich habe einen zweiten Detektor verglichen, weil das Ergebnis zählt.
- Ich habe nach Entwürfen oder Versionsverlauf gesucht, wenn Autorschaft strittig ist.
- Ich habe nur die Abschnitte überarbeitet, die es wirklich brauchten.
Häufige Fragen
Winston AI meldet für sein aktuelles Curia-Modell sehr starke Ergebnisse, darunter 99,95% Gesamtgenauigkeit auf einem englischen Datensatz mit 10.000 Proben und eine Quote falscher Treffer von 0,03%, und ein begutachteter Vergleich von 2026 setzte es in einem Test mit 24 Texten auf Platz eins. Kein Detektor ist für jeden Text genau. Winston nennt den Human Score eine Vorhersage, und die Dokumentation nennt die Bedingungen, unter denen Ergebnisse schwächer sind.
Das hängt vom Test ab. Winston meldet 99,95% Gesamtgenauigkeit für Curia und 99,74% für das frühere Luka-Modell, jeweils auf dem eigenen Evaluationsset. Unabhängige Evidenz zeigt auf kleinen Proben in dieselbe Richtung: 99% standardisierte Genauigkeit im Information-Research-Vergleich von 2026 und eine klare Trennung von KI-Text und klassischer menschlicher Literatur in einer Studie aus der medizinischen Ausbildung von 2025, die bei echten Motivationsschreiben gemischte Ergebnisse lieferte.
Er ist eine Schätzung von 0% bis 100%, wie stark das gesamte Dokument verifiziertem menschlichem Schreiben ähnelt. Nahe 100% ähnelt es stark menschlichem Schreiben, nahe 0% stark KI-generiertem Text, in der Mitte ist das Ergebnis weniger eindeutig. Winston beschreibt ihn als Hauptergebnis und als Vorhersage, nicht als Messung.
Er bedeutet, dass das Modell im Dokument Muster fand, die maschinellem Schreiben ähneln. Er bedeutet nicht, dass ein bestimmter Anteil der Wörter von einer KI stammt: Winston erklärt, ein Wert von 20% heiße nicht, dass genau 80% der Wörter generiert wurden. Ein niedriger Wert ist ein Signal zum Prüfen, ein mittlerer weist oft auf gemischte Autorschaft, starke Bearbeitung, Übersetzung oder zu wenig Text hin.
Kein Detektor ist das, und Winston behauptet es nicht. Die Dokumentation erklärt, Erkennung sei eine Vorhersageaufgabe, in der falsche Treffer und falsche Negativtreffer möglich sind, und kein Ergebnis dürfe als automatisches Schuldurteil gelten. Die veröffentlichte Quote falscher Treffer für Curia liegt bei 0,03% auf dem eigenen englischen Evaluationsset mit 10.000 Proben.
Ja, falsche Treffer sind möglich. Die Dokumentation nennt die schwächeren Situationen: kurze Ausschnitte, Listen, Transkripte, übersetzter Text, Standardformeln, Tabellen und formelhaftes Schreiben. Die Luka-Evaluation nennt auch die Genauigkeit nach Kategorie, mit Essays und Abschlussarbeiten, medizinischen Arbeiten und weiteren Genres bei 100% und Formaten wie Stack-Overflow-Antworten bei 98,05%.
Meist weil das Modell regelmäßige, vorhersehbare Muster im Dokument fand, nicht weil etwas Unzulässiges passiert ist. Formales Register, wiederholte Formulierungen, Standardtexte und eine sehr kurze Probe können den Human Score senken. Vergleiche einen zweiten Detektor, lies die markierten Passagen im Kontext und überarbeite nur, was es braucht.
Mit dem KI-Detektor prüfen →Ja. Winston dokumentiert drei häufige Ursachen: bedeutende menschliche Bearbeitung, die den KI-Wert auch bei maschinellen Originalen senken kann; Übersetzung, die Schreibmuster verändert; und gemischte Autorschaft, bei der menschliche Entwürfe und KI-Hilfe zu einem Mittelwert verschmelzen. Paraphrasierer und Humanizer liegen in derselben Zone.
Winston ist darauf ausgelegt, KI-Text der großen Modellfamilien zu klassifizieren, und die Cureus-Studie fand, dass mit ChatGPT erstellte Motivationsschreiben mit hohen Raten als KI erkannt wurden, während klassische menschliche Literatur meist als menschlich gelesen wurde. Das heißt nicht, dass jeder ChatGPT-Abschnitt markiert wird oder eine Markierung ChatGPT beweist.
Winston erklärt, speziell auf humanisierte Inhalte trainiert zu sein, und dass KI-Text durch einen Paraphrasierer oder Humanizer oft einen höheren Human Score erzielt als unveränderte KI-Ausgabe, während starkes Umschreiben die Sicherheit des Modells senken kann. Die eigene Schlussfolgerung lohnt Wiederholung: Ein mäßig erhöhter Human Score bei paraphrasiertem Inhalt beweist nicht, dass ein Mensch geschrieben hat.
Ja, und Winston nennt Länge den wichtigsten Faktor. Ein Scan braucht mindestens 500 Zeichen, die Dokumentation empfiehlt 300 Wörter oder mehr für ein verlässliches Ergebnis. Kürzere Texte lassen sich prüfen, doch die Sicherheit sinkt, und Winstons Beispiel zeigt, dass ein Ausschnitt mit 50 Wörtern unsicher zurückkommen kann, während derselbe Inhalt mit 500 Wörtern verlässlich ist.
Essays und akademische Arbeiten gelten als die Inhaltstypen, bei denen Winston am besten abschneidet, und die Luka-Evaluation meldet 100% Genauigkeit bei menschlichen Essays und Abschlussarbeiten. Das beschreibt Langprosa aus diesem Evaluationsset. Ein kurzer Auszug, ein stark bearbeiteter Entwurf oder ein übersetzter Essay sind eine andere Messung mit schwächerem Signal.
Es gibt keinen dauerhaften Sieger, weil Vergleiche von Datensatz, Modellversion und Metrik abhängen. Winston meldet starke interne Ergebnisse, führte einen kleinen unabhängigen Vergleich von 2026 an und steht aktuell an der Spitze von DetectArena, einem blinden Crowd-Vergleich mit 90,9% Siegquote und 1821 Elo über 44 gewertete Duelle. Die eigene Benchmark-Seite betont, dass eine Siegquote misst, welches Ergebnis Nutzende bei verborgenen Namen bevorzugten, nicht Sensitivität, und dass die Stichprobe der Plattform bei der Prüfung 491 Duelle und 400 Stimmen umfasste.
Mit dem KI-Detektor vergleichen →Auf den hier zitierten Datensätzen hat Winston die stärkeren Zahlen: 99% gegen 91% für ZeroGPT im Information-Research-Vergleich von 2026, und es führt den blinden DetectArena-Vergleich nach Siegquote an, wo ZeroGPT darunter liegt. Das sind Ergebnisse zu bestimmten Tests und Metriken, kein dauerhaftes Ranking.
Ja, und das ist erwartbar statt ein Zeichen für ein defektes Tool. Unterschiedliche Modelle, Datensätze und Schwellen führen zu unterschiedlichen Lesarten. Winstons Dokumentation warnt, Metriken aus verschiedenen Datensätzen seien nicht austauschbar, und die Cureus-Studie maß genau diese Art von Uneinigkeit bei drei Detektoren auf denselben 25 Proben.
Nicht als einzige Evidenz. Winston erklärt, kein Detektor dürfe als automatisches Schuldurteil gelten, und empfiehlt, den Wert zusammen mit Quellenmaterial, Schreibhistorie und menschlichem Urteil zu nutzen. Für Entscheidungen mit großen Folgen kombiniere ihn mit Entwürfen, Revisionsverlauf, prüfbaren Zitaten, früheren Arbeiten derselben Person und einem Gespräch.
Ja, besonders wenn der Human Score grenzwertig ist oder die Folgen ernst sind. Eine zweite Lesart zeigt, ob der Text nahe an einer Entscheidungsgrenze liegt, und liefert weitere markierte Passagen zur Prüfung. Der KI-Detektor von AI-2-Human liest denselben Text mit seinem eigenen Modell, damit du zwei Interpretationen nebeneinander stellst.
KI-Detektor nutzen →Ja. Füge denselben Abschnitt in den AI-2-Human Detektor ein und du erhältst eine weitere Lesart mit den Stellen, die noch generiert wirken. Zeigen beide Tools auf dieselben Passagen, verdienen sie eine genaue Prüfung. Widersprechen sie sich, weißt du, dass der Wert weich ist, und entscheidest mit mehr Kontext.
Meinen Text prüfen →Quellen und redaktionelle Hinweise
- Winston AI: Bibliothek zu Forschung und Validierung (auf Englisch)
- Winston AI: Wie funktionieren KI-Detektoren? (auf Englisch)
- Winston AI: Wie interpretiert man Ergebnisse eines Textscans? (auf Englisch)
- Winston AI: Welche Inhaltstypen kann ich prüfen? (auf Englisch)
- Winston AI: Falsch-Treffer-Quote und Genauigkeit bei menschlichem Text (auf Englisch)
- Information Research: Verifikation KI-generierter Inhalte (2026, auf Englisch)
- Cureus: Können Weiterbildungsprogramme KI-Nutzung erkennen? (2025, auf Englisch)
AI-2-Human ist weder mit Winston AI verbunden noch von Winston AI unterstützt. Die Dokumentation von Winston AI, veröffentlichte Modellevaluationen und die zitierte unabhängige Forschung wurden am 20. September 2026 eingesehen. Detektormodelle und Benchmark-Ergebnisse ändern sich, prüfe daher die aktuelle Winston-AI-Dokumentation, bevor du dich auf eine hier genannte Zahl verlässt.
Aktualisiert


