KI-Antworten zu psychischer Gesundheit kritisch prüfen

Generative KI kann komplizierte Fragen verständlich beantworten und dabei zugleich überzeugend falsch liegen. Entscheidend ist deshalb nicht, ob eine Antwort klug klingt, sondern wie ihre Aussagen geprüft werden können und welches Risiko ein Fehler hätte.

Warum sprachliche Sicherheit keine fachliche Sicherheit ist

Ein Sprachmodell erzeugt Text, indem es aus seinem Training und dem bisherigen Gespräch wahrscheinliche sprachliche Fortsetzungen berechnet. Das Ergebnis kann erstaunlich klar, einfühlsam und gut gegliedert sein. Diese Eigenschaften sagen jedoch zunächst etwas über die sprachliche Form aus, nicht über die Wahrheit jeder einzelnen Behauptung. Ein Modell kann korrekte Zusammenhänge erklären, eine unklare Frage sinnvoll strukturieren und verschiedene Perspektiven sichtbar machen. Es kann aber ebenso eine Lücke mit einer plausibel klingenden Ergänzung füllen, unterschiedliche Befunde vermischen oder eine Quelle nennen, die nicht existiert. Der Text trägt keinen eingebauten Warnhinweis, sobald seine Wissensgrundlage unsicher wird.

Gerade bei psychologischen und medizinischen Fragen ist diese Trennung wichtig. Eine Antwort kann freundlich formuliert sein und dennoch eine ungeeignete Schlussfolgerung nahelegen. Umgekehrt kann eine knappe, vorsichtige Antwort fachlich verantwortlicher sein, obwohl sie weniger befriedigend wirkt. Untersuchungen zu großen Sprachmodellen zeigen beides: In begrenzten Testumgebungen können sie medizinische Fragen oft gut bearbeiten; ihre Leistung hängt aber stark von Aufgabe, Modellversion, Eingabe und Bewertungskriterium ab. Aus einem guten Durchschnittswert folgt keine Garantie für die konkrete Antwort auf dem eigenen Bildschirm.

Auch Vergleiche mit menschlichen Antworten müssen genau gelesen werden. In einer viel beachteten Studie von Ayers und Kollegen bewerteten Fachpersonen Antworten eines Chatbots auf öffentliche Gesundheitsfragen häufig als qualitativ besser und empathischer als kurze ärztliche Antworten. Das war ein interessantes Ergebnis über diese ausgewählte Stichprobe und die Beurteilung von Texten. Es war kein Nachweis dafür, dass ein Chatbot Diagnosen stellen, Risiken im Einzelfall sicher einschätzen oder eine Behandlung verantworten kann. Die Studie prüfte weder reale Versorgungsergebnisse noch die Vollständigkeit einer Anamnese.

Plausibilität ist deshalb ein nützlicher Startpunkt, aber kein Gütesiegel. Wer eine KI-Antwort prüft, sollte ihre sprachliche Wirkung zunächst von ihrem sachlichen Gehalt trennen: Welche konkreten Tatsachen werden behauptet? Welche Schlussfolgerung wird daraus gezogen? Was bleibt unbekannt? Erst wenn diese Ebenen sichtbar sind, lässt sich sinnvoll entscheiden, welche Teile als Denk- oder Formulierungshilfe taugen und welche eine unabhängige Prüfung benötigen.

Was „Halluzination“ tatsächlich bezeichnet

Der verbreitete Begriff „Halluzination“ beschreibt bei Sprachmodellen Ausgaben, die sachlich falsch oder nicht durch verlässliche Daten gestützt sind, obwohl sie in einer sprachlich stimmigen Form erscheinen. Das Wort darf nicht mit einer menschlichen Wahrnehmungsstörung verwechselt werden. Ein Modell erlebt nichts und glaubt seine Aussage nicht. Es erzeugt eine Sequenz, die im jeweiligen Kontext wahrscheinlich wirkt. Dadurch kann es Namen, Zahlen, Studien oder Begründungen kombinieren, ohne dass eine überprüfbare Quelle dahintersteht.

Fehler entstehen nicht nur als spektakulär erfundene Literaturangabe. Häufiger sind unscheinbare Verschiebungen: Eine Korrelation wird als Ursache beschrieben. Ein Befund aus einer Kinderstichprobe wird auf Erwachsene übertragen. Eine kleine Beobachtungsstudie klingt plötzlich wie ein gesicherter Konsens. Ein Merkmal, das bei manchen Menschen vorkommt, wird als typische Erklärung für eine ganze Diagnosegruppe dargestellt. Bei Autismus, ADHS und ihrem gemeinsamen Auftreten sind solche Überdehnungen besonders problematisch, weil die Forschung in vielen Bereichen heterogen ist und für Erwachsene mit beiden Diagnosen oft nur wenige direkte Daten vorliegen.

Ein weiteres Risiko ist die sogenannte Automatisierungsneigung. Menschen schenken einem technischen Ergebnis eher Vertrauen, wenn es schnell, konsistent und professionell präsentiert wird. Das gilt nicht für alle und nicht in jeder Situation. Dennoch kann ein gut formulierter Text die Schwelle senken, an der eine Behauptung als ausreichend geprüft empfunden wird. Wer erschöpft ist, dringend eine Erklärung sucht oder gerade keinen zugänglichen Ansprechpartner hat, muss zusätzlich gegen den verständlichen Wunsch arbeiten, die offene Frage endlich schließen zu können.

Sprachmodelle können zudem ihre eigene Unsicherheit nur begrenzt verlässlich angeben. Ein vorsichtiger Ton garantiert keine korrekte Antwort, und ein sicherer Ton beweist keine hohe Wahrscheinlichkeit. Aufforderungen wie „Sei dir sicher“ oder „Erfinde nichts“ können das Verhalten verbessern, beseitigen das Grundproblem aber nicht. Ebenso ist die Bitte um Quellen hilfreich, wenn die genannten Arbeiten anschließend tatsächlich geöffnet und geprüft werden. Eine lange Literaturliste allein kann sogar eine Scheinsicherheit erzeugen.

Für die praktische Nutzung folgt daraus eine nüchterne Regel: Je konkreter und folgenreicher eine Behauptung ist, desto weniger darf ihre Prüfung an das Modell selbst delegiert werden. Eine KI kann eine Suchstrategie vorschlagen oder Fachbegriffe erklären. Ob eine Leitlinie wirklich das Behauptete sagt, ob ein Medikament in einer bestimmten Situation geeignet ist oder ob ein Symptom dringend abgeklärt werden muss, braucht eine belastbare externe Grundlage.

Erst die Aufgabe klären, dann die Antwort bewerten

Nicht jede Nutzung generativer KI hat dasselbe Risiko. Es macht einen Unterschied, ob ein Text umformuliert, eine Liste möglicher Fragen erstellt oder eine medizinische Entscheidung vorbereitet wird. Eine einfache Risikoeinteilung hilft, den Prüfaufwand an die möglichen Folgen anzupassen. Bei einer sprachlichen Aufgabe – etwa einen eigenen Gedanken übersichtlicher zu gliedern – lässt sich das Ergebnis meist unmittelbar am eigenen Ziel prüfen. Bei einer sachlichen Erklärung braucht es externe Belege. Bei diagnostischen, therapeutischen, rechtlichen oder akuten gesundheitlichen Fragen darf die KI nicht die entscheidende Instanz sein.

Vor der Bewertung sollte deshalb feststehen, welche Rolle die Antwort überhaupt spielen soll. Soll sie Ideen liefern, Begriffe erklären, Gegenfragen formulieren, Quellen finden oder eine Entscheidung treffen? Besonders der letzte Punkt ist kritisch. Sprachmodelle können Optionen darstellen, besitzen aber weder eine vollständige Kenntnis der persönlichen Situation noch professionelle Verantwortung. Sie sehen keine Körpersprache, prüfen keine Befunde, kennen nicht automatisch alle Medikamente und Begleiterkrankungen und können die Folgen einer Fehlentscheidung nicht auffangen.

Hilfreich ist außerdem, die ursprüngliche Frage aufzubewahren. In längeren Dialogen kann sich der Gegenstand verschieben. Das Modell beantwortet dann vielleicht eine verwandte, aber andere Frage. Eine kurze Zwischenprüfung verhindert, dass eine elegante Erklärung am eigentlichen Anliegen vorbeigeht: Welche Frage sollte beantwortet werden? Welche Annahmen hat das Modell ergänzt? Wurden diese Annahmen vom Nutzer genannt oder nur wahrscheinlich gemacht?

Auch die Form der Eingabe beeinflusst das Ergebnis. Eine suggestive Frage kann eine gewünschte Erklärung begünstigen. Wer schreibt „Warum ist dieses Verhalten eindeutig durch ADHS verursacht?“, setzt bereits voraus, dass die Ursache feststeht. Ergebnisoffener wäre: „Welche möglichen Erklärungen gibt es, welche davon sind untersucht und was spricht jeweils dagegen?“ Diese Form garantiert keine korrekte Antwort, fordert aber eher eine Differenzierung als eine Bestätigung.

Ein guter Prüfprozess bewertet somit nicht nur den Text, sondern auch Auftrag und Entstehungsbedingungen. Das ist keine besondere Misstrauensregel gegen KI. Auch menschliche Auskünfte müssen nach Kompetenz, Datenlage und Interessenkonflikten beurteilt werden. Der Unterschied liegt darin, dass ein Sprachmodell eine große Bandbreite von Themen mit derselben flüssigen Oberfläche behandeln kann. Gerade diese Gleichförmigkeit kann verdecken, wie unterschiedlich belastbar seine Aussagen in verschiedenen Bereichen sind.

Behauptungen in prüfbare Teile zerlegen

Eine lange Antwort wirkt oft wie ein geschlossenes Argument. Für die Prüfung ist es günstiger, sie in einzelne Aussagen zu zerlegen. Tatsachenbehauptungen betreffen etwa Häufigkeiten, diagnostische Kriterien, Wirkungen oder Risiken. Begriffsdefinitionen legen fest, was mit einem Ausdruck gemeint ist. Interpretationen verbinden Befunde zu einer Erklärung. Empfehlungen schlagen eine Handlung vor. Jede dieser Ebenen braucht eine andere Art der Kontrolle.

Bei einer Häufigkeitsangabe sollte die ursprüngliche Studie oder eine systematische Übersicht auffindbar sein. Entscheidend sind Population, Messmethode und Bezugsgröße. Eine Zahl aus einer Spezialambulanz beschreibt nicht automatisch alle Erwachsenen. Bei diagnostischen Aussagen sind anerkannte Klassifikationen und Leitlinien relevanter als ein populärer Blog. Bei Behandlungsempfehlungen zählen Nutzen, Risiken, Gegenanzeigen und die Qualität der Evidenz. Eine plausible Interpretation kann als Hypothese nützlich sein, muss aber als solche erkennbar bleiben.

Ein praktischer Schritt besteht darin, die KI selbst um eine Liste der überprüfbaren Behauptungen zu bitten. Diese Liste ist jedoch nur eine Arbeitshilfe. Anschließend sollte jede wichtige Aussage in einer verlässlichen Quelle gesucht werden. Wissenschaftliche Originalarbeiten, systematische Reviews, Leitlinien und Informationen anerkannter Institutionen sind stärker als Zusammenfassungen ohne transparenten Belegweg. Bei einer Studie reicht es nicht, dass Titel und DOI existieren. Abstract oder Volltext müssen zeigen, dass tatsächlich die genannte Frage, Population und Aussage untersucht wurden.

Besonders aufmerksam sollte man bei eindeutigen Ursache-Wirkungs-Sätzen werden. Viele psychologische Studien sind querschnittlich: Sie erfassen zwei Merkmale zum selben Zeitpunkt. Daraus lässt sich ein Zusammenhang beschreiben, aber nicht sicher ableiten, welches Merkmal das andere verursacht. Sprachmodelle neigen wie populäre Darstellungen dazu, aus „steht in Beziehung zu“ ein „führt zu“ zu machen. Dasselbe gilt für Gruppenunterschiede. Ein Mittelwertunterschied erlaubt keine zuverlässige Vorhersage über eine einzelne Person.

Die Zerlegung schützt auch vor einem Alles-oder-nichts-Urteil. Eine Antwort kann in ihrer Grundstruktur hilfreich sein und einzelne falsche Angaben enthalten. Umgekehrt macht eine korrekte Definition nicht automatisch die anschließende Empfehlung richtig. Statt die gesamte Ausgabe als wahr oder wertlos einzuordnen, lässt sich markieren: belegt, plausibel aber ungeprüft, widersprochen, nicht ermittelbar. Diese abgestufte Bewertung passt besser zur tatsächlichen Qualität vieler KI-Texte.

Quellen prüfen, nicht nur Quellen verlangen

Eine Quellenangabe ist erst dann nützlich, wenn sie auffindbar, korrekt wiedergegeben und für die konkrete Behauptung geeignet ist. Bei KI-generierten Literaturhinweisen sollten mindestens Autorenschaft, Titel, Jahr, Zeitschrift und DOI oder stabile URL übereinstimmen. Schon kleine Abweichungen können zeigen, dass Teile mehrerer Publikationen vermischt wurden. DOI-Links lassen sich direkt öffnen; bibliografische Daten können zusätzlich in wissenschaftlichen Datenbanken geprüft werden.

Danach beginnt die inhaltliche Kontrolle. Wurde mit Erwachsenen oder Kindern geforscht? Ging es um diagnostizierte Personen, um selbstberichtete Merkmale oder um eine allgemeine Stichprobe? War die Studie experimentell, beobachtend oder eine qualitative Befragung? Wie groß und wie selektiv war die Gruppe? Welche Schlussfolgerung ziehen die Autorinnen und Autoren selbst – und welche ausdrücklich nicht? Eine Quelle kann real sein und trotzdem als Beleg ungeeignet bleiben.

Systematische Übersichtsarbeiten und Metaanalysen bündeln mehrere Studien, sind aber nicht automatisch fehlerfrei. Ihre Aussage hängt von Suchstrategie, Einschlusskriterien, Qualität der Ausgangsstudien und möglicher Publikationsverzerrung ab. Leitlinien verbinden Forschung mit fachlicher Bewertung und sind für klinische Entscheidungen oft besonders wichtig. Sie gelten jedoch für definierte Versorgungskontexte und müssen aktuell sein. Bei schnell veränderlicher KI-Forschung ist zusätzlich das Datum zentral, weil Modelle und Einsatzbedingungen sich rasch ändern.

Wichtig ist auch die Unabhängigkeit der Quellen. Zehn Webseiten, die dieselbe Pressemitteilung abschreiben, ergeben keine zehn Belege. Idealerweise führt die Prüfung zurück zur Originalarbeit oder zu einer Institution, die ihre Bewertungsmethode offenlegt. Wenn die KI eine Aussage nicht mit einer überprüfbaren Quelle verbinden kann, sollte sie als unbestätigt behandelt werden – nicht als wahrscheinlich wahr, nur weil sie gut in das Gesamtbild passt.

Bei sensiblen Fragen kann eine zweite, unabhängige Suche sinnvoll sein, ohne den Wortlaut der KI-Antwort zu übernehmen. Wer nur nach der bereits gelieferten Behauptung sucht, findet leichter Bestätigungen. Eine neutral formulierte Suche nach dem Thema, möglichen Gegenbefunden und methodischen Grenzen reduziert diesen Bestätigungsfehler. Das Ziel ist nicht, jede Antwort bis ins letzte Detail akademisch zu prüfen, sondern die entscheidenden Aussagen an eine Quelle zu binden, die außerhalb des generierenden Systems steht.

Was bei Autismus, ADHS und AuDHS besonders zu beachten ist

Im Internet kursieren viele eingängige Erklärungen zu Autismus und ADHS. Manche beruhen auf Forschung, andere auf klinischer Erfahrung, Community-Begriffen oder persönlichen Berichten. Alle können für unterschiedliche Zwecke wertvoll sein. Problematisch wird es, wenn diese Ebenen miteinander verschmelzen. Ein Sprachmodell kann einen verbreiteten Begriff aufnehmen und so darstellen, als sei er diagnostisch definiert oder durch viele Studien bestätigt. Deshalb sollte immer gefragt werden, welchen Status ein Begriff tatsächlich hat.

Ein Beispiel sind populäre Kurzformeln über Dopamin, Empathie oder „Rejection Sensitive Dysphoria“. Sie können reale Erfahrungen ansprechen, bilden die Forschung aber häufig gröber ab, als es ihr sicherer Stand erlaubt. Bei AuDHS kommt hinzu, dass Befunde zu Autismus allein und ADHS allein nicht einfach addiert werden dürfen. Wenn direkte Studien zum gemeinsamen Auftreten fehlen, muss genau diese Lücke sichtbar bleiben. Eine KI-Antwort, die aus zwei getrennten Literaturfeldern eine eindeutige AuDHS-Erklärung konstruiert, überschreitet die Datenlage.

Auch individuelle Selbstbeobachtung und wissenschaftliche Allgemeinaussage müssen getrennt bleiben. Ein Mensch kann sich in einer Beschreibung präzise wiedererkennen, ohne dass daraus eine Diagnose folgt. Umgekehrt widerlegt eine uneindeutige Studienlage nicht die persönliche Erfahrung. Wissenschaftliche Forschung beantwortet Fragen über Muster in untersuchten Gruppen; sie entscheidet nicht allein, was eine einzelne Person erlebt hat. Generative KI kann diese Unterscheidung verwischen, weil sie persönliche Sprache und Fachsprache nahtlos verbindet.

Wer KI zur Vorbereitung einer Diagnostik nutzt, kann etwa Beobachtungen sortieren, Zeitverläufe aufschreiben oder Fragen für ein Gespräch sammeln. Das sind strukturierende Aufgaben. Ungeeignet ist die KI als abschließender Test, als Bestätigung einer Diagnose oder als Ersatz für Differentialdiagnostik. Ähnliche Schwierigkeiten können unterschiedliche Ursachen haben, gemeinsam auftreten oder durch Schlaf, körperliche Erkrankungen, Medikamente, Belastungen und andere psychische Probleme beeinflusst werden.

Schließlich braucht Barrierefreiheit Aufmerksamkeit. Eine zugängliche, geduldige Textoberfläche kann für Menschen hilfreich sein, denen spontane Gespräche schwerfallen. Dieser Vorteil ist real, hebt aber die fachlichen Grenzen nicht auf. Gerade weil der Zugang niedrigschwellig ist, sollte die Antwort klar markieren, wann ein verlässlicher menschlicher Ansprechpartner, eine Leitlinie oder eine akute Hilfe notwendig ist.

Ein risikobasiertes Prüfverfahren für den Alltag

Ein brauchbares Verfahren beginnt mit der Frage nach dem möglichen Schaden. Bei geringem Risiko kann eine KI als Ideenpartner dienen. Bei mittlerem Risiko werden zentrale Aussagen gegen unabhängige Quellen geprüft. Bei hohem Risiko – etwa akuten Symptomen, Medikamentenänderungen, Suizidgedanken, rechtlichen Fristen oder finanziell folgenreichen Entscheidungen – darf die Antwort nicht handlungsleitend bleiben. Dann ist professionelle oder zuständige Hilfe erforderlich.

Im zweiten Schritt wird die Ausgabe markiert: Was ist Beobachtung, was Definition, was Interpretation, was Empfehlung? Danach werden die zwei oder drei entscheidenden Behauptungen ausgewählt. Sie erhalten nicht automatisch denselben Prüfaufwand wie nebensächliche Formulierungen. Eine behauptete Nebenwirkung ist wichtiger als eine historische Randnotiz. Anschließend werden Quellen außerhalb des Chats geöffnet und auf Population, Methode, Aktualität und tatsächliche Aussage kontrolliert.

Der dritte Schritt ist ein Gegencheck. Welche andere Erklärung wäre möglich? Welche Information fehlt? Würde die Empfehlung anders ausfallen, wenn eine zentrale Annahme nicht stimmt? Bei psychischen Beschwerden kann dies bedeuten, körperliche Ursachen oder Begleiterkrankungen mitzudenken. Bei Forschungsaussagen kann es bedeuten, nach einer systematischen Übersicht statt nach einer einzelnen positiven Studie zu suchen.

Im vierten Schritt wird die Nutzung dokumentiert, wenn die Antwort für einen Text, eine Entscheidung oder ein Gespräch wichtig ist. Dazu gehören Datum, Modellversion soweit bekannt, genaue Eingabe, verwendete Quellen und eigene Änderungen. Sprachmodelle können bei derselben Frage unterschiedlich antworten; eine spätere Reproduktion ist deshalb nicht sicher. Dokumentation macht sichtbar, was tatsächlich geprüft wurde.

Dieses Verfahren kostet Zeit. Es ist nicht für jede harmlose Formulierung nötig. Sein Zweck ist, Vertrauen nicht nach Gefühl zu verteilen, sondern nach Risiko und Beleglage. Eine hilfreiche Antwort darf hilfreich bleiben, auch wenn sie geprüft wird. Kritische Prüfung ist kein Zeichen dafür, dass das Werkzeug wertlos wäre. Sie ist die Bedingung dafür, seine Stärken zu nutzen, ohne seine sprachliche Gewandtheit mit Verantwortung zu verwechseln.

Wo die Forschung noch nicht reicht

Die Forschung zu generativer KI entwickelt sich schneller als langfristige Wirkungsstudien durchgeführt werden können. Viele Untersuchungen testen standardisierte Fragen, Prüfungsaufgaben oder Bewertungen durch Fachpersonen. Solche Designs zeigen, was ein Modell unter bestimmten Bedingungen leisten kann. Sie sagen weniger darüber aus, wie Menschen Antworten in langen, emotional bedeutsamen Dialogen nutzen, wie Fehler erkannt werden oder wie sich wiederholte Nutzung auf Hilfesuche und Entscheidungen auswirkt.

Für autistische Erwachsene, Erwachsene mit ADHS und Menschen mit beiden Diagnosen gibt es bisher nur begrenzte direkte Forschung zur Nutzung allgemeiner Sprachmodelle als Alltagshilfe. Plausible Vorteile – schriftliche Kommunikation, zeitliche Flexibilität, wiederholbare Erklärungen – dürfen daher nicht als nachgewiesene spezifische Wirkung ausgegeben werden. Ebenso wenig ist belegt, dass diese Gruppen grundsätzlich anfälliger für falsche Antworten wären. Unterschiede in Bedarf, Medienkompetenz, Stress und Unterstützung sind wahrscheinlich wichtiger als pauschale Diagnoseannahmen.

Modellleistungen verändern sich außerdem durch Updates. Eine Untersuchung zu einer früheren Version beschreibt nicht automatisch ein heutiges System. Anbieterabhängige Sicherheitsregeln, verfügbare Suchfunktionen und Datenschutzbedingungen unterscheiden sich. Deshalb braucht jede Nutzung neben der wissenschaftlichen Evidenz eine aktuelle technische und rechtliche Prüfung. Vertrauliche Gesundheitsdaten gehören nicht unbedacht in einen Dienst, dessen Speicherung und Weiterverwendung unklar ist.

Die derzeit beste Schlussfolgerung ist weder blinder Optimismus noch pauschale Ablehnung. Generative KI kann Denken, Formulieren und Informationssuche unterstützen. Sie besitzt aber keine verlässliche Selbstkontrolle, die jede falsche Aussage kennzeichnet, und keine professionelle Verantwortung für Folgen. Wer beides gleichzeitig ernst nimmt, kann einen sinnvollen Mittelweg wählen: das Werkzeug für Struktur und Zugang nutzen, entscheidende Tatsachen außerhalb des Systems prüfen und folgenschwere Entscheidungen dort belassen, wo qualifizierte Menschen Verantwortung übernehmen können.

Warum ein langes Gespräch zusätzliche Fehlerquellen schafft

Dialogische Systeme wirken oft so, als hätten sie den ganzen bisherigen Austausch zu einem stabilen Bild der fragenden Person verbunden. Tatsächlich arbeiten Modelle mit dem jeweils verfügbaren Kontextfenster und den Informationen, die darin technisch berücksichtigt werden. Frühere Angaben können verkürzt, falsch gewichtet oder durch spätere Formulierungen überlagert werden. Selbst wenn ein Dienst Erinnerungsfunktionen anbietet, bedeutet das nicht, dass daraus eine vollständige und klinisch brauchbare Lebensgeschichte entsteht.

In langen Gesprächen bildet sich außerdem leicht eine gemeinsame Erzählung. Eine frühe Vermutung wird in späteren Fragen vorausgesetzt, das Modell greift sie wieder auf, und jede Wiederholung lässt sie vertrauter wirken. Dieser Effekt ähnelt einer zirkulären Bestätigung: Die neue Antwort scheint die alte Annahme zu stützen, obwohl beide auf derselben ungeprüften Ausgangsbehauptung beruhen. Wer etwa zunächst fragt, ob ein Verhalten durch ADHS erklärbar sei, und später nur noch nach den Folgen „dieses ADHS-Merkmals“ fragt, erhält eine immer geschlossenere Geschichte, ohne dass die erste Zuordnung je unabhängig geprüft wurde.

Ein Gegenmittel ist ein bewusster Neustart der Prüfung. Die zentrale Frage kann ohne die bisherige Deutung neu formuliert werden. Hilfreich sind Aufforderungen, alternative Erklärungen, fehlende Informationen und Gegenargumente aufzuschreiben. Noch wichtiger ist die Kontrolle außerhalb des Systems. Ein zweiter Chat mit derselben Modellfamilie ist keine wirklich unabhängige Quelle; ähnliche Trainingsdaten und Antwortmuster können denselben Fehler reproduzieren.

Auch die emotionale Wirkung eines langen Dialogs verdient Aufmerksamkeit. Ein System ist jederzeit verfügbar, wird nicht ungeduldig und kann eine Formulierung mehrfach erklären. Das kann Zugänglichkeit schaffen. Gleichzeitig ist seine scheinbare Anteilnahme kein menschliches Verstehen und keine therapeutische Beziehung. Das Modell kennt Konsequenzen nicht aus eigener Erfahrung, kann keine nonverbalen Veränderungen beobachten und ist nicht verlässlich in der Lage, eine sich verschärfende Krise über längere Zeit richtig einzuschätzen.

Wer merkt, dass der Chat zur einzigen Stelle geworden ist, an der schwierige Fragen besprochen werden, sollte diese Funktion nicht moralisch abwerten, aber praktisch prüfen. Welche Bedürfnisse erfüllt das Gespräch? Welche davon brauchen zusätzlich einen Menschen, eine Fachstelle oder eine belastbare Information? Die sinnvolle Grenze liegt nicht bei einer bestimmten Zahl von Nachrichten. Sie liegt dort, wo das Werkzeug Verantwortung übernimmt, die es technisch und institutionell nicht tragen kann.

Datenschutz gehört zur inhaltlichen Zuverlässigkeit

Bei psychischen und medizinischen Fragen sind die eingegebenen Daten häufig sensibel. Namen, Diagnosen, Medikamente, Beziehungsdetails, Arbeitgeber oder zeitlich genaue Ereignisse können zusammen eine Person identifizierbar machen, selbst wenn keine Adresse genannt wird. Ob und wie ein Anbieter Inhalte speichert, zu Sicherheitszwecken prüft oder für die Weiterentwicklung nutzt, hängt vom konkreten Dienst, Tarif, Standort und den aktuellen Einstellungen ab. Allgemeine Aussagen wie „Der Chat ist privat“ sind deshalb ohne Prüfung der geltenden Bedingungen nicht belastbar.

Datensparsamkeit ist eine praktische Schutzmaßnahme. Für viele Strukturierungsaufgaben reichen abstrahierte Angaben: „eine nahestehende Person“ statt eines Namens, ein ungefährer Zeitraum statt eines exakten Datums und eine Beschreibung des Problems ohne identifizierende Nebendetails. Dokumente sollten nicht vollständig hochgeladen werden, wenn einzelne Ausschnitte genügen. Besonders vorsichtig ist bei Arztbriefen, Diagnostikunterlagen, Daten Dritter und Informationen über Kinder vorzugehen.

Datenschutz und Richtigkeit hängen zusammen, weil ein Modell nur mit den gegebenen Angaben arbeiten kann. Wer aus Schutzgründen Details weglässt, erhält möglicherweise eine weniger passende Antwort. Die Lösung ist nicht automatisch, mehr preiszugeben. Stattdessen muss die Aufgabe angepasst werden. Man kann um allgemeine Fragen für ein Arztgespräch bitten, ohne eine individuelle Diagnose einzufordern. Man kann eine Textstruktur prüfen lassen, nachdem identifizierende Angaben entfernt wurden. So bleibt die Nutzung dem tatsächlichen Informationsniveau angemessen.

Auch lokal gespeicherte Protokolle verdienen Schutz. Ein exportierter Chat kann Gesundheitsdaten und intime Überlegungen enthalten. Zugriffsschutz, sichere Ablage und eine bewusste Entscheidung über Aufbewahrung sind ebenso wichtig wie die Einstellungen beim Anbieter. Wer eine KI-Antwort später veröffentlicht, muss außerdem prüfen, ob darin persönliche Daten, fremde Aussagen oder urheberrechtlich geschützte Passagen enthalten sind.

Diese Fragen sind keine bloße Technikbeilage. Ein System kann inhaltlich hilfreich sein und zugleich für eine bestimmte Information datenschutzrechtlich ungeeignet. Zu einer verantwortlichen Bewertung gehört daher immer: Welche Daten braucht die Aufgabe wirklich, wer kann sie verarbeiten, wie lange bleiben sie erhalten und welche Folgen hätte eine unbeabsichtigte Offenlegung?

Warnzeichen in einer KI-Antwort

Bestimmte Merkmale sollten den Prüfbedarf erhöhen. Dazu gehören exakte Zahlen ohne nachvollziehbare Quelle, absolute Aussagen über heterogene Gruppen, angeblich eindeutige Ursachen für komplexe Beschwerden und Behandlungsvorschläge ohne Fragen nach Risiken oder Gegenanzeigen. Ebenso auffällig sind erfundene Zitate, nicht auffindbare Fachbegriffe und Literaturangaben, deren Titel perfekt zur Frage passen, aber in keiner Datenbank erscheinen.

Ein weiteres Warnzeichen ist eine Antwort, die die gewünschte Diagnose oder Erklärung zu schnell bestätigt. Gute diagnostische Einordnung braucht Entwicklung, Beeinträchtigung, Kontext, Alternativerklärungen und häufig mehrere Informationsquellen. Ein Chat, der aus wenigen Sätzen eine sichere Zuordnung ableitet, besitzt nicht plötzlich mehr Gewissheit, weil die Erklärung emotional stimmig ist. Besonders kritisch sind Aussagen, die von professioneller Hilfe abraten, Medikamentendosen verändern oder akute Symptome verharmlosen.

Auch übermäßige Vollständigkeit kann täuschen. Ein sauber gegliederter Text mit Definition, Ursachen, Folgen und Lösung vermittelt den Eindruck, die Frage sei umfassend geklärt. In Wirklichkeit können entscheidende Unsicherheiten fehlen. Eine gute Gegenfrage lautet deshalb: Was müsste man wissen, um diese Antwort nicht nur plausibel, sondern tragfähig zu machen? Fehlen Verlauf, Kontext, Messung oder eine ärztliche Untersuchung, muss die Schlussfolgerung entsprechend begrenzt bleiben.

Widersprüche innerhalb des Dialogs sind ebenfalls bedeutsam. Wenn dieselbe Frage nach einer kleinen Umformulierung eine gegenteilige Antwort erzeugt, ist nicht die angenehmere Version automatisch richtig. Beide Ausgaben sollten auf gemeinsame, überprüfbare Aussagen reduziert werden. Lässt sich der Unterschied nicht durch eine mehrdeutige Frage erklären, ist das ein Signal, keine der beiden Schlussfolgerungen ungeprüft zu verwenden.

Schließlich ist Vorsicht geboten, wenn die KI ihre eigene Autorität betont. Formulierungen wie „wissenschaftlich bewiesen“ oder „Experten sind sich einig“ brauchen konkrete Belege. Wissenschaftlicher Konsens entsteht nicht durch den Ton einer Zusammenfassung. Er zeigt sich in übereinstimmenden hochwertigen Studien, Leitlinien und transparenten Bewertungen. Wo diese fehlen, ist eine ehrliche Antwort möglicherweise weniger befriedigend: Die Frage ist offen, die Daten sind uneinheitlich oder die Übertragung auf diesen Einzelfall ist nicht möglich.

Akute Situationen brauchen einen anderen Weg

Bei unmittelbarer Gefahr ist ein Prüfgespräch mit einer KI nicht der richtige Hauptweg. Dazu gehören etwa Suizidabsichten, schwere akute körperliche Symptome, Gewaltgefahr, Vergiftung oder eine rasche Verschlechterung des Zustands. Ein Modell kann Notfallhinweise geben, doch seine Einschätzung kann unvollständig sein. In solchen Situationen zählen örtliche Notruf- und Krisendienste, ärztliche Versorgung oder eine erreichbare vertraute Person. Die konkreten Anlaufstellen unterscheiden sich nach Land und Region.

Auch außerhalb eines Notfalls sollte eine KI nicht eigenmächtig über Beginn, Absetzen oder Dosierung verschreibungspflichtiger Medikamente entscheiden. Wechselwirkungen, körperliche Erkrankungen, Schwangerschaft, andere Medikamente und individuelle Reaktionen lassen sich nicht aus einem kurzen Chat zuverlässig beurteilen. Eine Liste möglicher Fragen für die behandelnde Person kann dagegen sinnvoll sein. Sie unterstützt das Gespräch, ohne die Entscheidung vorwegzunehmen.

Bei psychischer Belastung kann die Grenze weniger sichtbar sein. Ein Text kann beruhigen, obwohl eine professionelle Abklärung nötig wäre, oder alarmieren, obwohl eine harmlose Erklärung wahrscheinlicher ist. Beides zeigt, warum die emotionale Wirkung kein ausreichendes Bewertungskriterium ist. Hilfreich ist eine vorab festgelegte Schwelle: Welche Symptome, Dauer oder Beeinträchtigung führen unabhängig von der Chatantwort dazu, fachliche Hilfe zu suchen?

Die KI kann in diesem Prozess eine unterstützende Nebenrolle übernehmen. Sie kann eine Symptombeschreibung ordnen, Fragen priorisieren oder helfen, einen Terminwunsch klar zu formulieren. Dabei sollte die fertige Notiz als eigene Darstellung geprüft werden. Das Modell darf keine Symptome ergänzen, nur weil sie zu einem vermuteten Bild passen. Wer den Text an Fachpersonen weitergibt, sollte unterscheiden können, welche Beobachtungen selbst gemacht und welche Formulierungen von der KI vorgeschlagen wurden.

Ein verantwortlicher Umgang endet somit nicht bei „glaube der KI nicht alles“. Er weist jeder Aufgabe einen passenden Ort zu. Struktur, Sprache und Ideensammlung können im Chat liegen. Diagnose, Behandlung und Krisenverantwortung gehören in tragfähige menschliche und institutionelle Zusammenhänge.

Quellen

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Teilen

Weitere Gedanken

Neues aus der AuDHS-Welt

Neue Inhalte, Wissen und Werkzeugkisten-Downloads direkt per Mail. Nicht ständig. Nur wenn es wirklich etwas Neues gibt.