Online-Fragebögen können Beobachtungen ordnen und eine Abklärung anstoßen. Sie können jedoch weder eine Diagnose bestätigen noch zuverlässig alle Erwachsenen erkennen – und ihre Aussagekraft hängt stark davon ab, wer sie in welchem Kontext ausfüllt.
Ein Online-Selbsttest wirkt angenehm eindeutig: Fragen beantworten, Punkte addieren, Ergebnis erhalten. Diagnostik ist leider weniger kooperativ. Selbstberichtsskalen messen, wie eine Person bestimmte Aussagen im Moment versteht und auf sich bezieht; sie prüfen nicht automatisch Entwicklung, Beeinträchtigung, Kontext oder alternative Erklärungen. Ein hoher Wert kann einen begründeten Anlass für weitere Abklärung anzeigen, aber auch durch Angst, Depression, Traumafolgen, andere neuroentwicklungsbezogene Merkmale oder die Auswahl einer bereits stark belasteten Nutzergruppe beeinflusst sein. Ein niedriger Wert wiederum kann durch unpassende Fragen, Masking, wörtliche Interpretation oder mangelnden Vergleich mit anderen entstehen.
Der Begriff „Screening“ ist entscheidend. Ein Screening soll in einer definierten Population möglichst praktikabel Personen identifizieren, bei denen eine genauere Untersuchung sinnvoll sein könnte. Dafür werden häufig Sensitivität und Spezifität angegeben: Sensitivität beschreibt vereinfacht, wie viele tatsächlich Betroffene erkannt werden, Spezifität, wie viele Nichtbetroffene korrekt unauffällig bleiben. Diese Werte sind keine festen Eigenschaften eines Tests, die überall gleich gelten. Sie verändern sich mit Stichprobe, Cut-off, Durchführung und dem Anteil tatsächlich Betroffener in der untersuchten Gruppe.
Der Kontext verändert den Zahlenwert
Ein Instrument kann in der ursprünglichen Validierungsstudie beeindruckend abschneiden und in einer spezialisierten Erwachsenenambulanz deutlich weniger trennscharf sein. Dort haben viele Personen komplexe psychische oder neuroentwicklungsbezogene Beschwerden, auch wenn sie am Ende keine Autismusdiagnose erhalten. Beim RAADS-R zeigte eine kleine retrospektive Studie mit 50 Erwachsenen aus einem spezialisierten NHS-Dienst keinen Zusammenhang zwischen Gesamtscore und späterem diagnostischem Ergebnis. Das widerlegt nicht jede mögliche klinische Nutzung, zeigt aber deutlich, dass ein online selbst erhobener Wert keine zuverlässige Bestätigung ist. Auch Studien zu AQ, RAADS-R und ADOS bei Erwachsenen mit komplexer psychiatrischer Vorgeschichte fanden nur mäßige diagnostische Genauigkeit einzelner Instrumente.
NICE empfiehlt für Erwachsene bei möglichem Autismus den AQ-10 als eine mögliche Entscheidungshilfe für eine umfassende Abklärung, lässt aber ausdrücklich Raum für klinisches Urteil. Das ist etwas anderes als die Behauptung, der AQ-10 diagnostiziere Autismus. Ein Grenzwert steuert einen nächsten Schritt innerhalb eines Versorgungspfads; er ersetzt den Pfad nicht. Zudem wurden viele Instrumente in Stichproben entwickelt, die die Vielfalt spät diagnostizierter Erwachsener nur begrenzt abbilden. Sprachliche, kulturelle und geschlechtsspezifische Unterschiede sowie intellektuelle oder körperliche Beeinträchtigungen können die Übertragbarkeit zusätzlich begrenzen.
Für ADHS wird häufig die Adult ADHD Self-Report Scale, kurz ASRS, verwendet. Sie kann aktuelle ADHS-verdächtige Beschwerden effizient erfassen und ist in unterschiedlichen Erwachsenenpopulationen untersucht worden. Doch auch hier gilt: Konzentrationsprobleme und innere Unruhe sind nicht exklusiv für ADHS. Schlafmangel, affektive Erkrankungen, Angst, Substanzkonsum und hohe Dauerbelastung können Antworten verändern. Die ASRS fragt zudem aktuelle Erfahrungen ab; für eine Diagnose müssen Fachpersonen zusätzlich den Entwicklungsbeginn, mehrere Lebensbereiche, Beeinträchtigung und Differentialdiagnosen prüfen.
Warum positive Ergebnisse im Internet besonders häufig sind
Die Aussagekraft eines positiven Tests hängt auch von der sogenannten Vortestwahrscheinlichkeit ab. Wer gezielt „Habe ich Autismus?“ sucht, folgt vielleicht bereits einer starken Vermutung, hat belastende Erfahrungen oder kommt über Inhalte, die bestimmte Merkmale betonen. Online-Angebote testen daher selten eine zufällige Bevölkerungsstichprobe. Zusätzlich werden Ergebnisse oft ohne Informationen zu Fehlalarmen präsentiert und mit Formulierungen wie „sehr wahrscheinlich“ versehen, obwohl die wissenschaftliche Grundlage nur eine Screeningfunktion trägt. Das Ergebnis fühlt sich persönlich präzise an, kann statistisch aber überraschend unspezifisch sein.
Selbsttests haben dennoch einen legitimen Nutzen. Fragen können Erfahrungen benennbar machen, Erinnerungen anregen und zeigen, welche Themen in einem Fachgespräch angesprochen werden sollten. Sinnvoll ist, nicht nur die Punktzahl aufzubewahren, sondern zu notieren, welche Items schwer zu beantworten waren und welche konkreten Beispiele dahinterstehen. Ebenso aufschlussreich sind Aussagen, bei denen die Antwort je nach Kontext wechselt. Diagnostisch relevant ist nicht die Fähigkeit, einen Fragebogen möglichst eindeutig zu machen, sondern die Genauigkeit der eigenen Beschreibung.
Es gibt auch Gründe für falsch niedrige Werte. Erwachsene können Kompensationsstrategien so selbstverständlich finden, dass sie die zugrunde liegende Schwierigkeit nicht mehr bemerken. Manche Items setzen soziale oder berufliche Situationen voraus, die eine Person meidet oder delegiert. Andere Formulierungen sind kulturell eng, binär oder auf ein stereotype Bild zugeschnitten. Ein niedriger Score schließt Autismus oder ADHS deshalb nicht automatisch aus, insbesondere wenn die Lebensgeschichte und deutliche Beeinträchtigungen weiterhin Fragen aufwerfen.
Selbstbeobachtung ohne Testtraining
Problematisch wird Recherche, wenn sie sich in eine Anleitung verwandelt, wie Fragen „richtig“ beantwortet werden müssen, um einen Grenzwert zu erreichen. Das kann die spätere Abklärung verzerren und erhöht nicht die Wahrscheinlichkeit eines zutreffenden Ergebnisses. Besser ist, Unsicherheit sichtbar zu lassen: „Ich weiß nicht, ob das zutrifft, weil meine Partnerin die Terminplanung übernimmt“ ist diagnostisch wertvoller als ein erzwungenes Ja oder Nein. Dasselbe gilt für schwankende Antworten in guten und schlechten Phasen. Ein Test ist ein Messinstrument, kein Loyalitätstest gegenüber der eigenen Vermutung.
Wer mehrere Fragebögen nutzt, sollte die Resultate als Hinweise nebeneinanderlegen, nicht als Abstimmung. Zehn positive Online-Tests sind nicht zehn unabhängige Belege, wenn sie ähnliche Fragen stellen, dieselben Verzerrungen haben und von derselben Person im selben Erwartungskontext ausgefüllt wurden. Für ein Fachgespräch können sie dennoch Ausgangspunkte liefern: Welche Muster reichen in die Kindheit zurück? Wo bestehen reale Einschränkungen? Welche anderen Erklärungen wurden bereits geprüft? Und was soll eine mögliche Diagnose praktisch klären?
Die nüchterne Schlussfolgerung ist weder „Selbsttests sind wertlos“ noch „Betroffene wissen es immer selbst am besten“. Menschen besitzen unverzichtbares Wissen über ihr eigenes Erleben, während diagnostische Verfahren zusätzliche Perspektiven und Vergleichsrahmen beitragen. Gute Abklärung braucht beides. Ein Fragebogen kann die Tür markieren. Durchgehen muss man weiterhin mit einer vollständigen Geschichte.
Messgüte verständlich lesen
Neben Sensitivität und Spezifität sind positive und negative Vorhersagewerte wichtig. Sie beantworten, wie wahrscheinlich ein auffälliges oder unauffälliges Ergebnis in einer konkreten Population zutrifft, und hängen stark von der dortigen Häufigkeit der Diagnose ab. Ein Test kann hohe Sensitivität besitzen und dennoch viele falsch positive Resultate erzeugen, wenn er in einer Gruppe mit niedriger Vortestwahrscheinlichkeit eingesetzt wird. Umgekehrt kann ein Instrument in einer vorselektierten Spezialambulanz weniger gut zwischen verschiedenen komplexen Störungsbildern unterscheiden. Prozentwerte aus einer Validierungsstudie sollten daher nie ohne Studienpopulation zitiert werden.
Auch Reliabilität und Validität sind verschieden. Ein Fragebogen kann Antworten zuverlässig wiederholen, aber dennoch nicht spezifisch genug das gewünschte Konstrukt messen. Selbstberichte zu Autismus oder ADHS enthalten teilweise Items zu allgemeiner Belastung, sozialer Unsicherheit oder Organisation, die auch bei anderen Diagnosen erhöht sind. Übersetzungen, Onlineformat und selbst gewählte Cut-offs können die ursprünglichen Gütekriterien weiter verändern. Ein professionell aussehendes Diagramm repariert diese methodischen Verschiebungen nicht.
Für die persönliche Nutzung bedeutet das: Der genaue Zahlenwert ist weniger wichtig als der Anlass zur vertieften Frage. Wer ein Ergebnis zu einer Praxis mitbringt, kann Herkunft, Version und Ausfüllsituation nennen. Fachpersonen können dann entscheiden, ob und wie es in die Gesamtschau passt. Wiederholtes Ausfüllen bis zu einem stabilen oder gewünschten Wert erhöht die diagnostische Information kaum, kann aber die eigene Aufmerksamkeit stark auf einzelne Formulierungen verengen.
Ein Ergebnis braucht einen Verwendungszweck
Vor dem Ausfüllen ist daher sinnvoll zu klären, welche Entscheidung der Test unterstützen soll. Geht es um eine erste Gesprächsgrundlage, die Auswahl einer Fachstelle oder lediglich um persönliche Orientierung? Je weiterreichender die Entscheidung, desto weniger darf sie von einem einzelnen Selbstbericht abhängen. Auch wiederholte schwankende Ergebnisse sind nicht automatisch verdächtig; Tagesform, Bezugszeitraum und unterschiedlich verstandene Items können sie erklären. Für die Diagnostik sind konkrete Beispiele und Unsicherheiten oft informativer als eine scheinbar exakte Punktzahl. So bleibt das Screening in seiner richtigen Rolle: Es strukturiert eine Frage, beantwortet sie aber nicht allein.
Quellen & weiterführende Literatur
• Jones, S. L., Johnson, M., Alty, B. & Adamou, M. (2021). The effectiveness of RAADS-R as a screening tool for adult ASD populations. Autism Research and Treatment, 2021, 9974791. Retrospektive Studie mit 50 Erwachsenen in einem spezialisierten Dienst; relevant als Warnung vor Überinterpretation, aber wegen kleiner Stichprobe begrenzt. https://doi.org/10.1155/2021/9974791
• Conner, C. M. et al. (2019). Examining the diagnostic validity of autism measures among adults in an outpatient clinic sample. Autism in Adulthood, 1(1), 60–68. Verglich AQ, RAADS-R und ADOS mit klinischen Diagnosen bei Erwachsenen; einzelne Instrumente waren nur mäßig trennscharf. https://doi.org/10.1089/aut.2018.0023
• Kessler, R. C. et al. (2005). The World Health Organization Adult ADHD Self-Report Scale (ASRS): A short screening scale for use in the general population. Psychological Medicine, 35(2), 245–256. Entwickelte die kurze ASRS für Erwachsene; ein Screeninginstrument, keine alleinige Diagnosemethode. https://doi.org/10.1017/S0033291704002892
• National Institute for Health and Care Excellence (NICE) (2012, aktualisiert 2021). Autism spectrum disorder in adults: diagnosis and management (CG142). Ordnet den AQ-10 als mögliche Hilfe bei der Entscheidung über umfassende Abklärung ein und betont klinisches Urteil. https://www.nice.org.uk/guidance/cg142
„Hinweis: Dieser Beitrag dient der Information und Einordnung. Er ersetzt keine individuelle medizinische oder psychotherapeutische Beratung und keine professionelle Diagnostik.“










