Wissenschaftlicher Hintergrund
Jeder Test auf Empiralis basiert auf frei verfügbaren, in der Forschung veröffentlichten Fragebögen. Wir dokumentieren zu jedem Test die Originalquelle, den Lizenzstatus und was Studien über Aussagekraft und Grenzen des Verfahrens sagen.
Was bedeutet „wissenschaftlich fundiert“?
Psychologische Fragebögen werden nach anerkannten testtheoretischen Kriterien entwickelt und geprüft: Reliabilität (Messgenauigkeit), Validität (Misst der Test wirklich das, was er zu messen vorgibt?) und Normierung (Vergleichbarkeit mit einer Referenzstichprobe). Ein Selbsttest im Internet kann diese Gütekriterien nur eingeschränkt erfüllen, da z. B. die Durchführungsbedingungen nicht standardisiert sind. Unsere Tests eignen sich daher zur Selbstreflexion, nicht zur Diagnostik.
Artikel
Die Methodik hinter den Tests, verständlich erklärt – was einen validierten Fragebogen von einem beliebigen Internet-Quiz unterscheidet.
Autismus Test Erwachsene – welche Selbsttests sind sinnvoll?
RAADS-R, CAT-Q, ASRS: drei häufig genannte Online-Selbsttests, drei unterschiedliche Fragestellungen. Ein Überblick, was jeder davon tatsächlich misst – und was keiner davon leisten kann.
Was einen wissenschaftlichen Test wirklich ausmacht
Zwischen einem sorgfältig entwickelten Fragebogen und einem beliebigen Internet-Quiz liegen oft jahrelange Forschungsarbeit und tausende Proband:innen. Ein Blick hinter die Kulissen – mit einfachen Worten und echten Beispielen.
Was „über dem Durchschnitt“ bei uns heißt – und was noch fehlt
Ein Normwert ist immer relativ zu einer Bezugsgruppe. Wir legen offen, mit welcher Stichprobe dein Ergebnis verglichen wird, wo wir eigene Orientierungsbereiche verwenden – und warum wir (noch) keine eigene Validierungsforschung betreiben.
Wie zuverlässig sind Online-Persönlichkeitstests wirklich?
Zwischen seriösen, jahrzehntelang erforschten Fragebögen und reinen Unterhaltungsquiz liegen Welten. Woran erkennst du den Unterschied?
Reliabilität und Validität einfach erklärt
Zwei Begriffe entscheiden darüber, ob ein psychologischer Test etwas taugt. Was sie bedeuten – erklärt an einer Personenwaage statt an Formeln.
Wann ist ein Screening-Ergebnis ein Grund, professionelle Hilfe zu suchen?
Ein auffälliges Testergebnis ist kein Urteil – aber auch kein Zufall, den man ignorieren sollte. Eine Orientierung, ohne Angst zu machen.
Persönlichkeitstest vs. klinisches Screening – was ist der Unterschied?
Beide bestehen aus Fragen mit Antwortskalen – aber sie messen grundlegend verschiedene Dinge und haben unterschiedliche Konsequenzen für dich.
Ratgeber
Zu ausgewählten Themen: Hintergrundwissen, konkrete Handlungstipps sowie eine druckbare Checkliste und Notiztabelle.
Depression: Informationen, Handlungstipps & Hilfe
Was eine Depression ausmacht, was wissenschaftlich nachweislich hilft, und wo du Unterstützung findest.
Angst & Angststörungen: Informationen, Handlungstipps & Hilfe
Wo normale Sorge aufhört und eine behandlungsbedürftige Angststörung beginnt – und was nachweislich hilft.
Alkohol & Substanzkonsum: Informationen, Handlungstipps & Hilfe
Zwischen risikoarmem Konsum, riskantem Konsum und Abhängigkeit – wo liegen die Grenzen, und was hilft früh gegenzusteuern?
Essverhalten & Essstörungen: Informationen, Handlungstipps & Hilfe
Wann Sorgen ums Essen mehr sind als eine Phase – und warum frühes Ansprechen den größten Unterschied macht.
ADHS bei Erwachsenen: Informationen, Handlungstipps & Hilfe
Warum ADHS bei Erwachsenen oft spät erkannt wird – und was im Alltag konkret entlastet.
Autismus-Spektrum bei Erwachsenen: Informationen, Handlungstipps & Hilfe
Warum autistische Merkmale bei Erwachsenen – besonders bei guter Kaschierung – oft erst spät erkannt werden.
Bindungsstil & Beziehung: Informationen, Handlungstipps & Hilfe
Wie Bindungsmuster entstehen, warum sie kein festes Schicksal sind, und was ihre Veränderung unterstützt.
Einsamkeit: Informationen, Handlungstipps & Hilfe
Warum Einsamkeit ein Gefühl ist, keine Tatsache – und was nachweislich hilft, wieder Verbundenheit zu erleben.
Selbstwert stärken: Informationen & Handlungstipps
Was Selbstwert ausmacht, und warum er sich – anders als oft gedacht – trainieren lässt.
Wohlbefinden & Lebenszufriedenheit: Informationen & Handlungstipps
Was die Forschung zu psychischem Wohlbefinden zeigt – und was sich davon leicht in den Alltag holen lässt.
Selbstmitgefühl üben: Informationen & Handlungstipps
Was Selbstmitgefühl wirklich bedeutet – und warum es das Gegenteil von Selbstmitleid oder Nachlässigkeit ist.
Burnout: Informationen, Handlungstipps & Hilfe
Mehr als Erschöpfung nach einem harten Tag – und warum frühes Gegensteuern den Unterschied macht.
Elternstress & Familienfunktion: Informationen, Handlungstipps & Hilfe
Elternsein bedeutet Freude und Belastung zugleich – warum frühe Entlastung beiden hilft, Eltern wie Kindern.
Kindliche Entwicklung & Verhalten: Informationen, Handlungstipps & Hilfe
Wenn Eltern sich Sorgen um ihr Kind machen: Wie man Beobachtungen einordnet und den richtigen ersten Schritt geht.
Mediennutzung & Bildschirmzeit: Informationen, Handlungstipps & Hilfe
Warum die Art der Mediennutzung mehr über das Wohlbefinden deines Kindes aussagt als die reine Bildschirmzeit – und was nachweislich hilft.
Wissenschaftlicher Hintergrund je Test
Big Five
Dieser Test basiert auf dem International Personality Item Pool (IPIP), einer frei verfügbaren Sammlung von Persönlichkeits-Items, die als öffentlich zugängliche Alternative zu kommerziellen Fragebögen wie dem NEO-PI-R entwickelt wurde. Die hier verwendeten 50 Items entsprechen der bekannten IPIP-Repräsentation der fünf Faktoren nach Costa & McCrae (Goldberg, 1992). Die deutsche Fassung ist eine eigene, nicht klinisch validierte Übersetzung der englischen Originalitems und dient der Selbstreflexion, nicht der diagnostischen Einordnung. Studien zum Fünf-Faktoren-Modell zeigen international robuste Replikation der Faktorstruktur sowie gute Retest-Reliabilität über Zeiträume von mehreren Jahren. Internationale Validierungsstudien berichten eine für ein frei verfügbares Forschungsinstrument zufriedenstellende interne Konsistenz der fünf Skalen (Cronbachs Alpha meist zwischen .73 und .84) sowie eine gute Übereinstimmung mit etablierten kommerziellen Fragebögen wie dem NEO-FFI. Diese Übereinstimmung fällt allerdings nicht bei allen fünf Dimensionen gleich stark aus: Bei Gewissenhaftigkeit, Extraversion und emotionaler Stabilität liegt sie am höchsten, bei Verträglichkeit und Offenheit für Erfahrungen spürbar niedriger – ein bekannter Schwachpunkt, der in ähnlicher Form auch bei anderen Big-Five-Fragebögen auftritt und bei der Einordnung dieser beiden Werte mitbedacht werden sollte.
Dark Tetrad (SD4)
Paulhus und Williams prägten 2002 den Begriff „Dark Triad“ für drei sozial unbeliebte, aber überlappende Persönlichkeitseigenschaften – Narzissmus, Machiavellismus und Psychopathie –, die sich als eigenständige, aber verwandte Konstrukte erwiesen. Buckels, Jones und Paulhus (2013) zeigten, dass Alltagssadismus (Freude an der Grausamkeit gegenüber anderen) eine vierte, empirisch trennbare Facette darstellt – seither spricht man von der „Dark Tetrad“. 2020 veröffentlichten Paulhus, Buckels, Trapnell und Jones im European Journal of Psychological Assessment den SD4 (Short Dark Tetrad) als kompakte, 28 Items umfassende Kurzversion, die alle vier Eigenschaften mit guter interner Konsistenz erfasst (Cronbachs Alpha zwischen .76 und .81) und die vorherige, nur drei Eigenschaften abdeckende Kurzskala SD3 desselben Autorenteams ablöst. Wichtig: Diese Eigenschaften werden als normalverteilte Persönlichkeitsmerkmale in der Allgemeinbevölkerung verstanden ("subklinisch") – sie sind konzeptionell etwas anderes als die klinischen Diagnosen Narzisstische oder Antisoziale Persönlichkeitsstörung oder klinische Psychopathie (die z. B. über die klinikergestützte PCL-R erfasst wird). Die hier verwendeten Bandbreiten orientieren sich an den im Originalverfahren berichteten Item-Mittelwerten und Standardabweichungen einer Stichprobe von 660 Studierenden der University of Winnipeg und dienen nur als grobe Orientierung, nicht als klinische Normwerte.
Depression
Der PHQ-9 wurde von Spitzer, Kroenke und Williams (1999) auf Basis der DSM-IV-Kriterien für die Major Depression entwickelt und ist eines der am besten untersuchten Screening-Instrumente der klinischen Psychologie und Allgemeinmedizin. Zahlreiche Studien belegen gute interne Konsistenz (Cronbachs Alpha meist über .85) sowie gute Sensitivität und Spezifität zur Erkennung depressiver Störungen. Die deutsche Fassung (PHQ-D) wurde von Löwe, Spitzer, Zipfel & Herzog validiert. Der PHQ-9 ist ein Screening- und Verlaufsinstrument, keine eigenständige Diagnosestellung – diese erfordert immer ein klinisches Gespräch. Die Originalstudie umfasste 6.000 Patient:innen aus acht hausärztlichen und sieben gynäkologischen Praxen; die Kriteriumsvalidität wurde zusätzlich an 580 Personen gegen ein unabhängiges strukturiertes Interview durch eine Fachperson geprüft. Beim Schwellenwert von 10 Punkten erreichte der PHQ-9 dabei eine Sensitivität von 88 % und eine Spezifität von 88 % zur Erkennung einer Major Depression – ein gut ausbalanciertes Verhältnis zwischen übersehenen und fälschlich als auffällig eingestuften Fällen.
Angst
Der GAD-7 wurde von Spitzer, Kroenke, Williams und Löwe (2006) entwickelt und ist – neben dem PHQ-9 – eines der am besten untersuchten und am häufigsten eingesetzten Screening-Instrumente der klinischen Psychologie. Studien zeigen gute interne Konsistenz (Cronbachs Alpha meist über .89) sowie gute Sensitivität und Spezifität nicht nur für generalisierte Angststörungen, sondern auch als allgemeiner Indikator für Panikstörung, soziale Phobie und posttraumatische Belastungsstörung. Die deutsche Fassung ist Teil des validierten Gesundheitsfragebogens für Patienten (PHQ-D). Der GAD-7 ist ein Screening- und Verlaufsinstrument, keine eigenständige Diagnosestellung. In der ursprünglichen Validierungsstudie an einer großen hausärztlichen Stichprobe erreichte der Schwellenwert von 10 Punkten das beste Verhältnis aus Sensitivität (89 %) und Spezifität (82 %). Wichtig für die Einordnung: Diese Kennwerte gelten nicht automatisch für jede Population. Eine spätere Untersuchung an einer psychiatrischen Stichprobe (Menschen, die bereits wegen einer anderen psychischen Erkrankung in Behandlung waren) fand für denselben Schwellenwert eine deutlich schwächere Trennschärfe (Sensitivität 74 %, Spezifität 54 %) – ein Hinweis darauf, dass Screening-Kennwerte immer auch von der untersuchten Gruppe abhängen, nicht nur vom Fragebogen selbst.
Selbstwert
Die Skala wurde 1965 von dem Soziologen Morris Rosenberg entwickelt und ist bis heute das am häufigsten verwendete Instrument zur Erfassung des globalen Selbstwertgefühls in der psychologischen Forschung. Zahlreiche Studien in unterschiedlichsten Ländern und Sprachen belegen eine sehr gute interne Konsistenz (Cronbachs Alpha meist über .85) sowie stabile Retest-Reliabilität. Die Skala misst bewusst ein eindimensionales, globales Selbstwertgefühl und keine einzelnen Facetten wie Kompetenzerleben oder Körperbild. In der Methodenforschung wird seit Langem diskutiert, ob die Skala wirklich nur eine Dimension misst: Weil fünf der zehn Items positiv und fünf negativ formuliert sind, finden manche Studien statt eines einzelnen Faktors zwei separate Faktoren für „Selbstakzeptanz“ und „Selbstabwertung“ – vermutlich, weil negativ formulierte Items unabhängig vom eigentlichen Selbstwert etwas anders beantwortet werden als positiv formulierte. Aktuelle große Studien mit sogenannten Bifaktor-Modellen bestätigen, dass unter dieser Formulierungs-Eigenheit weiterhin ein gemeinsamer, substanzieller Globalfaktor steht, den die Auswertung hier abbildet. Die deutsche Fassung wurde von von Collani und Herzberg (2003) revidiert und an großen deutschen Stichproben validiert.
Einsamkeit
Die UCLA Loneliness Scale wurde ursprünglich 1978 von Russell, Peplau und Ferguson entwickelt und 1996 von Daniel Russell in der hier verwendeten dritten Version überarbeitet. Sie ist das weltweit am häufigsten eingesetzte Forschungsinstrument zur Messung subjektiver Einsamkeit und zeigt in zahlreichen Studien eine sehr gute interne Konsistenz (Cronbachs Alpha meist über .90). Wichtig: Die Skala misst das subjektive Gefühl von Einsamkeit, nicht die objektive Anzahl sozialer Kontakte – man kann sich in Gesellschaft einsam fühlen und allein sein, ohne sich einsam zu fühlen. Die hier verwendeten Bandbreiten basieren auf den in der Originalstudie (Russell, 1996, Tabelle 2) berichteten Referenzwerten zweier Erwachsenenstichproben mit dem vollständigen 20-Item-Bogen (Studierende, N=487, M=40,08, SD=9,50; Krankenpflegepersonal, N=305, M=40,14, SD=9,52): Der Bereich "durchschnittlich" entspricht ungefähr einer Standardabweichung um diesen gepoolten Mittelwert (M≈40,1, SD≈9,5). Hinweis: Es existiert eine eigenständige deutsche Adaption unter dem Namen UCLA-Einsamkeitsskala (Döring & Bortz, 1993, Diagnostica), die aber auf der älteren revidierten Fassung von 1980 basiert, eine abweichende Drei-Faktoren-Struktur aufweist ("Einsamkeitsgefühle", "wahrgenommene emotionale Isolation", "wahrgenommene soziale Isolation") und nicht frei zugänglich ist – sie ist daher keine Grundlage für die hier verwendeten Items oder Bandbreiten.
Wohlbefinden
Der WHO-5 wurde 1998 vom WHO Regionalbüro für Europa eingeführt und ist mit über tausend Validierungsstudien in mehr als 30 Sprachen eines der am besten untersuchten Kurzinstrumente zum psychischen Wohlbefinden. Er wird u. a. in der hausärztlichen Versorgung als erster Schritt eines zweistufigen Screenings auf Depression eingesetzt: Werte von 50 % oder darunter gelten als Hinweis auf reduziertes Wohlbefinden und rechtfertigen laut gängiger klinischer Praxis eine weitere Abklärung auf depressive Symptome. Seit 2024 hält die WHO selbst das Copyright am WHO-5 und stellt ihn ausdrücklich weltweit kostenfrei zur Verfügung. Der systematische Literaturreview von Topp und Kolleg:innen (2015) wertete 213 Studien aus 30 Ländern aus und bestätigt durchgehend gute interne Konsistenz (Cronbachs Alpha meist über .80) sowie eine für ein Fünf-Item-Instrument bemerkenswert hohe Sensitivität für Veränderungen, etwa im Verlauf einer Behandlung. Gerade diese Veränderungssensitivität – nicht nur die reine Erkennungsgenauigkeit als Depressions-Screener – gilt in der Literatur als eine der größten Stärken des WHO-5 gegenüber ähnlich kurzen Instrumenten.
Bindungsstil (ausführlich)
Der ECR-R wurde 2000 von Fraley, Waller und Brennan auf Basis der Item-Response-Theorie aus dem ursprünglichen ECR von Brennan, Clark und Shaver (1998) entwickelt und gilt als eines der psychometrisch robustesten Instrumente der Bindungsforschung. Die Kombination aus niedriger Bindungsangst und niedriger Bindungsvermeidung wird in der Forschung als „sicherer Bindungsstil“ bezeichnet; hohe Werte auf einer oder beiden Dimensionen entsprechen unsicher-ängstlichen, unsicher-vermeidenden bzw. ängstlich-vermeidenden Bindungsmustern. Für den deutschen Sprachraum gibt es zwei gesondert validierte Fassungen, die dieser Test bewusst nicht verwendet: die vollständige deutsche Version ECR-RD (Ehrenthal et al., 2009; nichtklinische Stichprobe n = 1.006, klinische Stichprobe n = 225; Cronbachs Alpha .91/.92) und deren 2021 an einer repräsentativen deutschen Stichprobe (n = 2.428) evaluierte 8-Item-Kurzform ECR-RD8 mit alters- und geschlechtsspezifischen Normwerten. Dieser Test nutzt stattdessen die englischen Originalitems von Fraley (offen für Forschung und Anwendung bereitgestellt) in einer eigenen, nicht gesondert validierten Übersetzung; die Auswertung folgt dem englischsprachigen Referenzrahmen und stützt sich nicht auf deutsche Normdaten. Für eine an deutschen Vergleichswerten ausgerichtete Einschätzung wäre die ECR-RD8 die vorzuziehende Grundlage. Die englische Originalstudie von Fraley, Waller und Brennan (2000) berichtet für beide Dimensionen eine gute interne Konsistenz (Cronbachs Alpha rund .86 für Bindungsangst, .88 für Bindungsvermeidung) sowie eine für ein Persönlichkeitsmaß bemerkenswert hohe zeitliche Stabilität: Über drei bis sechs Wochen hinweg blieben beide Dimensionen zu 85–86 % stabil. Das spricht dafür, dass der ECR-R tatsächlich ein relativ überdauerndes Bindungsmuster erfasst und nicht nur eine tagesformabhängige Stimmung.
Bindungsstil (kurz)
Der ECR-RD8 wurde von Ehrenthal und Kolleg:innen (2021) als Kurzform der deutschen ECR-R-Fassung (ECR-RD) entwickelt und an einer repräsentativen Stichprobe der deutschen Allgemeinbevölkerung (n = 2.428) evaluiert. Er besteht aus acht der ursprünglich 36 ECR-RD-Items – vier für Bindungsangst, vier für Bindungsvermeidung (letztere umgekehrt gepolt) – auf einer 7-stufigen Skala. Die interne Konsistenz war gut (McDonalds Omega .87 für Bindungsangst, .91 für Bindungsvermeidung) und die zweifaktorielle Struktur wurde bestätigt. Ausgewertet wird ein Mittelwert je Dimension (1–7). Die Studie berichtet für die repräsentative Stichprobe Mittelwerte von 2,39 (SD 1,35) für Bindungsangst und 2,89 (SD 1,70) für Bindungsvermeidung sowie – als Zusatzmaterial – alters- und geschlechtsspezifische T-Wert-Normen. Wichtig: Die Studie legt selbst keine Kategorien oder klinischen Schwellenwerte fest. Die hier gezeigte Dreiteilung „unter / im Bereich / über dem deutschen Durchschnitt“ ist eine Orientierung von Empiralis: die übliche Einteilung bei einer Standardabweichung unter bzw. über dem Mittelwert (Grenzen bei 1,04 / 3,74 für Bindungsangst, 1,19 / 4,59 für Bindungsvermeidung). Sie verwendet den Gesamt-Mittelwert der Stichprobe, nicht die alters- und geschlechtsspezifischen Normen – dieser Test fragt weder Alter noch Geschlecht ab, ein individuell passender Vergleichswert kann daher abweichen.
Beziehungszufriedenheit
Der Couples Satisfaction Index (CSI) wurde 2007 von Funk und Rogge (University of Rochester) mithilfe der Item-Response-Theorie entwickelt. Ziel war eine präzisere Messung der Beziehungszufriedenheit als mit älteren Skalen wie der Dyadic Adjustment Scale oder dem Marital Adjustment Test, die der CSI in direkten Vergleichen übertraf. Es gibt eine 4-, 16- und 32-Item-Fassung; die hier verwendete Kurzform CSI-4 erreicht trotz ihrer Länge eine mit den längeren Fassungen vergleichbare Messgüte. Eine validierte deutschsprachige Fassung (GCSI-4) wurde 2026 von Körner und Gauglitz an fünf Stichproben (N = 1.526, Einzelpersonen und Paare unterschiedlicher sexueller Orientierung) mit sehr guter interner Konsistenz (Cronbachs Alpha / McDonalds Omega .89–.91) und Messinvarianz über Geschlecht und sexuelle Orientierung bestätigt. Der Fragebogen misst ein eindimensionales, globales Konstrukt – die subjektive Gesamtbewertung der eigenen Partnerschaft – und keine einzelnen Facetten wie Kommunikation oder Sexualität. Die Entwicklungsstudie von Funk und Rogge stützte sich auf eine sehr große Online-Stichprobe von 5.315 Personen und verglich acht etablierte Zufriedenheitsskalen mithilfe der Item-Response-Theorie. Dabei zeigte sich, dass etablierte, deutlich längere Skalen wie die Dyadic Adjustment Scale trotz ihres Umfangs an vielen Punkten der Zufriedenheitsskala nur ungenau messen – der CSI wurde gezielt so konstruiert, dass er über den gesamten Wertebereich hinweg präziser unterscheidet. Die 32-Item-Vollversion erreichte dabei eine außergewöhnlich hohe interne Konsistenz (Cronbachs Alpha = .98); die hier verwendete Kurzform CSI-4 handelt diese Präzision bewusst gegen Kürze ein, ohne dabei nennenswert an Messgüte zu verlieren.
Soziale Unterstützung
Die MSPSS wurde 1988 von Gregory Zimet, Nancy Dahlem, Sara Zimet und Gordon Farley im Journal of Personality Assessment veröffentlicht. Sie besteht aus zwölf Aussagen, die sich zu drei je vierteiligen Skalen gruppieren: Unterstützung durch eine besondere, nahestehende Person, durch die Familie und durch Freundinnen und Freunde. In der Originalarbeit zeigte die Skala eine gute interne Konsistenz (Cronbachs Alpha .88 für die Gesamtskala; .91 / .87 / .85 für die drei Teilbereiche) und eine stabile dreifaktorielle Struktur, die seither in zahlreichen Sprachen und Stichproben repliziert wurde. Ausgewertet wird über Mittelwerte: je Teilbereich die Summe der vier Items geteilt durch vier, für den Gesamtwert die Summe aller zwölf Items geteilt durch zwölf. Eine deutschsprachige psychometrische Untersuchung liegt vor (Boggatz et al., 2023), allerdings an einer speziellen Stichprobe (ältere Menschen in betreuten Wohnformen); eine an der deutschen Allgemeinbevölkerung normierte Fassung mit eigenen Schwellenwerten gibt es nicht. Die hier verwendeten Formulierungen sind eine eng an das englische Original angelehnte eigene Übersetzung. Die Studie von Boggatz und Kolleg:innen bestätigte eine insgesamt gute interne Konsistenz, fand aber auch eine Einschränkung: Die theoretisch angenommene Dreifaktorstruktur (besondere Person, Familie, Freunde) ließ sich in dieser speziellen Stichprobe älterer Menschen in einer bestätigenden Faktorenanalyse nur teilweise nachweisen, vermutlich weil sich die drei Unterstützungsquellen bei stark eingeschränkter Mobilität inhaltlich stärker überschneiden. Für die Allgemeinbevölkerung – ohne die alterstypischen Einschränkungen dieser Stichprobe – gilt die dreifaktorielle Struktur international weiterhin als gut repliziert.
Selbstmitgefühl
Die Self-Compassion Scale wurde 2003 von Kristin Neff (University of Texas at Austin) entwickelt und ist das weltweit meistgenutzte Instrument der Selbstmitgefühl-Forschung. Selbstmitgefühl umfasst drei sich ergänzende Gegensatzpaare: selbstbezogene Freundlichkeit statt Selbstverurteilung, das Erleben verbindender Humanität statt Isolation, sowie Achtsamkeit statt Überidentifizierung mit negativen Gefühlen. Studien zeigen durchgehend gute interne Konsistenz der sechs Subskalen sowie robuste Zusammenhänge mit geringerer Depressivität und Ängstlichkeit und höherem Wohlbefinden. Die hier verwendeten Bandbreiten wurden aus den in der Originalstudie (Neff, 2003, Tabelle 4) berichteten Mittelwerten/Standardabweichungen der Gesamtstichprobe (N=391 US-amerikanische Studierende) abgeleitet: Selbstfreundlichkeit M=3,05/SD=0,75, Selbstverurteilung M=3,14/SD=0,79, Verbindende Humanität M=2,99/SD=0,79, Isolation M=3,01/SD=0,92, Achtsamkeit M=3,39/SD=0,76, Überidentifizierung M=3,05/SD=0,96 (jeweils auf der 5-stufigen Itemskala). Der Bereich "durchschnittlich" entspricht je Subskala ungefähr einer Standardabweichung um diesen Mittelwert. Da es sich um eine US-amerikanische Studierendenstichprobe und nicht um eine deutsche Normstichprobe handelt, sind die Bänder als Orientierung und nicht als klinische Normwerte zu verstehen. Die deutsche Validierung (Hupfeld & Ruffieux, 2011) prüfte die Skala an zwei separaten Stichproben (N=396 und N=165) und bestätigte dieselbe sechsfaktorielle Struktur wie im amerikanischen Original, mit den erwarteten Zusammenhängen zu psychischer Belastung und Wohlbefinden. Für die deutsche Kurzform berichten die Autoren eine gute interne Konsistenz (Cronbachs Alpha = .84) und eine gute Retest-Reliabilität (r = .83) – die deutsche Übersetzung funktioniert demnach psychometrisch ähnlich gut wie das amerikanische Original.
Lebenszufriedenheit
Die Satisfaction With Life Scale wurde 1985 von Ed Diener und Kolleg:innen im Rahmen der Forschung zum subjektiven Wohlbefinden (Subjective Well-Being) entwickelt. Sie gilt als Standardinstrument zur Erfassung der globalen, kognitiv-evaluativen Lebenszufriedenheit und wird von der emotionalen Komponente des Wohlbefindens (positiver/negativer Affekt) abgegrenzt. Die Skala zeigt in zahlreichen Studien eine hohe interne Konsistenz und eine für ein Trait-Maß angemessene zeitliche Stabilität, bei gleichzeitiger Sensitivität für Veränderungen z. B. im Rahmen therapeutischer Interventionen. In der Originalstudie lag Cronbachs Alpha bei .87, die Retest-Reliabilität über zwei Monate bei .82. Eine Metaanalyse über 60 Studien bestätigt eine im Mittel gute interne Konsistenz (Alpha ≈ .78) über sehr unterschiedliche Länder, Sprachen und Altersgruppen hinweg – ein Beleg dafür, dass die fünf sehr allgemein formulierten Items robust über kulturelle Kontexte hinweg funktionieren, was für ein derart kurzes Instrument nicht selbstverständlich ist.
Alkoholkonsum
Der AUDIT wurde von der Weltgesundheitsorganisation (WHO) im Rahmen einer internationalen Multi-Center-Studie entwickelt (Saunders et al., 1993) und ist heute das weltweit am häufigsten eingesetzte Screening-Instrument für riskanten Alkoholkonsum in der hausärztlichen Versorgung. Er deckt drei Bereiche ab: Trinkmenge und -häufigkeit (Fragen 1–3), Anzeichen einer Abhängigkeit (Fragen 4–6) sowie alkoholbedingte Probleme (Fragen 7–10). Zahlreiche internationale Validierungsstudien bestätigen gute Sensitivität und Spezifität zur Erkennung riskanten Konsums. Die Entwicklungsstichprobe umfasste 1.888 Personen aus der hausärztlichen Versorgung (36 % Nicht-Trinker:innen, 48 % trinkende Patient:innen, 16 % Menschen mit Alkoholabhängigkeit). Eine Übersicht über sechs AUDIT-Studien berichtet beim Schwellenwert 8 eine Sensitivität von 97 % und Spezifität von 78 % zur Erkennung riskanten Konsums sowie eine Sensitivität von 95 % und Spezifität von 85 % zur Erkennung schädlichen Konsums – der Test erkennt also die allermeisten tatsächlichen Fälle korrekt, bei vergleichsweise wenigen falschen Alarmen.
Autistische Merkmale
Der RAADS-R wurde 2011 von Ritvo und Kolleg:innen als überarbeitete Fassung der ursprünglichen RAADS veröffentlicht und ist eines der am häufigsten in Forschung und Praxis eingesetzten Screening-Instrumente für autistische Merkmale bei Erwachsenen. Er ist in vier Bereiche gegliedert: soziale Bezogenheit, umschriebene Interessen, Sprache und Sensomotorik. Die Originalstudie schlug einen Gesamt-Schwellenwert von 65 Punkten vor, ab dem autistische Merkmale wahrscheinlich sind (Kontrollgruppe ohne Autismus: Mittelwert ca. 21 Punkte). Die Originalarbeit (Ritvo et al., 2011, Tabelle 3, ROC-Analyse an 201 autistischen und 578 nicht-autistischen Erwachsenen) veröffentlicht zusätzlich je einen eigenen Schwellenwert pro Subskala: Soziale Bezogenheit 31, Umschriebene Interessen 15, Sprache 4, Sensomotorik 16 – das ist jeweils die Grenze zwischen „unauffällig“ und „mit Autismus vereinbar“ unten. Eine weitere Abstufung „ausgeprägt“ oberhalb dieser Schwellenwerte ist keine Vorgabe der Originalstudie (die nur einen einzelnen Schwellenwert pro Subskala definiert), sondern eine zusätzliche, eigene Orientierungshilfe. Wichtig: Sowohl niedrigere als auch höhere Werte kommen bei autistischen wie nicht-autistischen Menschen vor – insbesondere ausgeprägtes „Masking“ (siehe CAT-Q) kann den Wert senken. Der Test kann daher niemals eine Diagnose ersetzen, sondern liefert lediglich Hinweise, die eine weitere fachliche Abklärung sinnvoll erscheinen lassen können.
ASRS (ADHS Erwachsene)
Der ASRS wurde 2005 von einer Arbeitsgruppe der WHO gemeinsam mit Ronald C. Kessler (Harvard Medical School) und Kolleg:innen entwickelt und ist eines der international am häufigsten eingesetzten Screening-Instrumente für Erwachsenen-ADHS. Die vollständige Version umfasst 18 Items; die hier verwendeten sechs Items („Teil A“) wurden in der Originalstudie als die statistisch aussagekräftigsten Items aus allen 18 identifiziert und sind als eigenständiger Kurz-Screener validiert. Wichtig: Der Fragebogen prüft aktuelle Symptome, ersetzt aber nicht den für eine ADHS-Diagnose notwendigen Nachweis, dass entsprechende Schwierigkeiten bereits in der Kindheit bestanden. In der Entwicklungsstichprobe erreichte der Sechs-Item-Kurzscreener bei einem Schwellenwert von 4 auffälligen Antworten eine Spezifität von 99,5 % bei moderater Sensitivität von 68,7 % – der Test übersieht also einen relevanten Teil der Betroffenen, erzeugt dafür aber sehr selten falsch-positive Ergebnisse. Adler und Kolleg:innen (2006) berichten eine gute interne Konsistenz (Cronbachs Alpha ≈ .88). Eine deutsche Validierungsstudie des Nachfolgeverfahrens ASRS-5 findet vergleichbare Kennwerte (Cronbachs Alpha .88), allerdings mit einer anderen Sensitivitäts-Spezifitäts-Balance als das hier verwendete ASRS-v1.1 – ein Hinweis darauf, dass sich diese Werte je nach Sprachversion und Stichprobe verschieben können.
GAS-7 (Gaming)
Die Game Addiction Scale wurde 2009 von Lemmens, Valkenburg und Peter für Jugendliche entwickelt und orientiert sich an den klassischen Suchtkriterien (u. a. nach Griffiths): Salienz, Toleranzentwicklung, Stimmungsregulation, Rückfall, Entzugserscheinungen, Konflikte und negative Konsequenzen. Die hier verwendete deutsche Kurzfassung mit sieben Items wurde 2016 von Khazaal und Kolleg:innen an großen französisch- und deutschsprachigen Stichproben aus der Schweiz validiert und zeigte gute interne Konsistenz. Anders als etwa beim PHQ-9 ist die GAS-7 in der Originalstudie kein Summenwert mit abgestuften Schweregraden: Lemmens et al. (2009) schlagen ein zählwert-basiertes („polythetisches“) Kriterium vor – als Hinweis auf problematisches Spielverhalten gilt, wer mindestens 4 der 7 Items mit „Manchmal“ oder öfter beantwortet (eine strengere „monothetische“ Variante verlangt dagegen alle 7 von 7 Items). Wir verwenden hier das von den Autor:innen selbst empfohlene 4-von-7-Kriterium. Problematisches Spielverhalten ist seit 2019 als „Gaming Disorder“ auch in der ICD-11 der WHO als eigenständige Diagnose aufgeführt – diese erfordert dort allerdings eine deutliche Beeinträchtigung über mindestens 12 Monate und eine fachliche Diagnostik, die dieses kurze Screening nicht ersetzen kann. Die Validierungsstudie von Khazaal und Kolleg:innen (2016) prüfte die Kurzfassung an einer sehr großen Stichprobe aus der Schweiz (3.318 französischsprachige und 2.665 deutschsprachige Männer) und fand eine zufriedenstellende interne Konsistenz (Cronbachs Alpha = .85) sowie eine einfaktorielle Struktur in beiden Sprachgruppen. Wichtig für die Einordnung: Diese Validierungsstichprobe bestand ausschließlich aus Männern – wie gut die Kennwerte auf Frauen oder nicht-binäre Personen übertragbar sind, wurde in dieser Studie nicht geprüft.
PMUM-SF (Bildschirmmedien)
Der PMUM-SF (Kurzform der 27-Item Problematic Media Use Measure) wurde 2019 von Domoff und Kolleg:innen entwickelt und orientiert sich an den neun DSM-5-Kriterien für Internet-Gaming-Störung, angewendet auf Bildschirmmedien allgemein (nicht nur Gaming). Die deutsche Fassung wurde 2026 von Konrad, Domoff und Schneider (Ruhr-Universität Bochum) an 240 Eltern von 4- bis 16-jährigen Kindern validiert und zeigte sehr gute interne Konsistenz (Cronbachs Alpha = .889). Die Studie fand außerdem: Problematische Mediennutzung – nicht die reine Nutzungsdauer – sagte kindliche Verhaltensauffälligkeiten vorher, und war mit elterlichem Stress, elterlicher Bildschirmzeit und geringerem elterlichen Selbstvertrauen assoziiert. Die hier verwendeten Schwellenwerte stammen aus einer itemresponsetheoretischen Normierung (Woodman, Domoff et al., 2025). Die ursprüngliche englische Validierung (Domoff et al., 2019) beruhte auf zwei Stichproben: 291 Müttern von 4- bis 11-jährigen Kindern für die Item-Entwicklung und 632 Eltern zur Bestätigung der Faktorstruktur, mit sehr hoher interner Konsistenz der Kurzform (Cronbachs Alpha = .93). Faktorenanalysen bestätigten dabei ein eindimensionales Konstrukt, und problematische Mediennutzung sagte kindliche Verhaltensauffälligkeiten auch dann noch zusätzlich vorher, wenn die reine Bildschirmzeit bereits statistisch herausgerechnet war – ein Beleg dafür, dass die Skala mehr erfasst als nur die Nutzungsdauer.
CAT-Q (Masking)
Der CAT-Q wurde 2019 von Laura Hull und Kolleg:innen am University College London entwickelt, nachdem klinische Beobachtungen zeigten, dass viele autistische Menschen – insbesondere Frauen und spät diagnostizierte Erwachsene – ihre Merkmale so erfolgreich kaschieren, dass klassische Screening-Instrumente wie der AQ sie nicht zuverlässig erfassen. Camouflaging wird mit erhöhter psychischer Erschöpfung, Angst und Depression sowie einer verzögerten Diagnose in Verbindung gebracht. Der Fragebogen zeigt in Validierungsstudien gute interne Konsistenz für alle drei Subskalen und unterscheidet zuverlässig zwischen autistischen und nicht-autistischen Stichproben. Hinweis: 2026 erschien mit dem CAT-Q/DE (Boettcher, Zapf, Daubmann, Schimmelmann, Bindt, Hohmann & Micheel, 2026, Journal of Autism and Developmental Disorders, DOI 10.1007/s10803-026-07423-z) eine eigenständige, offiziell validierte deutsche Übersetzung – allerdings speziell für Jugendliche (13–21 Jahre, N=164 autistische und N=482 nicht-autistische Teilnehmende, Selbst- und Elternbericht per LimeSurvey), nicht für Erwachsene. Die Studie bestätigt die ursprüngliche Drei-Faktoren-Struktur auch im Deutschen, veröffentlicht aber keine kategorialen Cutoff-Werte, sondern separate Normwerte je Stichprobe (Supplementary Table 6a). Die hier verwendeten Bandbreiten stammen weiterhin aus der englischsprachigen Erwachsenenstichprobe von Hull et al. (2019) und wurden nicht an dieser deutschen Jugendstudie kalibriert. Wichtig für die Einordnung: Eine 2026 veröffentlichte kritische Übersichtsarbeit über 389 Studien (Arnold, Bitsika & Sharpley, 2026, Autism) attestiert dem CAT-Q zwar exzellente Reliabilität, findet aber gemischte Evidenz für seine Validität – die Gesamtwerte korrelierten bereits in Hulls eigener Validierungsstudie (2019) stärker mit sozialer Angst als mit autistischen Merkmalen, und in einer weiteren Studie (Ai et al., 2023) stärker mit ADHS-Merkmalen als mit autistischen Merkmalen. Die Autismus-Spezifität des Instruments ist damit begrenzt, weshalb die Übersichtsarbeit ausdrücklich von einer Verwendung als Screening-Instrument abrät. Mehrere fremdsprachige Übersetzungen (u. a. niederländisch, japanisch, schwedisch, traditionell-chinesisch) konnten außerdem die ursprüngliche Drei-Faktoren-Struktur nicht replizieren, und die niederländische sowie die französische Version zeigten keine Messinvarianz zwischen autistischen und nicht-autistischen Gruppen – ein Hinweis, dass Ergebnisse über Sprach- und Kulturräume hinweg nicht ohne Weiteres vergleichbar sind, was auch für unsere eigene, nicht separat validierte deutsche Übersetzung gilt. Auch die Autor:innen des CAT-Q selbst raten inzwischen ausdrücklich von einer diagnostischen Verwendung ab: In einem 2026 erschienenen Perspective-Artikel (Hannon, Hull, Lai, Magiati & Mandy, 2026, Autism in Adulthood) – mit CAT-Q-Miterfinderin Laura Hull als Ko-Autorin – wird empfohlen, CAT-Q-Werte weder für diagnostische Entscheidungen noch zur Verlaufsmessung einer Behandlung zu nutzen.
KINDL (Kinder 7–13)
Der KINDL wurde 1994 von Prof. Monika Bullinger entwickelt und 1998 von Prof. Ulrike Ravens-Sieberer und Bullinger zum KINDLR revidiert. Er ist eines der am besten etablierten deutschsprachigen Instrumente zur Erfassung gesundheitsbezogener Lebensqualität bei Kindern und Jugendlichen und wurde in zahlreichen nationalen und internationalen Studien eingesetzt, unter anderem in der bundesweiten KiGGS-Studie des Robert-Koch-Instituts, die alters- und geschlechtsspezifische Normwerte für Deutschland liefert. Die sechsfaktorielle Struktur (Körper, Gefühl, Selbstwert, Familie, Freunde, Schule) wurde in zahlreichen Validierungsstudien bestätigt. Wichtig: Das offizielle KINDL-Manual definiert selbst keine Schweregrad-Kategorien wie „niedrig/durchschnittlich/hoch“ – die Auswertung dort erfolgt ausschließlich über den Vergleich der 0–100-Skalenwerte mit den alters- und geschlechtsspezifischen KiGGS-Normwerten. Die unten verwendete Dreier-Einteilung ist eine eigene, nicht altersdifferenzierte Orientierungshilfe und keine offizielle Kategorie des Verfahrens. Die Psychometrie-Analyse der bundesweiten BELLA-Studie (Bullinger et al., 2008) berichtet eine gute interne Konsistenz des Gesamtscores (Cronbachs Alpha = .85 im Selbstbericht der Kinder/Jugendlichen, .86 im Elternbericht) – Eltern- und Selbsteinschätzung stimmen also insgesamt gut überein, auch wenn sie nicht identisch sind. Die KiGGS-Normierung selbst stützt sich auf eine der größten Stichproben, die je für ein deutschsprachiges Lebensqualitäts-Instrument erhoben wurden: rund 14.800 Eltern von 3- bis 17-Jährigen sowie zusätzlich rund 6.800 Jugendliche im Selbstbericht.
Familienfunktion
Der Family APGAR wurde 1978 vom Hausarzt Gabriel Smilkstein entwickelt, um Familienfunktion schnell in der hausärztlichen Praxis erfassen zu können – angelehnt an den bekannten APGAR-Score aus der Geburtsmedizin. Der Name ist ein Akronym für die fünf erfassten Bereiche: Adaptation (Anpassung/Unterstützung), Partnership (Partnerschaft/Kommunikation), Growth (Wachstum), Affection (Zuneigung) und Resolve (gemeinsame Zeit/Verbundenheit). Studien zeigen durchgehend hohe interne Konsistenz (Cronbachs Alpha .80–.90) und gute Retest-Reliabilität. Faktorenanalysen deuten darauf hin, dass die fünf Items eher eine einzelne, globale Dimension „Zufriedenheit mit der Familie“ abbilden als fünf getrennte Konstrukte. Die Validierungsstudie von Smilkstein und Ashworth (1982) verglich Familien mit und ohne bekannte Funktionsprobleme und fand deutliche Unterschiede in den erwarteten Bereichen – seither wird der Family APGAR weltweit in der Primärversorgung eingesetzt und in zahlreiche Sprachen übersetzt. Eine eigenständige, groß angelegte deutsche Validierungsstudie mit publizierten Normwerten ist uns nicht bekannt; die hier verwendete Übersetzung stützt sich auf die international etablierte Struktur und Auswertung des Originalverfahrens.
PSC-17 (Eltern)
Der PSC-17 ist eine von Gardner und Kolleg:innen (1999) entwickelte Kurzform des ursprünglichen, 35 Items umfassenden Pediatric Symptom Checklist von Jellinek und Murphy (1988). In einer Vergleichsstudie mit dem deutlich längeren Child Behavior Checklist (CBCL) an 269 Kindern zeigte der PSC-17 eine vergleichbare Erkennungsgüte bei einem Bruchteil des Umfangs (Gardner et al., 2007). Die drei Subskalen korrelieren mit unterschiedlichen klinischen Bildern: Aufmerksamkeit mit ADHS, internalisierende Symptome mit Angst- und depressiven Störungen, externalisierende Symptome mit oppositionellem und aggressivem Verhalten. Wie jedes kurze Screening ersetzt der PSC-17 keine ausführliche Diagnostik – seine Sensitivität liegt je nach Störungsbild bei etwa 42–73 %. Wie aussagekräftig diese Kennwerte wirken, hängt stark vom gewählten Vergleichsmaßstab ab: Der Gesamtwert des PSC-17 korreliert in der Vergleichsstudie von Gardner et al. (2007) mit r = –0,60 mit dem CBCL-Gesamtwert. Gegen ein breiteres Kriterium – irgendeine psychosoziale Beeinträchtigung statt eine einzelne Diagnose wie ADHS oder Depression – berichten andere Übersichtsarbeiten deutlich höhere Werte (Sensitivität im Mittel .90, Spezifität im Mittel .85) als die oben genannten 42–73 % für einzelne Störungsbilder. Das zeigt: Der PSC-17 eignet sich gut, um irgendeine psychosoziale Auffälligkeit zu erkennen, ist aber weniger treffsicher darin, eine bestimmte Diagnose vorherzusagen.
Substanzkonsum (Jugendliche)
Der CRAFFT wurde vom Center for Adolescent Substance Abuse Research (CeASAR) am Boston Children's Hospital entwickelt und ist eines der am besten validierten Kurz-Screenings für riskanten Substanzkonsum im Jugendalter. In einer Re-Evaluation anhand von DSM-5-Kriterien (Mitchell et al., 2014) stieg der Anteil der Personen mit einer diagnostizierbaren Substanzgebrauchsstörung mit der Anzahl der „Ja“-Antworten deutlich an (von 32 % bei einer „Ja“-Antwort auf über 90 % bei vier oder mehr). Ein Wert von 2 oder mehr gilt als Hinweis auf ein ernstzunehmendes Problem, das eine weitere Abklärung nahelegt. In der Originalvalidierungsstudie von Knight und Kolleg:innen (2002) erwies sich ein Schwellenwert von 2 oder mehr als optimaler Kompromiss zur Erkennung einer diagnostizierbaren Substanzgebrauchsstörung bei 14- bis 18-Jährigen (Sensitivität 80 %, Spezifität 86 %). Bei der spezifischeren Frage nach einer Abhängigkeit von Alkohol oder anderen Substanzen fiel derselbe Schwellenwert in Folgestudien sogar noch trennschärfer aus (Sensitivität 92 %, Spezifität 80 %) – der CRAFFT erkennt also besonders zuverlässig die schwereren Fälle.
Vanderbilt (Eltern, ADHS)
Die Vanderbilt-Skalen wurden von Mark Wolraich und Kolleg:innen auf Basis der DSM-IV-Kriterien entwickelt und in einer großen Stichprobe überwiesener Kinder validiert (Wolraich et al., 2003). Sie gehören zu den am häufigsten in der pädiatrischen Primärversorgung der USA eingesetzten ADHS-Screening-Instrumenten. Die Validierungsstudie berichtet eine sehr hohe interne Konsistenz (Cronbachs Alpha zwischen .91 und .94 je Subskala) sowie eine Test-Retest-Reliabilität über .80. Bei der Erkennung von ADHS im Abgleich mit einer Kombination aus Lehrkraft-Einschätzung und diagnostischem Interview erreichte der Eltern-Fragebogen allein eine Sensitivität von .80 und eine Spezifität von .75 – der positive Vorhersagewert lag jedoch nur bei .19. Das heißt: Von allen Kindern, die anhand des Elternfragebogens allein auffällig eingestuft werden, bestätigt sich das bei einer ausführlichen Diagnostik oft nicht. Genau das ist der wissenschaftliche Grund, warum eine einzelne Elterneinschätzung laut Originalstudie nie für eine Diagnose ausreicht, sondern zusätzliche Quellen wie eine Lehrkraft-Einschätzung und ein klinisches Gespräch braucht (siehe Hinweis unten).
Elterlicher Stress
Die Parental Stress Scale wurde 1995 von Berry und Jones als kürzere Alternative zum 101 Items umfassenden Parenting Stress Index entwickelt. Ihre Besonderheit: Sie erfasst nicht nur belastende, sondern bewusst auch positive, bereichernde Aspekte des Elternseins – beide Aspekte tragen zum Gesamtbild elterlichen Stresserlebens bei. Höhere Werte auf der Skala stehen in Studien im Zusammenhang mit geringerer elterlicher Feinfühligkeit, mehr kindlichen Verhaltensproblemen und einer geringeren Qualität der Eltern-Kind-Beziehung – die Skala wird u. a. eingesetzt, um Veränderungen durch Elternkurse oder Familienunterstützung sichtbar zu machen. Die hier verwendeten Bandbreiten orientieren sich an einer bevölkerungsbasierten norwegischen Stichprobe von 1.096 Eltern einjähriger Kinder (Nærde & Hukkelberg, 2020, PLOS ONE), die einen Mittelwert von 31,0 (SD=7,27) auf dem Rohwertbereich 18–90 berichtet: Der Bereich "durchschnittlich" entspricht ungefähr einer Standardabweichung um diesen Mittelwert. In der Originalstudie von Berry und Jones lag die interne Konsistenz des Gesamtscores bei Cronbachs Alpha = .83, die Retest-Reliabilität über sechs Wochen bei .81. Auf Ebene der beiden inhaltlichen Bereiche – belastende und bereichernde Aspekte des Elternseins – fällt die interne Konsistenz in Folgestudien deutlich uneinheitlicher aus (grob zwischen .61 und .79 je nach Stichprobe und Bereich) als beim Gesamtscore. Das spricht dafür, den Gesamtwert als verlässlicheres Maß zu behandeln als eine Aufspaltung in einzelne Unterbereiche.
Burnout (CBI)
Der CBI wurde 2005 von Kristensen, Borritz, Villadsen und Christensen als frei verfügbare Alternative zum kommerziellen Maslach Burnout Inventory entwickelt. Er zeigt gute interne Konsistenz (Cronbachs Alpha zwischen .85 und .91) und korreliert stark mit etablierten Burnout- und Erschöpfungsmaßen. Die Autor:innen betonen, dass Burnout kein stabiles Persönlichkeitsmerkmal ist, sondern sich über die Zeit deutlich verändern kann – eine wiederholte Durchführung kann daher sinnvoll sein, um Veränderungen sichtbar zu machen. Die persönliche Erschöpfungs-Subskala (Fragen 1–6) wird in der Forschung auch als Screening-Hinweis auf autistisches Burnout diskutiert. Die Autor:innen selbst veröffentlichten 2004 Normierungsdaten (Borritz & Kristensen, nfa.dk): Der einzige dort publizierte klinische Cutoff ist ein Wert von 50 oder mehr Punkten als "hoher Grad an Burnout" (in der Vergleichsstichprobe des PUMA-Projekts, N≈1.900 Beschäftigte in sozialen/pflegerischen Berufen, erreichten je nach Subskala 16–22 % diesen Wert). Die untere Grenze des Bereichs "durchschnittlich" wurde zusätzlich aus den dort berichteten Mittelwerten/Standardabweichungen abgeleitet: persönlicher Burnout anhand einer repräsentativen dänischen Bevölkerungsstichprobe (N=1.498, M=32,7, SD=15,7), arbeits- und klientenbezogener Burnout anhand der PUMA-Stichprobe (Arbeit: M=33,0, SD=17,7, N=1.910; Klient:innen: M=30,9, SD=17,6, N=1.752), da für diese beiden berufsbezogenen Subskalen keine Allgemeinbevölkerungsdaten existieren.
Essverhalten
Der SCOFF wurde 1999 von Morgan, Reid und Lacey in einer britischen Hausarztpraxis-Stichprobe entwickelt und im British Medical Journal veröffentlicht. In der Originalstudie erkannte der Test mit zwei oder mehr „Ja“-Antworten etwa 85–100 % der Personen mit einer diagnostizierten Essstörung korrekt (Sensitivität), bei ebenfalls hoher Spezifität. Der SCOFF wurde seither in zahlreiche Sprachen übersetzt und international validiert. Als reines Kurz-Screening kann er falsch-positive und falsch-negative Ergebnisse liefern und ersetzt keine ausführliche Diagnostik. Eine systematische Übersichtsarbeit mit Metaanalyse über 25 Studien (2020) bestätigt diese gute Erkennungsgüte auch im gepoolten Bild über viele Stichproben hinweg: Sensitivität 86 %, Spezifität 83 %, mit einer Gesamttrennschärfe (AUC) von 0,91 – ein Wert, der in der Diagnostik allgemein als sehr gut gilt. Diese gepoolten Werte liegen etwas näher an der Realität verschiedenster Praxissettings als die ursprüngliche Einzelstudie, die an einer spezifischen britischen Stichprobe entstand.
Resilienz
Die Brief Resilience Scale wurde 2008 von Bruce W. Smith und Kolleg:innen im International Journal of Behavioral Medicine veröffentlicht. Die Autor:innen wollten damit eine Lücke schließen: Viele ältere Resilienz-Fragebögen erfassen eigentlich Ressourcen, die mit Resilienz in Verbindung stehen (z. B. soziale Unterstützung, Optimismus, Sinnerleben), statt der Erholungsfähigkeit selbst – dadurch lässt sich schwer unterscheiden, ob jemand resilient ist oder einfach über mehr Ressourcen verfügt. Die deutsche Fassung wurde 2018 von Chmitorz, Kunzler und Kolleg:innen an zwei großen Stichproben (u. a. einer bevölkerungsrepräsentativen Stichprobe, n = 1.128) validiert und 2024 von Rösner und Kolleg:innen anhand aktueller Normdaten (n = 2.522, erhoben 2022) aktualisiert.
SOMEDIS-A (Social Media)
Der SOMEDIS-A wurde 2021 von Paschke, Austermann und Thomasius am Deutschen Zentrum für Suchtfragen des Kindes- und Jugendalters (DZSKJ, Universitätsklinikum Hamburg-Eppendorf) entwickelt – abgeleitet aus der bereits validierten Gaming Disorder Scale for Adolescents (GADIS-A) derselben Arbeitsgruppe. Er ist damit das erste Screening-Instrument für problematische Social-Media-Nutzung, das direkt auf den ICD-11-Kriterien für Gaming Disorder aufbaut, statt (wie ältere Skalen) auf den DSM-5-Kriterien für Internet Gaming Disorder. Die Validierung erfolgte an einer repräsentativen deutschen Stichprobe von 931 Eltern-Kind-Paaren (Jugendliche 10–17 Jahre), rekrutiert über das Marktforschungsinstitut forsa. Die zweifaktorielle Struktur (kognitiv-behaviorale Symptome, negative Konsequenzen) zeigte gute bis exzellente interne Konsistenz und gute Kriteriumsvalidität (Zusammenhänge mit der Social Media Disorder Scale, dem PHQ-9 und der Perceived Stress Scale). Konkret berichtet die Validierungsstudie eine exzellente interne Konsistenz für den Gesamtscore (Cronbachs Alpha = .91) und moderate, aber statistisch bedeutsame Zusammenhänge mit depressiven Symptomen (PHQ-9: r = .48) und wahrgenommenem Stress (PSS-10: r = .43) – ein Hinweis darauf, dass problematische Social-Media-Nutzung mit, aber nicht gleichzusetzen mit Depression oder Stress ist. In der repräsentativen Stichprobe erfüllten 6,3 % der Jugendlichen die Kriterien für eine problematische Nutzung nach diesem Verfahren.
Depressions- und Angstprofil
Der IDAS (Inventory of Depression and Anxiety Symptoms) wurde von David Watson und Kolleg:innen entwickelt, um Depressions- und Angstsymptome feiner aufzuschlüsseln, als es Gesamtwert-Skalen können. Die erweiterte Fassung IDAS-II (Watson et al., 2012, Assessment) ergänzte unter anderem Skalen für Manie, Euphorie, Zwangssymptome und traumabezogene Symptome. Die hier verwendete deutsche Version wurde 2021 von Wester, Rubel, Zimmermann, Hall, Kaven und Watson im Auftrag des Leibniz-Instituts für Psychologie (ZPID) übersetzt und an einer deutschen Community-Stichprobe von N = 1.054 Personen (51 % weiblich, 18-74 Jahre) normiert -- nicht an einer repräsentativen Bevölkerungsstichprobe, aber deutlich größer als bei den meisten Verfahren in diesem Katalog. Konfirmatorische Faktorenanalysen bestätigten für jede der 18 Skalen Eindimensionalität; die interne Konsistenz (McDonald's Omega) lag für 16 der 18 Skalen über .80, nur bei Euphorie (ω = .75) und Ordnungszwang (ω = .73) etwas darunter. Konvergente und diskriminante Validität wurden gegen sieben weitere Verfahren geprüft, darunter PHQ-9, GAD-7 und WHO-5 -- alle drei ebenfalls Teil dieses Katalogs. Eine Besonderheit: Die Skala „Wohlbefinden“ misst nicht Symptome, sondern positives Erleben (Zuversicht, Vorfreude, Energie) -- hier ist ein NIEDRIGER Wert die auffällige Richtung, weil stark vermindertes positives Erleben (Anhedonie) ein Kernsymptom von Depression ist.
Funktionsbeeinträchtigung (Kind)
Der WFIRS-P wurde von Margaret D. Weiss, Michael B. Wasdell und Melissa M. Bomben entwickelt und 2005 im Rahmen der Canadian ADHD Practice Guidelines veröffentlicht. Er ergänzt reine Symptom-Fragebögen (wie den Vanderbilt-Elternfragebogen) um eine zentrale, oft übersehene Frage: Wie stark wirken sich die Schwierigkeiten tatsächlich auf das Funktionieren im Alltag aus? Eine aktuelle Übersichtsarbeit (Weiss et al., 2018) fasst zusammen, dass Symptomverbesserung nicht automatisch mit funktioneller Verbesserung gleichzusetzen ist – ein Kind kann symptomatisch entlastet und trotzdem in einzelnen Lebensbereichen weiterhin stark beeinträchtigt sein, oder umgekehrt. Der WFIRS-P wurde inzwischen in 18 Sprachen übersetzt und unter anderem an einer deutschen klinischen Stichprobe psychometrisch geprüft (Dose et al., 2016), mit durchgehend guter bis sehr guter interner Konsistenz. Offizielle Auswertung: der Mittelwert pro Bereich (nicht die Summe), damit als „nicht zutreffend“ markierte Items die Berechnung nicht verzerren. Konkret berichtet die deutsche Validierungsstudie für alle Lebensbereiche eine interne Konsistenz von Cronbachs Alpha über .70 sowie eine Retest-Reliabilität über .70 – mit einer Ausnahme: Der Bereich „Riskante Aktivitäten“ erreichte diesen Wert nicht. Das deckt sich mit einem inhaltlichen Grund: Riskantes Verhalten (z. B. gefährliches Verhalten im Straßenverkehr) tritt bei Kindern seltener und unregelmäßiger auf als etwa schulische oder familiäre Schwierigkeiten, was die Skala statistisch weniger stabil macht. Bei der Einordnung dieses einen Bereichs ist daher etwas mehr Zurückhaltung angebracht als bei den anderen.
Funktionsbeeinträchtigung
Der WFIRS-S wurde von Margaret D. Weiss entwickelt und ergänzt reine Symptom-Fragebögen wie den ASRS-v1.1 um eine zentrale, oft übersehene Frage: Wie stark wirken sich die Schwierigkeiten tatsächlich auf das Funktionieren im Alltag aus? Eine aktuelle Übersichtsarbeit (Weiss et al., 2018) fasst zusammen, dass Symptomverbesserung nicht automatisch mit funktioneller Verbesserung gleichzusetzen ist. Der WFIRS-S wurde in 18 Sprachen übersetzt und unter anderem an Studierenden- und Erwachsenenstichproben in den USA, Japan und im Iran psychometrisch geprüft, mit durchgehend guter interner Konsistenz. Anders als beim Elternbericht (WFIRS-P) gibt es für den Selbstbericht bislang keine Studie, die einen wissenschaftlich abgesicherten Schwellenwert für „auffällig“ ermittelt hat – die Übersichtsarbeit von Weiss et al. (2018) nennt hierzu ausdrücklich noch offenen Forschungsbedarf. Verfügbar sind nur Referenz-Mittelwerte aus einzelnen Stichproben (z. B. Canu et al., 2016: erwachsene Studierende mit ADHS-Verdacht M=0,88, ohne M=0,35). Offizielle Auswertung: der Mittelwert pro Bereich (nicht die Summe), damit als „nicht zutreffend“ markierte Items die Berechnung nicht verzerren. Die Studie von Canu und Kolleg:innen (2016) an einer sehr großen Stichprobe von 2.093 Studierenden berichtet eine außergewöhnlich hohe interne Konsistenz (Cronbachs Alpha über .96 sowohl im Selbst- als auch im Fremdbericht durch nahestehende Personen) sowie eine gute Übereinstimmung zwischen beiden Berichtsformen. Dieselbe Studie fand aber auch eine wichtige Einschränkung: Die gemessene Beeinträchtigung hing nicht nur mit ADHS-Symptomen zusammen, sondern auch mit internalisierenden Symptomen wie Angst und Niedergeschlagenheit. Der WFIRS-S misst also allgemeine Alltagsbeeinträchtigung, keine ADHS-spezifische – ein erhöhter Wert kann daher auch andere Ursachen als ADHS haben.