Schätzen vs. Testen
Nach diesem Kapitel können Sie …
Begleitliteratur: Kruschke (2018)
Einmal Behauptung, einmal Frage — was macht das für einen Unterschied?
Einstieg
Was ist Testen? Was ist Schätzen?
Beispiel: “Lernen erhöht den Prüfungserfolg!”
Hypothesentests sind binär: Sie führen zu Schwarz-Weiß-Ergebnissen.
Was ist Testen? Was ist Schätzen?
Wichtig
Häufigste Variante: Test der Hypothese “Es liegt kein (null) Effekt vor” — die Nullhypothese, \(H_0\).
Beispiele für Nullhypothesen:
Vorteil des Hypothesentestens: klares, einfaches Ergebnis — reduziert Komplexität für Entscheidungen.
Was ist Testen? Was ist Schätzen?
Karl Poppers Falsifikationismus
Hypothesen lassen sich nicht bestätigen (verifizieren), nur falsifizieren (Popper, 2013).
Beispiel \(H\): “Alle Schwäne sind weiß.” Auch viele weiße Schwäne beweisen \(H\) nicht — der eine schwarze Schwan könnte noch fehlen. Aber ein einziger zuverlässig beobachteter schwarzer Schwan widerlegt \(H\).
In der Praxis: Hypothesen werden meist probabilistisch untersucht — komplett sichere Belege wie bei Popper sind selten. Sowohl Bestätigung als auch Widerlegung sind daher (graduell) möglich (Kruschke, 2018; Morey & Rouder, 2011).
Was ist Testen? Was ist Schätzen?
Beim Schätzen fragt man wie groß ein Effekt ist — ein “wieviel”, kein “ja/nein”.
Zwei Varianten:
Liegt ein bestimmter Wert (z. B. Null) nicht im Schätzbereich, kann man die entsprechende Hypothese verwerfen. Das Hypothesentesten steckt also implizit im Schätzen.
Was ist Testen? Was ist Schätzen?
Forschungsfrage: Um welchen Wert sind männliche Pinguine im Schnitt schwerer als weibliche?
body_mass_g ~ sexWas ist Testen? Was ist Schätzen?
Forschungsfrage: Sind männliche Pinguine im Schnitt schwerer als weibliche?
\[H: \mu_M \ge \mu_F \rightarrow d = \mu_M - \mu_F \ge 0\]
sexmale > 0: 100 % (4000 von 4000)Vorteil der Parameterschätzung: nuancierteres Ergebnis, das der Komplexität realer Systeme besser gerecht wird.
Was ist Testen? Was ist Schätzen?
We do not generally use null hypothesis significance testing in our own work. […] just about every treatment one might consider will have some effect, and no comparison or regression coefficient of interest will be exactly zero. (Gelman et al., 2021)
ROPE: Bereich von “praktisch Null”
Nullhypothesen wie \(\rho=0\), \(\mu_1=\mu_2\), \(\beta_1=0\) sind streng genommen fast nie exakt wahr. Alternativen:
ROPE: Bereich von “praktisch Null”
Definition: ROPE
ROPE (Region of Practical Equivalence) ist ein Bereich um den Nullwert, der als praktisch äquivalent zu Null angesehen wird.
Beispiele:
ROPE: Bereich von “praktisch Null”
Nach Kruschke (2018):
“Großteil” = per Default das 95 %-HDI der Posteriori-Verteilung.
ROPE: Bereich von “praktisch Null”
ROPE-Default
Voreinstellung: ROPE-Größe = ±10 % der Standardabweichung der AV.
ROPE: Bereich von “praktisch Null”
ROPE: Bereich von “praktisch Null”
Modell: body_mass_g ~ species (Referenz: Adelie)
ROPE-Grenzwert hier: ±80 g (10 % der SD der AV)
ROPE: Bereich von “praktisch Null”

ROPE: Bereich von “praktisch Null”
Die ROPE-Grenzen lassen sich anpassen, z. B. auf ±200 g:
Auch das Kredibilitätsintervall ist wählbar (z. B. 89 % statt 95 %).
ROPE: Bereich von “praktisch Null”
Modellgüte
Modellgüte
Modellgüte
Fazit
Fragen?
Fazit

Start:Bayes! — Schätzen vs. Testen