Einfache lineare Modelle
Nach diesem Kapitel können Sie …
Orientiert an McElreath (2020), Kap. 4.4.
Einstieg
lm): Die drei Parameter \(\beta_0\), \(\beta_1\), \(\sigma\) haben jetzt eine Post-VerteilungEinstieg
Howell1a.csv (McElreath, 2020)height (Größe), weight (Gewicht), age, maleDen Datensatz verstehen
age rechtsschief; height und weight eher symmetrisch/normalverteiltheight bimodal — vermutlich Mischung der GeschlechterDen Datensatz verstehen
Starke Zusammenhänge zwischen Größe und Gewicht sowie zwischen Geschlecht und Größe/Gewicht.
Den Datensatz verstehen
Den Datensatz verstehen
Deutlicher linearer Zusammenhang: je schwerer, desto größer.
Den Datensatz verstehen
weight_c (c wie centered)Warum zentrieren?
Mit zentriertem Prädiktor gibt der Achsenabschnitt \(\beta_0\) die Größe einer Person mit durchschnittlichem Gewicht an — sonst wäre es die (unsinnige) Größe bei Gewicht = 0. Vgl. Gelman et al. (2021), Kap. 10.4, 12.2.
Den Datensatz verstehen
Der Mittelwert von weight_c liegt danach bei 0.
Den Datensatz verstehen
Modell m_kung_gewicht_c: zentrierter Prädiktor
Modell m_kung_gewicht_c: zentrierter Prädiktor
m_kung_gewicht_cDefinition: Modelldefinition m_kung_gewicht_c
\[\begin{align*} \color{red}{\text{height}_i} & \color{red}\sim \color{red}{\operatorname{Normal}(\mu_i, \sigma)} && \color{red}{\text{Likelihood}} \\ \color{green}{\mu_i} & \color{green}= \color{green}{\beta_0 + \beta_1\cdot \text{weightcentered}_i} && \color{green}{\text{Lineares Modell}} \\ \color{blue}{\beta_0} & \color{blue}\sim \color{blue}{\operatorname{Normal}(178, 20)} && \color{blue}{\text{Priori}} \\ \color{blue}{\beta_1} & \color{blue}\sim \color{blue}{\operatorname{Normal}(0, 10)} && \color{blue}{\text{Priori}}\\ \color{blue}\sigma & \color{blue}\sim \color{blue}{\operatorname{Exp}(0.1)} && \color{blue}{\text{Priori}} \end{align*}\quad \square\]
Modell m_kung_gewicht_c: zentrierter Prädiktor
\[ \color{red}{\text{height}_i} \sim \operatorname{Normal}(\mu_i, \sigma) \]
“Die Wahrscheinlichkeit, eine bestimmte Größe \(h\) bei Person \(i\) zu beobachten, gegeben \(\mu\) und \(\sigma\), ist normalverteilt.”
Modell m_kung_gewicht_c: zentrierter Prädiktor
\[ \color{green}{\mu_i} = \beta_0 + \beta_1\cdot \text{weightcentered}_i \]
height bei einer Einheit Unterschied in weight (Steigung)weight_c = 0 (Achsenabschnitt)“Der vorhergesagte mittlere Wert der Körpergröße, \(\mu_i\), berechnet sich als Summe von \(\beta_0\) und \(\beta_1 \cdot \text{weight}_i\).”
Modell m_kung_gewicht_c: zentrierter Prädiktor
\[ \begin{aligned} \beta_0 &\sim \operatorname{Normal}(178, 20) && \text{Priori Achsenabschnitt} \\ \beta_1 &\sim \operatorname{Normal}(0, 10) && \text{Priori Regressionsgewicht}\\ \sigma &\sim \operatorname{Exp}(0.1) && \text{Priori Sigma} \end{aligned} \]
Modell m_kung_gewicht_c: zentrierter Prädiktor
m_kung_starkes_beta1: andere Priori für \(\beta_1\)\[\beta_1 \sim N(5,3); \quad \beta_0 \sim N(178, 20); \quad \sigma \sim E(0.1)\]
Hinweis
seed fixiert die Zufallszahlen für reproduzierbare Ergebnisse (Konvention hier: 42).
Die Post-Verteilung befragen
pd)Definition: Effektwahrscheinlichkeit
Die Kennzahl pd (probability of direction) gibt an, mit welcher Wahrscheinlichkeit ein Effekt positiv bzw. negativ ist (je nachdem, ob der Median des Effekts positiv oder negativ ist). Sie sagt nichts über die Effektstärke aus — nur ob der Effekt klar auf einer Seite der Null liegt. Grob vergleichbar mit dem p-Wert der Frequentistischen Statistik (Makowski et al., 2019).
Die Post-Verteilung befragen
Rhat, ESS: Diagnosekennzahlen der Stichprobenziehung — bei einfachen Modellen i. d. R. unproblematischDie Post-Verteilung befragen
parameters(modell): Zusammenfassung der Post-Verteilungas_tibble(modell): Rohe Stichproben als Tabellem_kung_starkes_beta1: \(\beta_1\) (Steigung) liegt etwa zwischen 0.8 und 1.0 cm Größe pro kg GewichtDie Post-Verteilung befragen
Die Post-Verteilung befragen
Die Post-Verteilung befragen
Die Post-Verteilung befragen
Die Post-Verteilung befragen
Die Post-Verteilung befragen
Typische Fragen an den (zentrierten) Achsenabschnitt:
Hinweis
Statt eines 95 %-Intervalls wird teils ein 90 %- oder 89 %-Intervall empfohlen (bessere numerische Stabilität).
Die Post-Verteilung befragen
Beantwortbar durch einfaches Auszählen der Stichproben aus der Post-Verteilung (Anteil erfüllt Bedingung).
Die Post-Verteilung befragen
Post-Verteilung bedingt auf einen Prädiktorwert
weight → weight_c = 0Post-Verteilung bedingt auf einen Prädiktorwert
weight_c = 5mu_at_50 = (Intercept) + 5 * weight_cPost-Verteilung bedingt auf einen Prädiktorwert
Dieselben Werkzeuge (Quantile, ETI/HDI, Auszählen) funktionieren für jede bedingte Post-Verteilung.
Post-Verteilung bedingt auf einen Prädiktorwert
Fazit
Fazit
Fragen?
Fazit

Start:Bayes! — Einfache lineare Modelle