Kapitel 3 – Multivariate Zusammenhangsmaße

Bedingte empirische Momente

  • Idee: Untersuche Kenngrößen einer Variablen YY getrennt nach Ausprägungen einer zweiten Variablen XX ("Bedingung auf X=ξiX = \xi_i").
  • Bedingtes arithmetisches Mittel von YX=ξiY\mid X = \xi_i
    • Aus Rohdaten (Urliste) – nur Wertepaaren mit X=ξiX = \xi_i verwenden:
    • yˉ<em>YX=ξ</em>i=1n<em>i</em>ν:x<em>ν=ξ</em>iyν\bar y<em>{Y\mid X=\xi</em>i}=\dfrac{1}{n<em>i}\sum</em>{\nu : x<em>\nu = \xi</em>i} y_\nu
    • Aus bedingter Verteilung h<em>YX(y</em>jX=ξi)h<em>{Y\mid X}(y</em>j\mid X = \xi_i):
    • yˉ<em>YX=ξ</em>i=<em>j=1ly</em>jh<em>YX(y</em>jX=ξi)\bar y<em>{Y\mid X=\xi</em>i}=\sum<em>{j=1}^l y</em>j\, h<em>{Y\mid X}(y</em>j\mid X = \xi_i)
  • Bedingte Varianz von YX=ξiY\mid X=\xi_i
    • Aus Urliste:
    • s2<em>YX=ξ</em>i=1n<em>i</em>ν:x<em>ν=ξ</em>i(y<em>νyˉ</em>YX=ξi)2s^2<em>{Y\mid X=\xi</em>i}=\dfrac{1}{n<em>i}\sum</em>{\nu : x<em>\nu = \xi</em>i}\bigl(y<em>\nu-\bar y</em>{Y\mid X=\xi_i}\bigr)^2
    • Aus bedingter Verteilung:
    • s2<em>YX=ξ</em>i=<em>j=1l(y</em>jyˉ<em>YX=ξ</em>i)2h<em>YX(y</em>jX=ξi)s^2<em>{Y\mid X=\xi</em>i}=\sum<em>{j=1}^l\bigl(y</em>j-\bar y<em>{Y\mid X=\xi</em>i}\bigr)^2\,h<em>{Y\mid X}(y</em>j\mid X = \xi_i)
  • Analog bestimmbar: Bedingte Quantile, höhere bedingte Momente (Schiefe, Kurtosis), bedingte Kovarianz.
  • Konzept übertragbar auf Datensätze beliebiger Dimension (mehrere bedingende Variablen).

Satz vom totalen Mittelwert

  • Liefert Beziehung zwischen bedingten und unbedingten (marginalen) Mitteln.
  • Beispiel Szenario Klausurleistung:
    • YY = erreichte Notenpunkte.
    • XX = Termin (Haupt-Termin HT = 1, Nach-Termin NT = 0).
    • nn = Gesamtzahl, n<em>HTn<em>{HT} bzw. n</em>NTn</em>{NT} Teilnehmer je Termin.
  • Ableitung:
    • yˉ=1n<em>ν=1ny</em>ν=n<em>HTnyˉ</em>YX=1+n<em>NTnyˉ</em>YX=0\bar y=\dfrac1n\sum<em>{\nu=1}^n y</em>\nu = \dfrac{n<em>{HT}}{n}\bar y</em>{Y\mid X=1}+\dfrac{n<em>{NT}}{n}\bar y</em>{Y\mid X=0}
    • Alternativ in relativen Häufigkeiten rel<em>H(X=1)\operatorname{rel}<em>H(X=1) und rel</em>H(X=0)\operatorname{rel}</em>H(X=0).
  • Interpretation: Gesamtmittelwert ist gewichtetes Mittel der bedingten Mittelwerte; Gewichte = Anteile der jeweiligen Gruppen.
  • Verallgemeinerung: Für diskrete XX mit kk Kategorien: yˉ=<em>i=1krel</em>H(X=ξ<em>i)yˉ</em>YX=ξi\bar y = \sum<em>{i=1}^k \operatorname{rel}</em>H(X=\xi<em>i)\,\bar y</em>{Y\mid X=\xi_i}.
  • Fundamentales Prinzip der bedingten Erwartung in der theoretischen (stochastischen) Formulierung.

Value-at-Risk und Expected Shortfall

  • Anwendung bedingter Mittelwerte in der Finanzwirtschaft.
  • Datengrundlage: Historische tägliche DAX-Renditen rtr_t eines 100.000 €-Portfolios, Länge (~20) Jahre.
  • Empirisches 0,010{,}01-Quantil der täglichen Renditen: 3,87%-3{,}87\%.
    • Täglicher VaR0,99\operatorname{VaR}_{0{,}99}: 3,87%×100000=38703{,}87\%\times100\,000€ = 3\,870€.
  • Expected Shortfall (Conditional VaR): Bedingtes Mittel aller Verluste, die schlimmer als das Quantil sind.
    • ES<em>0,99=E[r</em>tr<em>tq</em>0,01]ES<em>{0{,}99}=E\bigl[r</em>t\,\bigl|\,r<em>t\le q</em>{0{,}01}\bigr]
    • Rechnerisch Analog zum bedingten Mittelwertkonzept.
  • Relevanz:
    • VaRVaR = Grenzwert, ESES = durchschnittlicher Schaden dahinter.
    • Beide Größen Abschätzung des Marktrisikos.

Maßzahlen für lineare Zusammenhänge

Kovarianz

  • Formale Definition für Stichprobe der Größe nn:
    • c<em>XY=1n</em>ν=1n(x<em>νxˉ)(y</em>νyˉ)c<em>{XY}=\dfrac1n\sum</em>{\nu=1}^n \bigl(x<em>\nu-\bar x\bigr)\bigl(y</em>\nu-\bar y\bigr)
  • Eigenschaften:
    • Wertebereich -\infty < c_{XY} < \infty.
    • cXY|c_{XY}| gibt Stärke (und Vorzeichen) des linearen Zusammenhangs an.
    • Abhängig von Maßeinheiten (skaliert mit Einheiten von (X)·(Y)).
  • Geometrische Interpretation: Fläche gemischter Rechtecke relativ zum Schwerpunkt (xˉ,yˉ)(\bar x,\bar y).
  • Visualisierung (Slide 6): Quadranten-Analyse:
    • ++ und -- Quadrant tragen positiv bei, +- und -+ negativ.

Korrelationskoeffizient nach Bravais – Pearson

  • Normierte Kovarianz:
    • r<em>XY=c</em>XYs<em>Xs</em>Yr<em>{XY}=\dfrac{c</em>{XY}}{s<em>X\,s</em>Y}
  • Eigenschaften:
    • Wertebereich 1rXY1-1\le r_{XY}\le1.
    • Einheitenfrei, erlaubt Vergleich über Skalen.
    • rXY=±1r_{XY}=\pm1 → perfekte lineare Beziehung Y=a+bXY=a+bX.

Eigenschaften von Kovarianz und Korrelation (zusammengefasst)

  • Ungleichung: c<em>XY2s</em>X2s<em>Y2c<em>{XY}^2\le s</em>X^2 s<em>Y^2 entspricht r</em>XY1|r</em>{XY}|\le1.
  • Alternative Kovarianzform: c<em>XY=1n</em>ν=1nx<em>νy</em>νxˉyˉc<em>{XY}=\dfrac1n\sum</em>{\nu=1}^n x<em>\nu y</em>\nu-\bar x\bar y.
  • Lineare Transformation: Für U=a+bXU=a+bX, V=c+dYV=c+dY gilt c<em>UV=bdc</em>XYc<em>{UV}=b\,d\,c</em>{XY} (Skalierungs-Multiplikator).
  • Sensitivität: Beide Maße stark ausreißerempfindlich (Quadrate).
  • Faustregel (Interpretation rXY|r_{XY}|):
    • =0=0 → keine lineare Korrelation.
    • 0<|r|<0{,}5 → schwach.
    • 0{,}5\le|r|<0{,}8 → mittel.
    • 0{,}8\le|r|<1 → stark.

Vorsicht bei Interpretation

  • Linearität vs. Nichtlinearität:
    • Beispiel Datenpaar x<em>v=4,,4x<em>v=-4,\dots,4 und y</em>v=x<em>v2y</em>v=x<em>v^2: r</em>XY=0r</em>{XY}=0 trotz perfektem quadratischen Zusammenhang.
  • Korrelation ist nicht Kausalität:
    • Dritte Variable könnte verantwortlich sein.
    • Spurious Correlation (Data Mining Fallstricke).
    • Bei echter Kausalität: rXYr_{XY} verrät nicht Richtung (Ursache-Wirkung).

Arithmetische Mittel messbarer Funktionen (Verbindet Konzepte)

  • Allgemeines Funktionsmittel: Für Z=g(X,Y)Z=g(X,Y)
    • zˉ=1n<em>ν=1ng(x</em>ν,yν)\bar z=\dfrac1n\sum<em>{\nu=1}^n g(x</em>\nu,y_\nu).
  • Beispiele:
    • Kreuzmoment: Z=XYzˉ=1nx<em>νy</em>νZ=XY\Rightarrow \bar z=\dfrac1n\sum x<em>\nu y</em>\nu.
    • Kovarianz: g=(Xxˉ)(Yyˉ)g=(X-\bar x)(Y-\bar y).
    • Linearkombination: Z=aX+bYzˉ=axˉ+byˉZ=aX+bY\Rightarrow \bar z=a\bar x+b\bar y.
  • Sichtweise: Auch Histogramm-Dichten h<em>XY[ξ</em>i,ηi]h<em>{XY}[\xi</em>i,\eta_i] oder Kerndichten sind gewichtete arithmetische Mittel.

Rankkorrelationskoeffizient nach Spearman

  • Ziel: Stärke einer monotonen Beziehung zwischen ordinalskalierten oder rangierbaren Variablen erfassen.
  • Vorgehen:
    • Ersetze ursprüngliche Werte x<em>ν,y</em>νx<em>\nu,y</em>\nu durch ihre Ränge rank(x<em>ν),rank(y</em>ν)\operatorname{rank}(x<em>\nu),\operatorname{rank}(y</em>\nu).
    • Berechne Quadratsumme der Rangdifferenzen.
  • Formel:
    • r<em>XYSp=16</em>ν=1n(rank(x<em>ν)rank(y</em>ν))2n3nr<em>{XY}^{Sp}=1-\dfrac{6\sum</em>{\nu=1}^n\bigl(\operatorname{rank}(x<em>\nu)-\operatorname{rank}(y</em>\nu)\bigr)^2}{n^3-n}
  • Eigenschaften:
    • Wertebereich wie Pearson [1,1][-1,1].
    • Robust gegenüber Ausreißern, weil nur Ordnung zählt.
    • Erkennt beliebige monotone, nicht notwendigerweise lineare Zusammenhänge.

Verknüpfungen zu früheren Kapiteln / Praxis:

  • Kapitel 2 behandelte univariate Momente; Kapitel 3 erweitert auf multivariate Beziehungen.
  • Konzepte wie bedingte Erwartung sind zentral für inferenzstatistische Methoden (Regression, ANOVA, Bayes).
  • Finanz-Kennzahlen wie VaRVaR/ESES illustrieren, wie statistische Theorie unmittelbar in Regulierung (Basel III) oder Risikomanagement mündet.
  • Warnung vor Fehlinterpretationen (Korrelation ≠ Kausalität) wichtig für wissenschaftliche Ethik und Evidenzbasierung.