Morgenwunder

Wissenschaft & Ideen

Die Zahl, die mit jeder neuen Variablen besser aussieht

Das Bestimmtheitsmaß, meist als R² bezeichnet, gibt bei einer Regression an, wie gut die geschätzte Modellfunktion zu den beobachteten Daten passt. Es basiert auf der Idee, die gesamte Streuung der Messwerte in einen durch das Modell erklärten und einen unerklärten Rest aufzuteilen – das Verhältnis dieser beiden Anteile ergibt das Maß. Bei einer einfachen Regression mit nur einer erklärenden Variablen entspricht R² schlicht dem Quadrat des Korrelationskoeffizienten. Allerdings gibt es, wie du erfährst, mehrere nicht ganz gleichwertige Definitionen, die vor allem bei Regressionen ohne Achsenabschnitt auseinanderfallen und dort sogar negative Werte liefern können. Weil R² mit jeder zusätzlichen erklärenden Variablen automatisch steigt, selbst wenn diese nichts zur Erklärung beiträgt, wird in der Praxis meist eine korrigierte Variante verwendet, die diesen Effekt ausgleicht. 

Du lernst außerdem, dass das Bestimmtheitsmaß zwar sehr populär, aber auch häufig missverstanden wird. Ein hoher Wert bedeutet nicht automatisch, dass ein linearer Zusammenhang tatsächlich vorliegt oder dass das Modell überall gut passt – nichtlineare Daten können trotzdem ein täuschend hohes R² erzeugen, wie Beispielgrafiken im Artikel zeigen. Umgekehrt heißt ein niedriger Wert nicht, dass gar kein Zusammenhang existiert, etwa wenn die wahre Beziehung quadratisch statt linear ist. Besonders wichtig ist die Warnung vor Verwechslung mit Kausalität: ein hoher Zusammenhang zwischen zwei Größen sagt nichts darüber aus, ob die eine die andere tatsächlich verursacht, wie das klassische Beispiel mit Störchen und Geburtenzahlen illustriert. Auch über statistische Signifikanz oder Multikollinearität der erklärenden Variablen macht das Maß keine Aussage, weshalb ergänzende Tests wie der F-Test nötig sind.

Historisch geht die Regressionsanalyse auf Francis Galton zurück, der in den 1870er-Jahren beim Studium von Pflanzensamen die „Regression zur Mitte“ entdeckte; spätere Statistiker wie Ronald Fisher und Karl Pearson lieferten die mathematischen Grundlagen, auf denen das Bestimmtheitsmaß aufbaut. Wegen anhaltender Kritik an seiner Tendenz, mit jeder neuen Variablen zu wachsen, schlug der Ökonometriker Henri Theil 1961 das adjustierte Bestimmtheitsmaß vor, das Freiheitsgrade berücksichtigt, wenn auch nach Ansicht mancher Kritiker noch unzureichend. Für Modelle mit kategorialen abhängigen Variablen, etwa in der Logit-Regression, existieren zudem sogenannte Pseudo-Bestimmtheitsmaße, und für die Vorhersagequalität eines Modells gibt es ein eigenes Prognose-Bestimmtheitsmaß. Insgesamt zeigt der Artikel, dass hinter der scheinbar simplen Kennzahl ein ganzes Geflecht von Definitionen, mathematischen Herleitungen und Anwendungsgrenzen steckt, die bei der Interpretation in der Praxis unbedingt mitbedacht werden müssen.

Es gibt nicht eine Definition von R², sondern mehrere, die sich nicht entsprechen – bei einer Regression durch den Ursprung fallen die Varianten auseinander und liefern unterschiedliche Werte.

Den ganzen Artikel „Bestimmtheitsmaß“ auf Wikipedia lesen

Der Artikel stammt aus der Wikipedia und steht unter CC BY-SA 4.0. Die Einleitung oben ist unsere eigene.

Jeden Morgen einer.

Ein Wikipedia-Artikel pro Tag, zu deiner Uhrzeit, aus den Themen, die du willst. Kostenlos, jederzeit abbestellbar.

Anmelden