Bei Datenerhebungen kommt es oft vor, dass die erhobenen Werte nicht vollständig sind. Dies tritt zum Beispiel auf, wenn Umfrageteilnehmer nicht jede Frage beantworten. Methoden der statistischen Inferenz wie Schätzen oder Testen gehen jedoch meist von vollständigen Datensätzen aus.
Imputationsverfahren dienen dem Ziel trotz fehlender Werte, Verfahren der statistischen Inferenz anwenden zu können. Es ist nicht ihr Ziel, fehlende Werte möglichst genau vorherzusagen.

Inhaltsverzeichnis

Mechanismen fehlender Daten

Es ist wichtig sich zu fragen, warum die Daten fehlen, denn der Grund für das Fehlen der Daten kann Informationen beinhalten und hat auch Einfluss auf die Wahl des Imputationsverfahrens.

Fehlen die Daten völlig zufällig, etwa weil ausgefüllte Fragebögen verloren gegangen sind, so nennt man den Mechanismus Missing completely at random (MCAR).
Hängt die Wahrscheinlichkeit für das Fehlen der Daten hingegen von den Werten einer vollständig beobachteten Variablen ab, so liegt der Mechanismus Missing at random (MAR) vor. Dies wäre zum Beispiel der Fall, wenn Männer eine Umfrage früher abbrechen als Frauen, sofern Geschlecht beobachtet werden kann.
Es kommt ebenfalls vor, dass die Wahrscheinlichkeit für das Fehlen der Daten von den fehlenden Werten abhängt, etwa wenn Umfrageteilnehmer mit hohem Einkommen Auskunft über ihr Einkommen verweigern. Dieser Mechanismus nennt sich Missing not at random (MNAR).

Mehr zu diesen Mechanismen fehlender Daten und wie man herausfindet, welcher vorliegt, befindet sich im Artikel Vom Umgang mit fehlenden Werten .

Singuläre Imputationsverfahren

Es gibt verschiedene singuläre Imputationsverfahren, welchen gemein ist, dass sie für jeden fehlenden Wert einen Wert einsetzen.

Imputation durch Lagemaße

Bei diesem Verfahren werden die fehlenden Werte durch ein Lagemaß der beobachteten Werte derselben Variable imputiert. Bei metrischen Variablen wird dafür typischerweise das arithmetische Mittel, bei nicht-metrischen Variablen der Median oder der Modus gewählt.
Das Lagemaß der jeweiligen Variablen bleibt durch die Imputation unverändert, allerdings werden sowohl die Varianz als auch die Kovarianz zu anderen Variablen unterschätzt. Dadurch sind die p-Werte von statistischen Tests zu gering und die Konfidenzintervalle der Parameter zu schmal.

Zusätzliche Information zu diesem Verfahren befindet sich im Artikel Vom Umgang mit fehlenden Werten .

Imputation durch Regression

Diese Methode nutzt die Korrelation zwischen den Variablen, beispielsweise zwischen Körpergröße und Gewicht. Es wird eine Regression der beobachteten Werte einer teilweise beobachteten Variable auf die zugehörigen Werte von vollständig beobachteten Variablen durchgeführt. Anschließend werden die Werte der vollständig beobachteten Variablen, welche nicht zur Regression verwendet wurden, in das geschätzte Regressionsmodell eingesetzt, um prognostizierte Werte für die fehlenden Werte zu erhalten.

Mehr Information zu diesem Verfahren und möglichen Problemen befindet sich im Artikel Vom Umgang mit fehlenden Werten .

Hot Deck Imputation

Die Hot Deck Imputation nutzt beobachtete Werte von ähnlichen Individuen zur Imputation. Hat beispielsweise jemand eine Frage einer Umfrage nicht beantwortet, so wird die Antwort von jemandem mit ähnlichen Charakteristiken (z. B. Alter, Beruf, Wohnort) für die fehlende Antwort eingesetzt.
Es gibt verschiedene Möglichkeiten, die Ähnlichkeit zwischen Individuen zu messen. Eine ist die Methode Nearest Neighbor Hot Deck

.
Dabei wird mithilfe einer Metrik die Distanz zwischen Individuen gemessen. Je kleiner die Distanz, umso ähnlicher sind sich diese.
Eine mögliche Metrik ist die Mahalanobis-Distanz. Die Distanz \(d(i,j)\) zwischen den Individuen i und j ist bei ihr gegeben durch:

\[d(i,j) = (x_{i}-x_{j})^{T}S_{xx}^{-1}(x_{i}-x_{j}),\] wobei \(x_{k}\) den Vektor der Variablen von Individuum k und \(S_{xx}\) die geschätzte Kovarianzmatrix von \(x_{i}\) bezeichnet.

Sollen Werte für Individuum i imputiert werden, so wird nach dem Individuum gesucht, welches den kleinsten Abstand zu Individuum i besitzt. Die Werte dieses Individuums werden anschließend zur Imputation benutzt.

Der Vorteil dieses Verfahrens ist, dass nur plausible Werte eingesetzt werden, denn die imputierten Werte stammen von Beobachtungen. Zudem ist die Hot Deck Imputation weniger anfällig für Modellmisspezifikation, verglichen mit der Regressionsimputation. Allerdings hängt die Imputation von der Wahl der Metrik ab.

Zum Umgang mit Abbildungen und Tabellen

Format im Text

Abbildungen und Tabellen werden zentriert. Alle Abbildungen besitzen eine Bildüberschrift, die Teil der Abbildung ist. Wenn dies nicht möglich ist, dann wird entsprechend im Wiki-Editor eine zentrierte Überschrift hinzugefügt. Nach Möglichkeit sollten Bilder eine Überschrift als Eigenschaft haben.

Abweichung

Abbildungen können und sollten über Infoboxen verfügen. Die Infobox besitzt den selben Titel wie die Abbildung. In dieser Box können Quellenangaben und weitere Informationen enthalten sein.

Bereichsverknüpfungen

Seitenhierarchie

Inhaltsverzeichnis

Mechanismen fehlender Daten

Singuläre Imputationsverfahren

Imputation durch Lagemaße

Imputation durch Regression

Hot Deck Imputation

Zum Umgang mit Abbildungen und Tabellen

Format im Text

Formeln

Hilfe

Zitieren

Quellennachweis

Bildergalerie