Likert-Skala
Definition: Die Likert-Skala ist ein in der empirischen Sozial- und Marktforschung weit verbreitetes Antwortformat zur Messung von Einstellungen, Meinungen, Zufriedenheiten oder anderen latenten psychologischen Konstrukten. Benannt nach dem amerikanischen Psychologen und Organisationsforscher Rensis Likert, der das Format 1932 in seiner Dissertation einführte, besteht die Skala aus einer positiv oder negativ formulierten Aussage (Item), zu der Befragte ihren Grad der Zustimmung oder Ablehnung auf einer geordneten, mehrstufigen Antwortskala angeben. Typische Skalierungen sind 5-stufig (“stimme gar nicht zu” / “stimme eher nicht zu” / “weder noch” / “stimme eher zu” / “stimme voll zu”) oder 7-stufig. Im engeren Sinne bezeichnet “Likert-Skala” eine summierte Ratingskala, bei der mehrere Items dasselbe Konstrukt messen und zu einem Gesamtscore addiert werden; im weiteren, im Marketing gebräuchlichen Sinne wird das Format auch als Antwortskala für Einzelfragen bezeichnet.
Erläuterung
Die Likert-Skala ist das meistgenutzte Messinstrument in der Marktforschung und in Kundenbefragungen, weil sie einen guten Kompromiss aus Messgenauigkeit, Verständlichkeit und Antwortbereitschaft bietet. Im Marketing-Kontext wird sie für Kundenzufriedenheitsstudien (z. B. “Ich bin mit dem Kundenservice des Unternehmens zufrieden.”), Brand-Perception-Studien (“Die Marke X vermittelt mir ein Gefühl von Vertrauen.”), UX-Research (“Diese Website ist einfach zu bedienen.”), Mitarbeiterbefragungen und als Bestandteil validierter Marktforschungsskalen (z. B. Net Promoter Score-Befragungen, Customer Effort Score, ACSI) eingesetzt. Eine wichtige methodische Debatte betrifft das Messniveau: Streng betrachtet sind Likert-Daten ordinal skaliert – die Abstände zwischen den Skalenpunkten müssen nicht gleich gross sein. In der Praxis werden sie jedoch häufig als intervallskaliert behandelt, was die Berechnung von Mittelwerten, Standardabweichungen und parametrischen Statistiken (t-Test, ANOVA, Faktoranalyse) ermöglicht. Diese Praxis ist in der Forschung akzeptiert, wenn ausreichend Skalenpunkte vorhanden sind (ab 5 Stufen) und Validierungsstudien keine gravierenden Messfehler nahelegen. Die Wahl der Stufenanzahl hat praktische Konsequenzen: Eine 5-Punkt-Skala ist kompakter und für mobile Befragungen besser geeignet; eine 7-Punkt-Skala bietet mehr Differenzierungsmöglichkeiten und ist bei gut informierten Zielgruppen vorzuziehen; eine 10-Punkt-Skala (wie beim NPS) ist intuitiv, aber nicht klassisch “Likert”. Die Frage nach einer neutralen Mittelkategorie (ungerade Stufenzahl) ist ein häufig diskutiertes Design-Problem: Eine neutrale Mittelkategorie gibt ambivalenten Befragten die Möglichkeit, ihre echte Unentschlossenheit auszudrücken; ohne Mittelkategorie (gerade Stufenzahl, “Forced Choice”) werden Befragte zur Positionierung gezwungen, was bei genuiner Indifferenz zu Zufallsantworten führen kann. Acquiescence Bias (die Tendenz, unabhängig vom Inhalt eher zuzustimmen) und Extremantwortbias (Tendenz zu Extrempositionen, besonders in bestimmten Kulturen) sind bekannte Antworttendenzen, die durch abwechselnd positiv und negativ formulierte Items (reverse coding) und durch Ankerbalancierung kontrolliert werden können.
Design-Entscheidungen bei Likert-Skalen
- Stufenanzahl (5 vs. 7 vs. 10): 5-stufige Skalen sind kompakt und mobilfreundlich; 7-stufige Skalen bieten mehr Differenzierungsmöglichkeit für Konstrukte mit klarer Variabilität; 10-stufige Skalen (z. B. beim NPS) sind intuitiv, aber statistisch analog zu behandeln wie 7-Punkt-Skalen. Meta-Analysen zeigen keinen klaren Überlegenheitsvorteil einer Anzahl für Reliabilität.
- Verbale Beschriftung aller Stufen: Alle Skalenpunkte vollständig verbal zu beschriften (statt nur Endanker) erhöht die Intersubjektivität der Interpretation und reduziert Messunschärfe. Praxis: immer vollständige Ankerung verwenden.
- Skalenrichtung: Zustimmung von links nach rechts ist im westlichen Kulturraum standard (1 = Ablehnung, höchster Wert = Zustimmung). Konsistenz der Skalenrichtung im gesamten Fragebogen ist für die Antwortqualität entscheidend.
- Positive vs. negative Formulierung: Mischung positiv und negativ formulierter Items (Reversed Items) zur Kontrolle von Acquiescence Bias. Reversed Items müssen vor der Skalensummierung recodiert werden.
Gütekriterien für Likert-Skalen
- Reliabilität: Cronbachs Alpha misst die interne Konsistenz einer Skala aus mehreren Items; Werte ≥ 0,70 gelten als akzeptabel für Forschungszwecke, ≥ 0,80 für diagnostische Zwecke.
- Inhaltsvalidität: Die Items decken das zu messende Konstrukt inhaltlich vollständig ab (Expertenurteil, kognitive Interviews).
- Konstruktvalidität: Convergente Validität (die Skala korreliert hoch mit anderen Messungen desselben Konstrukts) und diskriminante Validität (niedrige Korrelation mit konzeptuell verschiedenen Konstrukten). Prüfung durch konfirmatorische Faktoranalyse (CFA).
Ausgewählte Referenzen
- Likert, R. (1932). A technique for the measurement of attitudes. Archives of Psychology, 22(140), 1–55.
- Krosnick, J. A. & Presser, S. (2010). Question and questionnaire design. In P. V. Marsden & J. D. Wright (Hrsg.), Handbook of Survey Research (2. Aufl., S. 263–314). Emerald.
- Revilla, M. A., Saris, W. E. & Krosnick, J. A. (2014). Choosing the number of categories in agree–disagree scales. Sociological Methods & Research, 43(1), 73–97.
- Norman, G. (2010). Likert scales, levels of measurement and the “laws” of statistics. Advances in Health Sciences Education, 15(5), 625–632.
- Porst, R. (2022). Fragebogen: Ein Arbeitsbuch (5. Aufl.). Springer VS.