Task-Completion-Rate
Definition: Die Task-Completion-Rate (auch: Aufgabenabschlussrate, Task-Success-Rate) ist eine UX-Metrik die den Prozentsatz der Nutzer angibt die eine vorgegebene Aufgabe in einem Usability-Test oder einer Produktanalyse erfolgreich abschließen können. Berechnungsformel: Task-Completion-Rate = (Anzahl erfolgreicher Abschlüsse / Gesamtzahl der Versuche) × 100; Beispiel: 14 von 20 Testteilnehmern schließen eine Aufgabe erfolgreich ab → 14/20 × 100 = 70% Task-Completion-Rate. Task-Completion-Kodierung: Binäre Kodierung (Standard): 1 = vollständiger Erfolg (Ziel ohne Hilfe erreicht); 0 = Misserfolg (Aufgabe nicht beendet oder falsch beendet); Einfach zu berechnen; gute statistische Basis; Dreiteilige Kodierung (erweitert): 1 = vollständiger Erfolg; 0,5 = partieller Erfolg (mit Hilfe oder Umweg aber Ziel erreicht); 0 = Misserfolg; differenzierter aber subjektiver; Vier-Punkte-Skala (ISO-CSUQ): erfolgreicher Abschluss / partieller Erfolg / Aufgabe abgebrochen / Aufgabe falsch abgeschlossen; am genauesten; erhöhter Codierungs-Aufwand. Task-Completion-Rate als ISO-9241-11-Effektivitäts-Metrik: ISO 9241-11 (2018) definiert Usability als Effektivität (Vollständigkeit und Genauigkeit der Zielerreichung), Effizienz (Aufwand für Zielerreichung) und Zufriedenheit (Komfort und Akzeptabilität); Task-Completion-Rate ist primäre Effektivitäts-Metrik; Time-on-Task ist primäre Effizienz-Metrik; SUS oder SEQ ist primäre Zufriedenheits-Metrik; vollständige Usability-Messung kombiniert alle drei.
Erläuterung
Tom Tullis (Fidelity Investments; Boston; MA; später Fidelity Center for Applied Technology; UX-Research-Veteran) und Bill Albert (Bentley University; Waltham; MA; Human Factors and Information Design) systematisierten UX-Metriken inkl. Task-Completion-Rate in «Measuring the User Experience: Collecting, Analyzing, and Presenting Usability Metrics» (Morgan Kaufmann; 2008; dritte Auflage 2023): das Buch definierte Task-Completion-Rate als fundamentale Output-Metrik für Usability-Tests und beschrieb erstmals systematisch Erhebungs- und Auswertungsmethoden für die Praxis; Tullis und Albert unterschieden zwischen binary success (1/0) und continuous metrics (Error Rate; Time-on-Task) und zeigten statistische Methoden für kleine Stichproben. Jeff Sauro (MeasuringU; Denver; CO; Statistiker und UX-Metriken-Experte; measuringu.com; «A Practical Guide to Measuring Usability», 2010; «Quantifying the User Experience», Morgan Kaufmann, 2012) analysierte 1.100 Usability-Tasks aus 138 Studien (publiziert 2011; measuringu.com/task-completion-benchmarks): durchschnittliche Task-Completion-Rate über alle Studien: 78%; Standardabweichung: 14 Prozentpunkte; 90th-Percentile (beste Produkte): ≥93%; 10th-Percentile: ≤55%; Implikation: unter 78% = unter Durchschnitt; unter 55% = deutliches Usability-Problem; über 90% = exzellente Usability für diese Aufgabe. Sauro identifizierte auch Task-spezifische Benchmarks: einfache Navigationsaufgaben (Find a phone number): median 89%; komplexe transaktionale Tasks (Complete checkout with promo code): median 62%; Aufgaben mit Formularausfüllung: median 71%; Erklärung: komplexere Tasks haben naturgemäß niedrigere Completion-Rates; Benchmarks müssen task-spezifisch verglichen werden. Nigel Bevan (National Physical Laboratory; Teddington; UK; ISO/IEC 25010-Beiträge; ISO 9241-11-Working-Group) führte Task-Completion-Rate als standardisierte Usability-Metrik in die ISO-Normen ein: ISO 9241-11 (erste Version 1998; Revision 2018) definiert Effektivität als primäre Usability-Dimension; Task-Completion-Rate ist die direkte Operationalisierung dieser Effektivitäts-Dimension; Bevan's MUSIC-Methode (Metrics for Usability Standards in Computing; 1993) war Vorläufer und kombinierte Task-Completion-Rate mit Time-on-Task und Fehleranalyse. Kerry Rodden (Google; Mountain View; CA), Hilary Hutchinson (Google) und Xin Fu (Google) entwickelten das HEART-Framework (Happiness, Engagement, Adoption, Retention, Task Success; Google Ventures/Google Research; 2010; publiziert in CHI 2010 «Measuring the User Experience on a Large Scale: User-Centered Metrics for Web Applications»): Task-Success-Metrik im HEART-Framework entspricht der Task-Completion-Rate für Produkt-Analytics; für groß angelegte Produkte misst Google Task Success durch Proxy-Metriken aus Analytics-Daten statt durch direkte Test-Beobachtung; Checkout-Completion-Rate; Form-Submission-Rate; Feature-Adoption-Rate als indirekte Task-Success-Indikatoren.
Erhebung und Auswertung der Task-Completion-Rate
- Aufgaben-Definition und Erfolgs-Kriterien: Aufgaben-Formulierung (TEDW-Prinzip: Task-based; Explicit goal; Defined success; Without navigation hints): gut: «Finden Sie den Preis für eine 1-Jahres-Mitgliedschaft und fügen Sie diese in den Warenkorb»; schlecht: «Gehen Sie zu Preisen und klicken Sie auf Jahresplan»; Erfolgs-Kriterien vorab definieren: was zählt als Erfolg? Nur Checkout-Abschluss? Oder auch: Artikel im Warenkorb? Richtiger Preis notiert? Erfolgs-Kriterien müssen beobachtbar und eindeutig sein; Moderatoren-Kalibrierung: alle Test-Moderatoren müssen dieselbe Kodierung (1/0/0,5) für dieselben Situationen verwenden; Pre-Test-Kalibrierungssession; Inter-Rater-Reliability messen (Cohen's Kappa; Ziel: κ > 0,8); Time-Limit als Abbruch-Kriterium: in moderierten Tests: Task wird als Misserfolg gewertet wenn Nutzer innerhalb des festgelegten Time-Limits nicht abschließt (typisch 3–5× erwartete Task-Zeit); in unmoderierten Tests: automatisches Abbruch nach Zeitlimit; Aufgaben-Reihenfolge: randomisieren für Between-Subjects-Design (verschiedene Nutzer für verschiedene Aufgaben); oder lateinisches Quadrat für Within-Subjects-Design (jeder Nutzer alle Aufgaben in verschiedener Reihenfolge)
- Statistische Auswertung und Konfidenzintervalle: Laplace-Korrektur für kleine Stichproben (Jeff Sauro; 2005; «Confidence Interval Calculator for a Completion Rate»): Standard-Binomial-Proportion-Konfidenzintervall bei kleinen n sehr breit und unzuverlässig; Laplace-Schätzer: (x + 1) / (n + 2) statt x/n; für n=5 Nutzer 4/5 Erfolge: Standard = 80%; Laplace-adjustiert = 5/7 = 71,4%; realistischerer Schätzer; adjustiertes Wald-Intervall als Alternative (Agresti-Coull; 1998): noch präziser für n < 20; Wilson-Score-Intervall: ebenfalls empfohlen für kleine n; praxisrelevante Konfidenzintervall-Logik: bei n=5 und 4/5 Erfolgen: 95%-Konfidenzintervall = 28% bis 99% (riesig!); bei n=20 und 16/20: 95%-KI = 56% bis 91%; bei n=50 und 40/50: 95%-KI = 66% bis 87%; Implikation: für statistisch verlässliche Aussagen mindestens n=20 pro Aufgabe; für Vergleiche zwischen Versionen (A/B): n=30+ pro Gruppe; Vorher/Nachher-Vergleich: McNemar-Test für gepaarte Binärdaten; Chi-Quadrat-Test für unabhängige Gruppen; Fisher-Exact-Test bei sehr kleinen n
- Analytics-basierte Task-Completion-Rate: Indirekte Task-Completion aus Analytics wenn direkte Beobachtung nicht möglich: Checkout-Completion-Rate = Bestellungen / Warenkorb-Starts; Form-Submission-Rate = Erfolgreiche Submits / Form-Starts; Onboarding-Completion = Abgeschlossene Aktivierungen / Signups; Google Analytics (Funnel-Visualization; GA4 Funnel-Exploration): zeigt Completion-Rate für jeden Funnel-Schritt; Mixpanel/Amplitude (San Francisco; CA): Event-basiertes Tracking für App-Flows; detailliertere Funnel-Analyse als GA; Unterschied zu Test-basierter TCR: Analytics-TCR misst alle Real-World-Nutzer (inkl. Nutzer die nicht motiviert sind die Aufgabe abzuschließen); Test-TCR misst motivated Representative-Nutzer mit klarer Aufgabe; Analytics-TCR ist meist niedriger; beide Messungen ergänzen sich; Baymard Institute (Baymard.com; Christian Holst/Jamie Appleseed; Kopenhagen; Dänemark): E-Commerce-Checkout-Benchmarks aus 50.000+ User-Test-Sessions; Checkout-Abandonment-Rate Industrie-Durchschnitt 70% (2023); damit Checkout-Completion-Rate nur 30%; zeigt wie weit Analytics-TCR von Test-TCR abweichen kann
Task-Completion-Rate im Kontext und Kombinations-Metriken
- Kombination mit Time-on-Task und Error-Rate: Vollständiges Usability-Metriken-Set: Task-Completion-Rate (Effektivität: wurde das Ziel erreicht?); Time-on-Task (Effizienz: wie lange hat es gedauert?); Error-Rate (Qualität: wie viele Fehler passiert?); SEQ/SUS (Zufriedenheit: wie hat sich die Aufgabe angefühlt?); Zusammenhänge: hohe Completion-Rate bei hoher Zeit → Effektiv aber ineffizient → Navigation funktioniert aber zu komplex; niedrige Completion-Rate bei kurzer Zeit → Nutzer brechen früh ab → Orientierungsverlust; hohe Completion-Rate bei hoher Error-Rate → Nutzer finden trotz Fehlern zum Ziel → Error-Recovery-Design funktioniert; Efficiency-Metrik: Zeit/Completion-Rate = Effizienz-Verhältnis; oder: nur Zeit erfolgreicher Tasks (excludiert gescheiterte Nutzer); HEART-Metrik Task-Success-Rate: kombiniert in Google's HEART-Framework mit Engagement-Metriken; Goal-Signal-Metric-Struktur: Goal «Nutzer können Kern-Aufgaben abschließen» → Signal «Task-Completion in Usability-Tests» → Metric «TCR ≥ 85% für Top-5-Tasks»