Sleak
Mitarbeiterentwicklung

Philipp Heideker15. September 202614 Min. Lesezeit

Was ist eine Scorecard? Aufbau und Grenzen

Eine Scorecard im Training ist eine Bewertungsrubrik für ein einzelnes Gespräch: benannte Kriterien, beschriebene Stufen, Beleg aus dem Transkript.

Was ist eine Scorecard? Aufbau und Grenzen

TL;DR. Eine Scorecard im Training ist eine Bewertungsrubrik, die vorab festlegt, woran ein gutes Gespräch zu erkennen ist: an einzelnen Kriterien, klar beschriebenen Stufen und Belegen aus dem Transkript. Dadurch wird Feedback nachvollziehbar und weniger abhängig von der Tagesform einer Führungskraft. Gemeint ist weder die Balanced Scorecard aus der Strategiesteuerung noch die Scorecard aus dem Recruiting, auch wenn man bei der deutschen Suche meist zuerst auf diese beiden Varianten stößt. Die Methode hat eine klare Grenze: Sie bewertet, was gesagt wurde, nicht, ob ein Geschäft zustande kam. Dieser Beitrag erklärt den Aufbau, die Stufen, die Zuständigkeit und typische Fehler.

Key Takeaways

  • Eine Scorecard besteht aus drei Teilen: benannte Kriterien, beschriebene Stufen pro Kriterium und ein Beleg aus dem Transkript für jede Bewertung.
  • Der Begriff ist im Deutschen dreifach belegt. Balanced Scorecard steuert Strategiekennzahlen, die Recruiting-Scorecard bewertet Bewerber, die Scorecard im Training bewertet eine einzelne Gesprächsleistung.
  • Verhalten wird häufiger gemessen als behauptet, aber überwiegend erfragt: 54 Prozent der Organisationen evaluieren auf Kirkpatrick-Ebene 3 (ATD 2019, n = 779), und Will Thalheimer schätzt, dass weit über 80 Prozent der Transferstudien statt des Verhaltens die Selbsteinschätzung der Lernenden erheben (Thalheimer, 2020).
  • Auf der Plattform von Sleak sind über 2.200 Scorecards angelegt, gegen die mehr als 1,9 Millionen einzelne Kriterienbewertungen erzeugt wurden. Bewertet wird pro Kriterium, nicht als Gesamtnote.
  • Belegt ist die Wirkung der Übung dahinter: In der Transferstudie bei Schwäbisch Hall erreichte die Gruppe mit zwei Übungsgesprächen 72,5 Prozent Handlungskompetenz gegenüber 61,4 Prozent in der Kontrollgruppe (p = 0,036).

Zwei Führungskräfte hören dasselbe Verkaufsgespräch. Die eine findet es souverän, die andere zu weich. Beide haben ihre Gründe, doch keine kann genau sagen, an welchem Satz sie ihr Urteil festmacht. Im Eiskunstlauf wäre das undenkbar: Dort steht der Maßstab vor dem Wettkampf fest, und jede Wertung bezieht sich auf ein Element, das sich im Protokoll nachlesen lässt. In der Mitarbeiterentwicklung fehlt ein solcher Maßstab häufig. Nicht aus Nachlässigkeit, sondern weil niemand festgehalten hat, woran ein gutes Gespräch eigentlich zu erkennen ist.

Diese Lücke schließt die Scorecard. Zunächst klärt dieser Beitrag, was mit dem Begriff gemeint ist, denn im Deutschen bezeichnet er drei verschiedene Instrumente. Anschließend geht es um den Aufbau, um beschriebene statt nur nummerierte Stufen, um die Zuständigkeit und um den Einsatz außerhalb des Vertriebs. Zum Schluss folgt die Frage, was eine Scorecard nicht leisten kann. Gerade diese Grenzen entscheiden darüber, wofür sich das Instrument eignet.

Was ist eine Scorecard im Training?

Eine Scorecard im Training ist eine Bewertungsrubrik, die vorab festlegt, woran ein gutes Gespräch erkennbar ist: einzelne Kriterien, klare Stufen pro Kriterium und ein Beleg aus dem Transkript. Sie macht Feedback wiederholbar und unabhängig davon, welche Führungskraft gerade zugehört hat. Alle drei Bestandteile sind dafür notwendig.

Eine Scorecard besteht aus drei Teilen. Erstens aus den Kriterien, auf die es bei diesem Gesprächstyp ankommt, etwa Bedarfsklärung, der Umgang mit Widerspruch oder ein verbindlicher Abschluss. Zweitens aus den Stufen. Für jedes Kriterium wird beschrieben, wie eine vollständige, eine teilweise oder eine fehlende Erfüllung aussieht. Drittens aus der Belegpflicht: Jede Bewertung verweist auf eine konkrete Stelle im Gespräch. Ohne diesen Beleg bleibt sie eine Meinung mit einer Zahl davor. Ohne beschriebene Stufen verschiebt sich der Maßstab mit jeder Person, die bewertet.

Bei Sleak heißt dieses Artefakt Scorecard oder Standard of Excellence. Es ist der Maßstab, gegen den ein Übungsgespräch ausgewertet wird: Nach einem sprachbasierten KI-Rollenspiel liefert der AI Coach, also die jederzeit verfügbare Coaching-Instanz, mit der jede Person spricht, eine Bewertung pro Kriterium, mit Belegzitat aus dem Transkript statt mit pauschalem Lob. Die Scorecards selbst sind versioniert, es existieren also ein Entwurf und veröffentlichte Stände, und 18 fertige Vorlagen decken verbreitete Gesprächstypen ab.

Balanced Scorecard, Recruiting-Scorecard oder Bewertungsrubrik: was ist gemeint?

Im deutschen Sprachraum bezeichnet Scorecard drei verschiedene Instrumente, und nur eines davon bewertet ein einzelnes Gespräch. Wer den Begriff sucht, landet zuerst bei der Balanced Scorecard aus der Strategiesteuerung oder bei Vorlagen für die Bewerberauswahl. Beides ist etabliert, und beides beantwortet eine andere Frage.

Balanced ScorecardRecruiting-ScorecardScorecard im Training
Bewertungsgegenstanddie Organisationeine Person als Kandidateine einzelne Gesprächsleistung
Zeitpunktquartalsweiseeinmal pro Auswahlprozessnach jedem Übungsgespräch
Typischer InhaltKennzahlen aus vier PerspektivenAnforderungen und EignungsurteilKriterien mit beschriebenen Stufen
Wozu die Bewertung dientSteuerungAuswahlentscheidungEntwicklung derselben Person
Wer sie liestGeschäftsführungHiring Managerdie übende Person selbst

Der wichtigste Unterschied steht in der letzten Zeile. Eine Recruiting-Scorecard vergleicht Menschen miteinander und führt zu einer Auswahlentscheidung. Eine Scorecard im Training vergleicht eine Person mit einem festgelegten Standard und zeigt, was sie beim nächsten Mal anders machen kann. Am ähnlichsten ist ihr die QA-Scorecard aus dem Kundenservice, denn auch sie bewertet einzelne Gespräche. In der Regel benennt sie jedoch nur Bewertungskategorien. Was eine bestimmte Stufe ausmacht und was als Beleg gilt, bleibt häufig offen.

Woraus besteht eine Scorecard?

Eine brauchbare Scorecard ordnet ihre Kriterien den Phasen des Gesprächs zu und beschreibt für jedes Kriterium, woran die Erfüllung erkennbar ist. Ohne Phasenbezug entsteht eine Liste von Tugenden, und Tugenden lassen sich nicht bewerten. Empathisch ist kein Kriterium. Hat den genannten Einwand aufgegriffen und mit einer Rückfrage geprüft, bevor eine Lösung angeboten wurde: das ist eines.

Die Kriterienzahl folgt aus derselben Logik. Sinnvoll ist, was eine Führungskraft im Gesprächsverlauf tatsächlich unterscheiden kann, nicht, was sich vollständig anhört. Eine Scorecard mit zwanzig Kriterien pro Phase erzeugt Bewertungen, die niemand mehr liest, und sie verwässert das Urteil, weil die drei entscheidenden Kriterien in der Masse untergehen. Die Praxis besteht daher aus wenigen Kriterien je Phase, dafür mit einer präzisen Beschreibung.

Die Belegpflicht ist der Teil, der eine Rubrik von einem Fragebogen trennt. Jede Bewertung nennt das Kriterium, den Wert und die Stelle im Transkript, an der das Urteil hängt. Damit wird sie überprüfbar, und die bewertete Person kann widersprechen. Das ist kein Detail der Darstellung, sondern die Voraussetzung dafür, dass aus einer Bewertung ein Gespräch werden kann statt einer Mitteilung.

Warum beschriebene Stufen statt einer Skala von 1 bis 10?

Eine Zahl ohne Beschreibung beseitigt die subjektive Einschätzung nicht. Wer auf einer Skala von 1 bis 10 eine 7 vergibt, hat noch keinen Maßstab geschaffen, der auch beim nächsten Gespräch gilt. Die 7 der einen Führungskraft kann für eine andere eine 5 sein. Begründen lässt sich das erst, wenn beide die Skala im Nachhinein definieren.

Verankerte Stufen lösen das, indem sie die Beschreibung vor die Zahl setzen. Für jedes Kriterium steht vorher fest, wie die volle Erfüllung aussieht und woran erkennbar ist, dass sie ausbleibt. Die Zahl ist danach nur noch die Kurzform dieser Beschreibung. Das ist auch der Grund, warum wenige klar beschriebene Stufen besser funktionieren als zehn feine Abstufungen: Je feiner die Skala, desto größer der Anteil daran, den niemand beschreiben kann.

Auf der Plattform von Sleak läuft die Bewertung auf einer Skala von 0 bis 100, und Gespräche lassen sich anschließend nach Score-Bereich filtern. Über alle bisher erzeugten Kriterienbewertungen hinweg, mehr als 1,9 Millionen an der Zahl, sind 0, 100 und 50 die drei häufigsten Einzelwerte und machen zusammen knapp 38 Prozent aus. Die Ankerpunkte werden also tatsächlich getroffen, ohne dass die Skala dazwischen leer bliebe. Wie aus dieser Bewertungslogik ein laufender Coaching-Rhythmus wird, ist eine eigene Frage und steht in den weiterführenden Beiträgen am Ende.

Wer schreibt die Scorecard?

Die Scorecard schreibt die Führungskraft, die für das Ergebnis geradesteht, nicht die Personalentwicklung und nicht der Anbieter. Das ist keine organisatorische Vorliebe, sondern folgt aus dem Zweck: Eine Rubrik legt fest, was in diesem Team als gut gilt. Diese Festlegung ist eine Führungsentscheidung.

In der Sleak-Logik heißt der Rahmen dafür Initiative, also ein von einer Führungskraft gesetztes Entwicklungsziel aus KNOW und DO. Die Führungskraft muss dafür nicht didaktisch ausgebildet sein. Sie muss benennen können, woran sie ein gutes Gespräch erkennt, und genau daran scheitern die meisten Einführungen: Nicht an der Technik, sondern an der Frage, ob eine Organisation ihre fünf wichtigsten Gespräche überhaupt beschreiben kann. In der Führungskräfteentwicklung ist diese Schreibarbeit deshalb der eigentliche Aufwand, und sie fällt genau einmal an.

Personalentwicklung und Anbieter haben trotzdem eine Rolle. Vorlagen liefern die Struktur, also welche Phasen ein Gesprächstyp hat und welche Kriterien üblich sind. Was in die Stufenbeschreibung kommt, entscheidet das Haus. Eine gekaufte Scorecard, die niemand im Haus angefasst hat, bewertet fremde Erwartungen.

Wie sieht eine Scorecard außerhalb des Vertriebs aus?

Der Aufbau bleibt gleich, die Kriterien ändern sich mit dem Gesprächstyp. Eine Scorecard ist kein Vertriebsinstrument, sie ist ein Instrument für jede wiederkehrende Gesprächssituation, über deren Qualität sich jemand ein Urteil bilden muss.

Im Einkauf bewertet eine Scorecard etwa, ob die eigene Zielgröße vor dem ersten Preisgespräch feststand, ob Zugeständnisse gegen Gegenleistungen getauscht wurden und ob das Ergebnis am Ende schriftlich zusammengefasst wurde. Wie das im Verhandlungstraining für Einkaufsteams aussieht, hängt dann nur noch an der Frage, welche Verhandlungslinie im Haus gilt. In der Führung geht es um andere Kriterien: ob die Beobachtung von der Bewertung getrennt wurde, ob die betroffene Person zu Wort kam, ob am Schluss eine überprüfbare Vereinbarung steht. Im Service sind es Deeskalation, Zusagenqualität und der Umgang mit Regeln, die dem Kundenwunsch widersprechen.

Auffällig ist, dass die Kriterien über Abteilungen hinweg ähnlich aufgebaut sind, obwohl die Inhalte nichts miteinander zu tun haben. Sie beschreiben immer eine beobachtbare Handlung im Gesprächsverlauf, nie eine Eigenschaft der Person. Das ist die eigentliche Übertragbarkeit der Methode, und sie ist der Grund, warum dieselbe Struktur in Vertrieb, Einkauf, Führung und Service funktioniert.

Wird Verhalten wirklich gemessen, oder nur erfragt?

Verhalten wird häufiger gemessen, als der Ruf der Branche vermuten lässt, aber es wird überwiegend erfragt statt beobachtet. Das ist die präzisere Version eines beliebten Vorwurfs, und sie ist unbequemer als das Original.

Kirkpatrick-EbeneAnteil der Organisationen
1 Reaktionrund 80 Prozent
2 Lernenrund 80 Prozent
3 Verhalten54 Prozent
4 Ergebnisse38 Prozent
5 ROI16 Prozent

Diese Zahlen stammen aus einer Erhebung der ATD unter 779 Fachleuten der Personalentwicklung (ATD, 2019). Mehr als die Hälfte der Organisationen evaluiert also auf Ebene 3. Der Haken steckt in der Methode: Level-3-Daten werden typischerweise über Folgebefragungen erhoben, das etablierte Vorgehen besteht darin, 25 bis 30 zufällig ausgewählte Teilnehmende frühestens 30 Tage nach dem Training selbst einschätzen zu lassen, wie viel sie anwenden (Training Industry, 2022). Will Thalheimer schätzt, dass weit über 80 Prozent der Transferstudien auf diese Weise nicht das Verhalten messen, sondern die Wahrnehmung der Lernenden davon (Thalheimer, 2020).

Wer selbst einschätzt, ob er sein Verhalten geändert hat, berichtet Zufriedenheit unter anderem Namen. Genau an dieser Stelle sitzt die Scorecard: ein vorab definierter Maßstab plus eine wiederholbare Bewertung derselben Handlung durch jemanden, der nicht die übende Person ist. Dass das den Unterschied macht, ist messbar. In der Transferstudie bei Schwäbisch Hall erreichte die Gruppe mit zwei Übungsgesprächen 72,5 Prozent Handlungskompetenz gegenüber 61,4 Prozent in der Kontrollgruppe (p = 0,036), bei vergleichbarem Ausgangswissen, und die Lücke zwischen Wissen und Anwenden sank von 32,9 auf 13,9 Prozent (p = 0,014). Gemessen wurde dabei die Übung gegen einen Maßstab, nicht der Maßstab allein.

Ist das nicht nur eine Checkliste mit einem besseren Namen?

Von einer Checkliste unterscheidet sich die Scorecard durch zwei Dinge: beschriebene Stufen und die Pflicht, eine Bewertung zu belegen. Der Einwand ist verständlich, denn viele Bewertungsbögen sind tatsächlich nur Checklisten mit einem anspruchsvolleren Namen. Eine Checkliste fragt, ob etwas vorkam. Eine Rubrik beschreibt, wie gut es umgesetzt wurde, und verlangt dafür einen Nachweis.

Praktisch ist der Unterschied an einem Kriterium sichtbar. Checkliste: Einwand behandelt, ja oder nein. Rubrik: volle Erfüllung, wenn der Einwand aufgegriffen, mit einer Rückfrage geprüft und erst danach beantwortet wurde. Halbe Erfüllung, wenn er beantwortet, aber nicht geprüft wurde. Keine Erfüllung, wenn er überhört oder überredet wurde. Dieselbe Situation, drei unterscheidbare Ergebnisse, und jedes davon an einer Stelle im Transkript festzumachen.

Für viele Zwecke ist eine Checkliste weiterhin das richtige Werkzeug. Bei Pflichtangaben, regulatorischen Hinweisen und allem, was entweder gesagt wurde oder nicht, wäre eine Stufenbeschreibung unnötiger Aufwand. Auch eine erfahrene Führungskraft, die einem Menschen seit zwei Jahren zuhört, nimmt Dinge wahr, die in keiner Rubrik stehen. Die Scorecard ersetzt dieses Urteil nicht. Sie sorgt aber dafür, dass es nicht die einzige Grundlage bleibt und eine Bewertung nicht jedes Mal bei null beginnt.

Was kann eine Scorecard nicht?

Eine Scorecard bewertet das Gesprächsverhalten gegen einen Standard, nicht den Geschäftserfolg des Gesprächs. Ein Gespräch kann sauber geführt sein und trotzdem nicht zum Abschluss führen, und ein schlecht geführtes Gespräch kann mit einem Auftrag enden. Wer die Scorecard als Umsatzprognose liest, hat das Instrument verwechselt.

Vier Fehler kommen regelmäßig vor. Erstens: Kriterien, die Eigenschaften beschreiben statt Handlungen, also empathisch statt hat nachgefragt. Zweitens: zu viele Kriterien, wodurch die entscheidenden untergehen. Drittens: Stufen, die nur aus Zahlen bestehen, womit der Maßstab wieder in den Köpfen liegt. Viertens, der folgenreichste: eine Scorecard, die das Falsche belohnt. Eine Rubrik übt mit hoher Zuverlässigkeit genau das ein, was sie bewertet, und das gilt auch dann, wenn die Kriterien an der Realität des Marktes vorbeigehen.

Dazu kommt eine Grenze der maschinellen Bewertung selbst. Bewertet wird der Gesprächstext, nicht Tonfall, Tempo oder Wirkung im Raum. In Sleaks Validierungsstudie zur Bewerberbeurteilung lag die Übereinstimmung einer rein transkriptbasierten KI-Bewertung mit dem gemittelten Urteil erfahrener, verblindeter Recruiter bei r = .63, und die KI bewertete dabei im Schnitt rund sieben Punkte auf der 100er-Skala großzügiger als die Menschen. Diese Studie hat Bewerbergespräche untersucht, nicht Übungsgespräche im Training; der Schluss auf die Trainingssituation ist eine Übertragung und kein Befund. Belastbar ist daraus nur der allgemeine Punkt: Die Rangfolge stimmt eng überein, das absolute Niveau nicht. Eine Scorecard sortiert zuverlässiger, als sie benotet.

Häufig gestellte Fragen

Was ist der Unterschied zwischen einer Scorecard und einem Feedbackbogen?

Ein Feedbackbogen sammelt Eindrücke nach dem Gespräch, eine Scorecard legt den Maßstab vorher fest. Der Bogen fragt, wie es war, die Scorecard prüft, ob definierte Kriterien erfüllt wurden, und verlangt für jede Bewertung einen Beleg. Deshalb lassen sich zwei Bewertungen mit derselben Scorecard vergleichen, zwei ausgefüllte Feedbackbögen dagegen nicht.

Wie viele Kriterien sollte eine Scorecard haben?

So viele, wie im Gesprächsverlauf tatsächlich unterscheidbar sind, und sie gehören den Phasen des Gesprächs zugeordnet. Wenige präzise beschriebene Kriterien je Phase führen zu Bewertungen, die gelesen und akzeptiert werden. Eine lange Liste erzeugt Vollständigkeit auf dem Papier und lässt die drei Kriterien untergehen, auf die es wirklich ankommt.

Wer legt die Kriterien fest?

Die Führungskraft, die für das Ergebnis verantwortlich ist. Vorlagen können die Struktur liefern, also Phasen und übliche Kriterien, aber die Stufenbeschreibung muss aus dem eigenen Haus kommen. Eine Scorecard, die niemand im Unternehmen angefasst hat, bewertet fremde Erwartungen.

Braucht jedes Gespräch eine eigene Scorecard?

Nein, jeder Gesprächstyp braucht eine. Ein Erstgespräch, eine Preisverhandlung und ein Kritikgespräch haben unterschiedliche Phasen und damit unterschiedliche Kriterien. Innerhalb eines Gesprächstyps bleibt die Scorecard dagegen konstant, denn genau daraus entsteht die Vergleichbarkeit über mehrere Durchläufe.

Wie lässt sich prüfen, ob die Bewertung fair ist?

Über das Verfahren, nicht über das Gefühl. Zwei Prüfungen reichen weit: dieselbe Aufnahme zweimal gegen dieselbe Scorecard bewerten lassen und die Ergebnisse vergleichen, und jede Bewertung daraufhin ansehen, ob der genannte Beleg die Stufe trägt. Wo kein Beleg steht, ist die Bewertung nicht prüfbar, unabhängig davon, ob ein Mensch oder eine Maschine sie vergeben hat.

Lässt sich eine Scorecard an eine Methodik wie SPIN, MEDDIC, SBI oder GROW binden?

Ja, und das ist der häufigste Anwendungsfall. Eine Methodik liefert die Phasen und oft auch die Begriffe, die Scorecard übersetzt sie in beobachtbare Handlungen mit Stufen. Ohne diese Übersetzung bleibt eine Methodik ein Schulungsinhalt, den alle nennen können und niemand nachweislich anwendet.


Weiterlesen

Weitere Artikel

Mehr zu Üben, Feedback und dem Besserwerden in den Gesprächen, an denen der Job wirklich hängt.

Mitarbeiterentwicklung

Üben ohne Publikum: Rollenspiele im Training

Rollenspiele im Training scheitern selten an der Methode. Sie scheitern daran, dass Sicherheit und Wiederholung im Seminarraum gegeneinander stehen.

Philipp Heideker11 Min. Lesezeit
Artikel lesen
Mitarbeiterentwicklung

Lerntransfer sichern: Vom Wissen zum Können

Lerntransfer sichern gelingt nicht mit Erinnerungsimpulsen, sondern mit einer geplanten Übungsphase. Was belegt ist, und was die Praxis auslässt.

Philipp Heideker11 Min. Lesezeit
Artikel lesen
Mitarbeiterentwicklung

Deliberate Practice im Unternehmen: Warum ein Training allein kein Verhalten verändert

Deliberate Practice bedeutet: eine reale Situation wiederholt üben, direktes Feedback bekommen und es im nächsten Versuch besser machen.

Philipp Heideker13 Min. Lesezeit
Artikel lesen