360-Grad-Feedback mit KI: 80 Prozent weniger Aufwand – aber zu welchem Risiko?

Was früher mehrere Workshops beanspruchte, erledigt KI heute in wenigen Minuten – vom Ordnen der Kompetenzen bis zum Entwurf des Fragebogens. Doch ungeprüfte Fragen können Führungskräfte falsch beurteilen – mit Folgen für Beförderung, Vergütung und Vertrauen. Eine Fallstudie zeigt, wo KI hilft, wo sie scheitert und was HR vor dem Einsatz prüfen muss.

Kopfgrafik


Was HR-Software beim 360-Grad-Feedback übernimmt – und was nicht

Kurz gesagt: HR-Software kann Befragungen organisieren, Antworten zusammenführen und Berichte erstellen. Sie kann aber nicht nachweisen, ob die verwendeten Fragen wirksame Führung erkennen.

Welche Aufgaben HR-Systeme automatisieren

Systeme wie SAP SuccessFactors, Workday, Oracle Fusion Cloud HCM und Qualtrics EmployeeXM übernehmen heute einen großen Teil der technischen Durchführung eines 360-Grad-Feedbacks. SAP SuccessFactors nennt beispielsweise 360-Grad-Beurteilungen, Leistungsbewertungen und Feedbackprozesse.

Je nach Produkt und Konfiguration können HR-Systeme:

  • Beurteilergruppen verwalten,
  • Einladungen und Erinnerungen versenden,
  • Zugänge und Fristen steuern,
  • Mindestgrößen für anonyme Gruppen berücksichtigen,
  • Antworten zusammenführen,
  • Berichte erstellen und
  • Ergebnisse für Feedbackgespräche aufbereiten.

Damit entfällt ein großer Teil der früheren Verwaltungsarbeit. Personalabteilungen müssen nicht mehr jede Einladung einzeln versenden, Rückläufe in Excel-Listen kontrollieren oder Bewertungen verschiedener Gruppen von Hand zusammenführen.

Warum die Software keine wirksame Führung erkennen kann

Die Software weiß nicht, welche Ergebnisse eine Führungskraft im konkreten Unternehmen erreichen soll. Sie kann auch nicht entscheiden, ob die Fragen jene Verhaltensweisen erfassen, die Mitarbeitende, Kollegen oder Kunden tatsächlich beobachten können.

Vor allem kann sie nicht belegen, ob hohe Bewertungen mit höherer Teamleistung, geringerer Fluktuation, besseren Entscheidungen oder zufriedeneren Kunden zusammenhängen. Dafür werden Antworten realer Beurteilender und konkrete Erfolgszahlen aus dem Unternehmen benötigt.

Auch ein übersichtlicher Bericht mit Balkendiagrammen und Vergleichswerten kann deshalb auf ungeprüften Fragen beruhen. Das technische System verteilt den Fragebogen und zählt die Antworten. Ob der Fragebogen erfolgreiche Führung erkennt, ist eine völlig andere Frage.


Warum Unternehmen in geprüfte Fragebögen investieren

Kurz gesagt: Ein ungeprüfter Fragebogen kann die falschen Führungskräfte loben und die entscheidenden Entwicklungsfelder übersehen. Unternehmen investieren deshalb nicht nur in gute Formulierungen, sondern in Fragen, die zur Führungsrolle, zu den Beurteilergruppen und zu den angestrebten Ergebnissen passen.

Welche Fragen vor der Entwicklung geklärt werden müssen

Ein hochwertiger Fragebogen besteht nicht einfach aus einer Liste vernünftig klingender Aussagen. Er soll Führungsverhalten so erfassen, dass die Ergebnisse verständlich, zuverlässig, fair und für konkrete Veränderungen nutzbar sind.

Vor der Formulierung der einzelnen Aussagen muss geklärt werden:

  • Welche Ergebnisse sollen die Führungskräfte erreichen?
  • Welche Verhaltensweisen tragen tatsächlich zu diesen Ergebnissen bei?
  • Welche Kompetenzen sind für die jeweilige Verantwortungsebene wichtig?
  • Was können Mitarbeitende, Kollegen und Vorgesetzte zuverlässig beobachten?
  • Welche Fragen eignen sich für welche Beurteilergruppe?
  • Woran soll später erkennbar sein, dass gute Bewertungen mit erfolgreicher Führung zusammenhängen?

Erst danach lassen sich passende Aussagen formulieren. Andernfalls entstehen Fragen, die zwar Zustimmung finden, aber weder zwischen unterschiedlich wirksamen Führungskräften unterscheiden noch konkrete Entwicklungsmaßnahmen ermöglichen.

Wie schnell Entwicklungskosten von 36.000 Euro entstehen

Unternehmen führen deshalb häufig mehrere Workshops mit Führungskräften, Personalverantwortlichen und externen Fachleuten durch. Ein einfaches Rechenbeispiel zeigt die Größenordnung:

4 Personen × 3 Arbeitstage × 3.000 Euro = 36.000 Euro

Die 3.000 Euro stehen dabei für einen externen Tagessatz oder einen internen Verrechnungssatz einschließlich Arbeitszeit und Projektkosten. Werden die Fragen anschließend mit Führungskräften und Beurteilenden getestet, statistisch untersucht und überarbeitet, kann der Gesamtaufwand deutlich höher liegen.

Diese Investition ist nicht automatisch übertrieben. Ein unternehmensspezifischer und geprüfter Fragebogen kann zeigen, welche Verhaltensweisen mit Teamleistung, Mitarbeiterbindung, Kundenzufriedenheit oder Zielerreichung zusammenhängen. Damit lassen sich Führungskräfte gezielter auswählen und entwickeln.

Der Wert liegt also nicht in einer möglichst langen Liste von Fragen. Er liegt in dem Wissen, welche Fragen erfolgreiche Führung tatsächlich von erfolgloser Führung unterscheiden. Genau dieses Wissen kann für ein Unternehmen einen Wettbewerbsvorteil darstellen.


Wo KI bis zu 80 Prozent Aufwand sparen kann

Kurz gesagt: KI kann einen großen Teil der redaktionellen und administrativen Arbeit in wenigen Minuten erledigen. Die Schätzung von bis zu 80 Prozent bezieht sich jedoch auf die Vorbereitung des Fragebogens – nicht auf den Nachweis, dass seine Fragen erfolgreiche Führung erkennen.

Welche Arbeiten KI vorbereiten oder beschleunigen kann

Der größte Zeitgewinn entsteht überall dort, wo Informationen geordnet, Texte formuliert und verschiedene Fassungen miteinander verglichen werden müssen. Die KI kann dabei in wenigen Minuten Vorschläge liefern, für die früher mehrere Besprechungen oder Arbeitstage notwendig waren.

Diese Aufgaben kann KI vorbereiten oder beschleunigen:

  • Führungsgrundsätze und vorhandene Kompetenzmodelle ordnen,
  • erste Kompetenzbeschreibungen entwerfen,
  • mehrere Formulierungsvarianten erstellen,
  • abstrakte Aussagen in beobachtbares Verhalten übersetzen,
  • Fragen mit der gemeinsamen Formulierung „Diese Person …“ vereinheitlichen,
  • Instruktionen und Antwortskalen vorbereiten,
  • ähnliche, doppelte oder unklare Fragen kennzeichnen,
  • Fragebögen für verschiedene Beurteilergruppen anpassen,
  • Einladungen, Erinnerungen und häufige Fragen formulieren,
  • Auswertungsregeln dokumentieren und
  • bereits vorhandene Befragungsdaten statistisch analysieren.

Damit kann KI die Vorbereitung von Workshops erheblich verkürzen. Statt jede Formulierung gemeinsam von Grund auf zu entwickeln, können Führungskräfte und HR-Verantwortliche bereits über konkrete Vorschläge diskutieren.

Warum 80 Prozent Zeitersparnis keine 80 Prozent Qualität bedeuten

Die Zahl von 80 Prozent ist kein allgemeingültiges Forschungsergebnis. Sie beschreibt eine mögliche Größenordnung aus praktischer Sicht. Wie groß die tatsächliche Ersparnis ausfällt, hängt von den vorhandenen Unterlagen, der Erfahrung der Beteiligten und dem Zweck des Fragebogens ab.

Vor allem darf die eingesparte Arbeitszeit nicht mit der Qualität des Ergebnisses verwechselt werden. Eine KI kann innerhalb weniger Minuten 30 professionell klingende Aussagen formulieren. Sie weiß deshalb aber noch nicht, ob Mitarbeitende diese Aussagen gleich verstehen, ob das beschriebene Verhalten beobachtbar ist oder ob fast alle Führungskräfte die Bestnote erhalten.

Ebenso wenig kann die KI ohne entsprechende Daten feststellen, ob hohe Bewertungen mit besseren Entscheidungen, höherer Teamleistung oder geringerer Fluktuation zusammenhängen. Dafür muss der Fragebogen von realen Personen beantwortet und anschließend ausgewertet werden.

Die Zeitersparnis betrifft somit vor allem die Herstellung des Entwurfs. Die Auswahl der entscheidenden Kompetenzen, die Erprobung der Fragen und die Prüfung anhand konkreter Führungsergebnisse bleiben notwendig.


Warum KI Original-Items und Erfolgsdaten fehlen

Kurz gesagt: Eine KI kennt häufig die Namen und Beschreibungen von Führungskompetenzen. Meistens fehlen ihr aber die geschützten Originalfragen, Auswertungsregeln und Unternehmensdaten, die zeigen, ob der Fragebogen erfolgreiche Führung tatsächlich erkennt.

Warum Original-Items und Prüfdaten selten im Internet stehen

Das Herzstück eines Fragebogens sind seine konkreten Aussagen – in der Fachsprache Items genannt. An ihnen entscheidet sich, ob eine Kompetenz nur allgemein beschrieben oder tatsächlich erfasst wird.

Bei der Entwicklung von Instrumenten wie dem Berufsbezogenen Persönlichkeitstest, dem Gießener Inventar der Umsetzungskompetenz oder dem Gießener Inventar der Transformationalen Führung entsteht der größte Wert nicht durch die Namen der Kompetenzen. Begriffe wie „Empathie“, „Delegation“ oder „Umsetzungskompetenz“ kann jede KI nennen.

Entscheidend sind Informationen, die meistens nicht vollständig öffentlich zugänglich sind:

  • die erprobten Original-Items,
  • ihre Zuordnung zu den einzelnen Kompetenzen,
  • die Auswertungsregeln,
  • statistische Kennzahlen zur Qualität der Fragen,
  • Norm- und Vergleichswerte,
  • die im Entwicklungsprozess verworfenen Aussagen,
  • Zusammenhänge mit Teamleistung, Fluktuation oder Zielerreichung und
  • Erfahrungen aus der praktischen Anwendung.

Auf diese Informationen haben allgemeine KI-Systeme in der Regel keinen vollständigen Zugriff. Sie finden möglicherweise den Namen eines Verfahrens, die bezeichneten Kompetenzen und zusammengefasste Forschungsergebnisse. Damit kennen sie aber noch lange nicht den eigentlichen Fragebogen.

Original-Items und Auswertungsregeln sind häufig durch Urheberrecht, Lizenzbedingungen oder Verträge geschützt. Auch wissenschaftliche Fachartikel enthalten nicht automatisch den vollständigen kommerziell nutzbaren Fragebogen. Noch weniger öffentlich zugänglich sind Antworten realer Beurteilender, interne Vergleichswerte und Erfahrungen aus Unternehmen.

Es wäre unrealistisch anzunehmen, ein Unternehmen investiere beispielsweise 100.000 Euro in die Entwicklung und Prüfung eines Fragebogens und stelle anschließend die Fragen, Auswertungsregeln und Vergleichsdaten kostenlos ins Internet. Gerade dieses Wissen soll helfen, Führungskräfte besser auszuwählen und zu entwickeln als die Konkurrenz.

Eine KI kann einen solchen Fragebogen deshalb bestenfalls aus öffentlich zugänglichen Beschreibungen und einzelnen Textstellen rekonstruieren. Diese Rekonstruktion kann professionell klingen. Sie ist aber nicht mit dem geprüften Original gleichzusetzen.

Welche Daten KI für einen guten Fragebogen bräuchte

Die Grenze liegt nicht grundsätzlich in der Leistungsfähigkeit der KI, sondern in ihrer Datenbasis. Das dahinterliegende Prinzip heißt GIGO: Garbage in, garbage out. Aus allgemeinen Beschreibungen, populären Führungsmodellen und einzelnen Fundstellen kann keine KI einen nachweislich hochwertigen Fragebogen zaubern.

Das lässt sich mit der Medizin vergleichen: Ein KI-System kann Ärzte bei Diagnose- oder Therapieentscheidungen unterstützen, wenn es mit zahlreichen hochwertigen Patientendaten arbeiten kann. Dazu gehören Anamnesen, Diagnosen, Behandlungen, Krankheitsverläufe und Erfolgskontrollen.

Für ein 360-Grad-Feedback wäre eine vergleichbare Datenbasis notwendig.

Die KI müsste unter anderem Zugriff haben auf:

  • die tatsächlich verwendeten Fragen,
  • die Antworten von Mitarbeitenden, Kollegen und Vorgesetzten,
  • die Position und Verantwortung der beurteilten Führungskraft,
  • relevante Bedingungen im Unternehmen,
  • spätere Veränderungen des Führungsverhaltens und
  • konkrete Ergebnisse wie Teamleistung, Mitarbeiterbindung, Kundenzufriedenheit oder Zielerreichung.

Ohne diese Daten kann die KI prüfen, ob eine Frage verständlich formuliert ist, nur ein Thema behandelt und beobachtbares Verhalten beschreibt. Sie kann aber nicht feststellen, ob hohe Bewertungen tatsächlich mit erfolgreicher Führung zusammenhängen.

KI kann also einen hervorragenden Fragebogen entwickeln – aber nur, wenn man ihr die dafür notwendigen hochwertigen und rechtmäßig nutzbaren Daten zur Verfügung stellt.


Was KI an einem Fragebogen prüfen kann – und was nicht

Kurz gesagt: KI kann unklare, abstrakte oder doppelte Fragen erkennen und bessere Formulierungen vorschlagen. Ohne Antworten realer Beurteilender kann sie aber nicht feststellen, ob die Fragen zwischen unterschiedlich wirksamen Führungskräften unterscheiden.

Was KI an der Formulierung erkennen kann

Eine KI erkennt meistens, dass die Aussage „Diese Führungskraft kommuniziert offen“ zu allgemein ist. Sie kann daraus eine konkretere Frage machen:

„Diese Person erläutert die Gründe für wichtige Entscheidungen.“

Die neue Formulierung beschreibt ein konkreteres und eher beobachtbares Verhalten. Die KI kann außerdem prüfen, ob die Aussage verständlich ist, nur ein Thema behandelt und zur verwendeten Antwortskala passt.

Trotzdem ist damit noch nicht bewiesen, dass die Frage brauchbare Ergebnisse liefert. Mitarbeitende, Kollegen und Vorgesetzte könnten die Aussage unterschiedlich verstehen oder das beschriebene Verhalten nicht gleich häufig beobachten.

Auch eine Aussage wie „Diese Person behandelt andere respektvoll“ klingt sinnvoll. Wenn jedoch fast alle Führungskräfte dafür die Bestnote erhalten, macht die Frage keine Unterschiede sichtbar. Ob ein solcher Deckeneffekt entsteht, zeigt erst die Auswertung realer Antworten.

Was nur Antworten und Erfolgszahlen zeigen

Eine KI kann mehrere Aussagen unter einer Überschrift wie „Delegation und Empowerment“ zusammenfassen. Die Überschrift beweist jedoch nicht, dass diese Fragen tatsächlich dieselbe Kompetenz erfassen.

Einige Aussagen könnten hauptsächlich Vertrauen messen, andere Kommunikation, Verantwortungsbereitschaft oder Kontrolle. Auch fast gleichlautende Fragen sind problematisch: Sie erzeugen möglicherweise sehr ähnliche Antworten und damit einen hohen Zuverlässigkeitswert, wiederholen aber lediglich denselben Gedanken.

Erst reale Befragungsdaten beantworten folgende Fragen:

  • Verstehen verschiedene Beurteilergruppen die Aussagen gleich?
  • Können sie das beschriebene Verhalten tatsächlich beobachten?
  • Erhalten fast alle Führungskräfte sehr hohe oder sehr niedrige Werte?
  • Messen die zusammengefassten Fragen wirklich dieselbe Kompetenz?
  • Unterscheiden die Fragen zwischen stärker und schwächer ausgeprägtem Führungsverhalten?
  • Hängen hohe Bewertungen mit Teamleistung, Mitarbeiterbindung oder Zielerreichung zusammen?

Der letzte Punkt betrifft die Kriteriumsvalidität. Soll eine Skala beispielsweise Delegation und Empowerment erfassen, müsste geprüft werden, ob hohe Werte tatsächlich mit selbstständigeren Mitarbeitenden, mehr Verantwortungsübernahme, besseren Entscheidungen oder einer Entlastung der Führungskraft einhergehen.

Eine KI kann erklären, warum Delegation wichtig sein könnte. Ohne Befragungs- und Erfolgsdaten kann sie aber nicht nachweisen, ob ihre Fragen wirksame Delegation erkennen.


Welche 14 Gütekriterien HR prüfen sollte

Kurz gesagt: Gut formulierte Fragen sind noch kein Beweis für einen guten Fragebogen. Erst die 14 Gütekriterien zeigen, was bereits geprüft wurde – und welche wichtigen Nachweise noch fehlen.

Die wichtigsten Prüfkriterien

Für die Qualität eines 360-Grad-Feedback-Fragebogens sind insbesondere folgende Kriterien wichtig:

Die 14 Gütekriterien im Überblick

  1. Inhaltsvalidität
  2. Verständlichkeit und Beobachtbarkeit
  3. Konstruktvalidität
  4. Faktorielle Validität
  5. Reliabilität
  6. Trennschärfe der Items
  7. Kriteriumsvalidität
  8. Objektivität
  9. Differenzierungsfähigkeit sowie Decken- und Bodeneffekte
  10. Qualität der Beurteilergruppen
  11. Vergleichbarkeit der Beurteilergruppen
  12. Schutz vor Urteilsverzerrungen
  13. Fairness und Akzeptanz
  14. Praktischer Entwicklungsnutzen

Die DIN 33430 bezieht sich unmittelbar auf die berufsbezogene Eignungsdiagnostik und nicht speziell auf jedes entwicklungsorientierte 360-Grad-Feedback. Ihre Grundgedanken zur Qualität von Verfahren, ihrer Anwendung und der Qualifikation der Beteiligten sind dennoch hilfreich.

Werden die Ergebnisse für Auswahl, Beförderung, Vergütung oder andere wichtige Personalentscheidungen verwendet, steigen die Anforderungen erheblich.

Das entscheidende Kriterium: Erkennt der Fragebogen wirksame Führung?

Die Kriteriumsvalidität beantwortet die wichtigste Frage: Erzielen Führungskräfte mit hohen Bewertungen tatsächlich bessere Ergebnisse?

Wenn eine Skala beispielsweise Delegation und Verantwortung messen soll, müsste geprüft werden, ob hohe Werte tatsächlich mit größerer Selbstständigkeit der Mitarbeitenden, besseren Entscheidungen, höherer Teamleistung oder einer Entlastung der Führungskraft ohne Kontrollverlust zusammenhängen.

Ohne solche Erfolgsdaten kann eine KI lediglich vermuten, dass ihre Fragen sinnvoll sind. Sie kann aber nicht nachweisen, dass der Fragebogen wirksame Führung erkennt.

Die Hintergründe zu den einzelnen Kriterien finden Sie auf der Seite Gütekriterien für 360-Grad-Feedback-Fragebögen .

Checkliste für die Prüfung Ihres Fragebogens

Mit der Checkliste können Sie dokumentieren, welche Qualitätskriterien nachgewiesen wurden und an welchen Stellen lediglich plausible Behauptungen vorliegen.

Checkliste mit 14 Gütekriterien herunterladen (PDF)


Fallstudie: Kann KI den eigenen Fragebogen prüfen?

Kurz gesagt: Die KI erstellte 24 professionell klingende Fragen. Bei der anschließenden Prüfung konnte sie jedoch kein einziges der 14 Gütekriterien vollständig nachweisen.

Der Versuch: Erst erstellen, dann streng prüfen

Für diese Fallstudie wurde eine KI zunächst beauftragt, aus ihrem allgemeinen Wissen einen Fragebogen für ein 360-Grad-Feedback zu entwickeln. Sie hatte keinen Zugriff auf geschützte Original-Items oder auf Validierungsdaten bereits geprüfter Instrumente.

Das Ergebnis war ein Fragebogen mit 24 Aussagen aus sechs Bereichen:

Die sechs Bereiche des KI-Fragebogens

  • Ziele und Entscheidungen
  • Kommunikation und Beteiligung
  • Delegation und Verantwortung
  • Feedback und Entwicklung
  • Zusammenarbeit und Konfliktklärung
  • Veränderung und Lernen

Die Aussagen wirkten auf den ersten Blick professionell. Drei Beispiele:

  • Diese Person macht deutlich, welche Aufgaben Vorrang haben.
  • Diese Person fragt vor wichtigen Entscheidungen nach abweichenden Einschätzungen.
  • Diese Person unterstützt bei Hindernissen, ohne die Aufgabe sofort wieder an sich zu ziehen.

Anschließend musste die KI ihren eigenen Fragebogen anhand der oben verlinkten Checkliste prüfen. Dabei galt eine strenge Beweisregel:

Die Beweisregel: Ein Kriterium darf nur dann als erfüllt gelten, wenn dafür ein konkreter Nachweis vorliegt. Verständliche oder plausible Formulierungen zählen nicht als Nachweis. Fehlen reale Befragungsdaten oder statistische Untersuchungen, muss das Kriterium als „noch nicht geprüft“ beziehungsweise „nicht nachgewiesen“ bewertet werden.

Das Ergebnis: Kein Gütekriterium vollständig nachgewiesen

Ergebnis der KI-Selbstprüfung

  • 0 Kriterien vollständig erfüllt
  • 5 Kriterien teilweise erfüllt
  • 8 Kriterien noch nicht geprüft
  • Kriteriumsvalidität nicht nachgewiesen

Teilweise beurteilen konnte die KI nur Kriterien, die bereits am Text erkennbar waren. Dazu gehörten die Verständlichkeit der Aussagen, die grundsätzliche Beobachtbarkeit des Verhaltens und eine einheitliche Formulierung.

Nicht nachweisen konnte sie dagegen, ob die Kompetenzbereiche tatsächlich existieren, ob die Aussagen zuverlässig messen, ob sie zwischen unterschiedlich wirksamen Führungskräften unterscheiden und ob hohe Bewertungen mit besseren Ergebnissen zusammenhängen.

Der Versuch zeigt den entscheidenden Unterschied: Die KI konnte einen überzeugend wirkenden Fragebogen erstellen. Sie konnte auch benennen, welche Nachweise fehlen. Die fehlenden Nachweise konnte sie jedoch nicht selbst erzeugen.

So führen Sie den Selbsttest durch

Lassen Sie eine KI zunächst einen Fragebogen für Ihr 360-Grad-Feedback erstellen. Laden Sie danach die oben angebotene Checkliste als PDF in die KI-Anwendung hoch und geben Sie folgende Anweisung ein:

Prüfanweisung für die KI

Prüfe den von dir erstellten Fragebogen anhand der hochgeladenen Checkliste. Bewerte ein Kriterium nicht allein deshalb als erfüllt, weil die Aussagen verständlich oder plausibel klingen. Nenne für jedes Urteil den konkreten Nachweis. Wenn Daten aus realen Befragungen oder statistische Untersuchungen fehlen, markiere das Kriterium als „noch nicht geprüft“ beziehungsweise „nicht nachgewiesen“. Unterscheide ausdrücklich zwischen einer formalen Prüfung der Formulierungen und einem Nachweis der tatsächlichen Qualität des Fragebogens.

Die Übung ersetzt keine Validierung. Sie schützt aber davor, einen professionell formulierten Entwurf vorschnell für ein zuverlässiges Messinstrument zu halten.

Fallstudie mit Fragebogen und Prüfergebnis

Die vollständige Fallstudie enthält den KI-generierten Fragebogen, die Prüfanweisung und das Ergebnis der Prüfung anhand der 14 Gütekriterien.

Fallstudie zum KI-Fragebogen herunterladen (PDF)


Wofür HR KI verantwortbar einsetzen kann

Kurz gesagt: KI eignet sich als Assistentin für Vorbereitung, Formulierung und Analyse. Sie sollte aber nicht allein entscheiden, welche Kompetenzen wichtig sind oder ob ein Fragebogen für Beförderungen, Vergütung und andere Karriereentscheidungen geeignet ist.

Bei diesen Aufgaben kann KI sinnvoll helfen

Richtig eingesetzt spart KI viel Zeit und macht Schwächen eines ersten Entwurfs schneller sichtbar. Ihre Vorschläge sollten dabei als Arbeitsgrundlage und nicht als geprüfte Lösung verstanden werden.

KI kann HR insbesondere dabei unterstützen:

  • unklare oder abstrakte Begriffe zu finden,
  • doppelte und sehr ähnliche Fragen zu kennzeichnen,
  • alternative Formulierungen vorzuschlagen,
  • Aussagen sprachlich zu vereinheitlichen,
  • beobachtbares Verhalten konkreter zu beschreiben,
  • mögliche Kompetenzbereiche zu strukturieren,
  • einen Pilotfragebogen vorzubereiten,
  • Einladungen, Erinnerungen und Erläuterungen zu formulieren,
  • vorhandene Befragungsdaten schneller auszuwerten und
  • offene Prüfschritte systematisch zu dokumentieren.

Besonders nützlich ist KI, wenn bereits hochwertige Daten vorhanden sind. Sie kann dann beispielsweise Trennschärfen berechnen, auffällige Fragen kennzeichnen, Unterschiede zwischen Beurteilergruppen untersuchen und Ergebnisse für einen Bericht aufbereiten.

Dabei gilt: Die KI liefert Vorschläge, Berechnungen und Hypothesen. Die Verantwortung für die Auswahl der Kompetenzen, die Interpretation der Ergebnisse und die daraus abgeleiteten Maßnahmen bleibt beim Unternehmen.

Wann HR besonders vorsichtig sein muss

Je stärker ein Ergebnis in die Karriere einer Person eingreift, desto höher müssen die Anforderungen an den Fragebogen sein. Besondere Vorsicht ist notwendig, wenn die Bewertungen Einfluss haben auf:

  • Auswahlentscheidungen,
  • Beförderungen,
  • Vergütung oder Bonuszahlungen,
  • Potenzialbewertungen,
  • die Aufnahme in einen Talentpool oder
  • die weitere berufliche Entwicklung.

In solchen Fällen genügt es nicht, dass die Fragen verständlich klingen und von den Beteiligten akzeptiert werden. Das Unternehmen muss zeigen können, dass die Fragen zuverlässig messen, keine Gruppen systematisch benachteiligen und mit relevanten Ergebnissen der Führung zusammenhängen.

Ein ungeprüfter KI-Fragebogen kann für ein freiwilliges Pilotprojekt als Ausgangspunkt dienen. Für Beförderungen, Vergütung oder andere folgenreiche Entscheidungen darf er nicht alleinige Grundlage sein.


Wofür HR KI verantwortbar einsetzen kann

Kurz gesagt: KI kann HR bei der Vorbereitung, Formulierung und Auswertung unterstützen. Sie sollte aber nicht darüber entscheiden, welche Kompetenzen wichtig sind oder ob ein ungeprüfter Fragebogen für Beförderungen und Vergütungsentscheidungen geeignet ist.

Diese Arbeiten kann KI sinnvoll übernehmen

KI eignet sich besonders für Aufgaben, bei denen Texte geordnet, verglichen, vereinheitlicht oder für unterschiedliche Zielgruppen angepasst werden müssen.

Sinnvolle Einsatzmöglichkeiten

  • unklare und abstrakte Begriffe kennzeichnen,
  • doppelte oder sehr ähnliche Fragen finden,
  • Formulierungsvarianten vorschlagen,
  • Aussagen sprachlich vereinheitlichen,
  • abstrakte Begriffe in beobachtbares Verhalten übersetzen,
  • mögliche Kompetenzbereiche strukturieren,
  • einen Pilotfragebogen vorbereiten,
  • Fragen an verschiedene Beurteilergruppen anpassen,
  • Einladungen, Erinnerungen und Erläuterungen formulieren,
  • vorhandene Befragungsdaten statistisch auswerten und
  • offene Prüfungen und fehlende Nachweise dokumentieren.

Auf diese Weise kann KI einen erheblichen Teil der redaktionellen und administrativen Arbeit beschleunigen. Sie liefert dabei Vorschläge und Hypothesen – noch keine Beweise für die Qualität des Fragebogens.

Bei Personalentscheidungen wird ein ungeprüfter Fragebogen zum Risiko

Besondere Vorsicht ist geboten, wenn die Ergebnisse nicht nur der persönlichen Entwicklung dienen, sondern Einfluss auf die berufliche Zukunft einer Person haben.

Folgenreiche Entscheidungen sind beispielsweise:

  • Auswahl einer Führungskraft,
  • Beförderung in eine höhere Position,
  • variable Vergütung oder Bonuszahlungen,
  • Potenzial- und Leistungsbewertungen,
  • Aufnahme in einen Talentpool sowie
  • Entscheidungen über die weitere Karriere.

In solchen Fällen genügt es nicht, dass die Fragen vernünftig klingen und von den Beteiligten akzeptiert werden. Es muss nachvollziehbar belegt sein, dass der Fragebogen zuverlässig misst, faire Ergebnisse liefert und tatsächlich zwischen unterschiedlich wirksamen Führungskräften unterscheiden kann.

Ein ungeprüfter KI-Fragebogen kann für ein freiwilliges Pilotprojekt als Ausgangspunkt dienen. Für Beförderungen, Vergütung oder andere folgenreiche Entscheidungen darf er nicht alleinige Grundlage sein.


Wie aus einem KI-Entwurf ein geprüfter Fragebogen wird

Kurz gesagt: Ein KI-Entwurf wird erst dann zu einem brauchbaren Fragebogen, wenn Menschen die Inhalte geprüft, reale Beurteilende die Fragen beantwortet und statistische Analysen die Qualität bestätigt haben.

Sieben Schritte vom Entwurf zum geprüften Instrument

Ein verantwortbarer Entwicklungsprozess besteht aus sieben Schritten:

  1. Zweck klären: Soll das Feedback ausschließlich der persönlichen Entwicklung dienen oder auch Beförderungen, Vergütung und andere Personalentscheidungen beeinflussen?
  2. Anforderungen analysieren: Welche Ergebnisse soll die Führungskraft erreichen? Welche Kompetenzen und beobachtbaren Verhaltensweisen sind dafür tatsächlich notwendig?
  3. Vorhandene Qualität nutzen: Bereits geprüfte und rechtmäßig lizenzierte Items sollten nicht ohne Grund durch frei erfundene KI-Aussagen ersetzt werden.
  4. KI für den Entwurf einsetzen: Die KI kann Varianten erstellen, Formulierungen vereinheitlichen, abstrakte Begriffe kennzeichnen und offensichtliche Doppelungen finden.
  5. Mit Betroffenen testen: Führungskräfte und Beurteilende sollten erklären, wie sie die Aussagen verstehen und ob sie das beschriebene Verhalten tatsächlich beobachten können.
  6. Mit realen Antworten prüfen: Untersucht werden müssen unter anderem Reliabilität, Trennschärfe, Faktorstruktur, Decken- und Bodeneffekte sowie Unterschiede zwischen den Beurteilergruppen.
  7. Erfolgskriterien einbeziehen: Entscheidend ist, ob gute Bewertungen tatsächlich mit relevanten Ergebnissen wie Teamleistung, Mitarbeiterbindung, Zielerreichung oder Kundenzufriedenheit zusammenhängen.

Die KI kann analysieren – die Daten müssen aus der Praxis kommen

Liegen ausreichend viele und qualitativ brauchbare Daten vor, kann KI auch bei anspruchsvollen statistischen Analysen helfen. Sie kann beispielsweise schwache Fragen kennzeichnen, Zusammenhänge berechnen, auffällige Antwortverteilungen erkennen und Ergebnisse dokumentieren.

Die dafür notwendigen Antworten und Erfolgskriterien kann sie jedoch nicht erfinden. Sie müssen aus realen Befragungen und aus der tatsächlichen Arbeit der beurteilten Führungskräfte stammen.

Der entscheidende Unterschied: Ein KI-generierter Fragebogen kann später durchaus alle Gütekriterien erfüllen – aber erst, nachdem er mit realen Beurteilenden erprobt, statistisch untersucht, überarbeitet und möglichst an einer weiteren geeigneten Stichprobe erneut geprüft wurde.

Dann handelt es sich nicht mehr nur um einen „KI-generierten Fragebogen“. Es ist ein entwickeltes und geprüftes Messinstrument, bei dessen Entwicklung KI als Werkzeug eingesetzt wurde.


Fazit: KI spart Arbeit, aber übernimmt keine Verantwortung

Kurz gesagt: KI kann einen Fragebogen in wenigen Minuten entwerfen. Ob dieser Fragebogen wirksame Führung erkennt oder falsche Urteile produziert, zeigt sich erst durch die Prüfung mit realen Daten.

Die Grenze verläuft zwischen Formulierung und Nachweis

KI kann den Aufwand für die Konzeption und Durchführung eines 360-Grad-Feedbacks drastisch reduzieren. Sie erledigt in wenigen Minuten Aufgaben, für die früher viele Stunden redaktioneller und administrativer Arbeit notwendig waren.

Sie kann einen überzeugenden Fragebogen schreiben, wichtige Gütekriterien erklären und vorhandene Daten analysieren. Sie kann jedoch fehlende Daten, geschützte Original-Items, vertrauliche Unternehmenserfahrungen und reale Erfolgskontrollen nicht durch geschliffene Formulierungen ersetzen.

Die entscheidende Grenze verläuft deshalb nicht zwischen Mensch und Maschine, sondern zwischen Formulierung und Nachweis.

Zeit sparen, ohne Führungskräfte zum Versuchskaninchen zu machen

Wer diese Grenze beachtet, kann KI produktiv einsetzen und viel Zeit sparen. Wer sie ignoriert, riskiert, Führungskräfte mit einem professionell aussehenden, aber ungeprüften Instrument zu beurteilen.

Das kann falsche Entwicklungsmaßnahmen, ungerechte Personalentscheidungen und einen erheblichen Vertrauensverlust auslösen. Die gesparte Arbeitszeit steht dann in keinem Verhältnis zu den möglichen Folgen.

KI kann überzeugend formulieren – aber nicht beurteilen, ob Führung wirkt.


Über den Autor: Prof. Dr. Waldemar Pelz

Prof. Dr. Waldemar Pelz ist emeritierter Professor der Technischen Hochschule Mittelhessen und Geschäftsführer des Instituts für Management-Innovation, einer Ausgründung der THM.

Zu seinen Arbeitsschwerpunkten gehören Führungskompetenzen, Persönlichkeit, Umsetzungskompetenz, Potenzialdiagnostik und 360-Grad-Feedback. Er hat unter anderem den Berufsbezogenen Persönlichkeitstest, das Gießener Inventar der Umsetzungskompetenz und das Gießener Inventar der Transformationalen Führung entwickelt.

Die Fragebögen und Testverfahren wurden mit umfangreichen Stichproben geprüft und in Projekten mit Unternehmen eingesetzt. Diese Erfahrung bildet die Grundlage für die Beurteilung der Chancen und Grenzen KI-generierter Fragebögen in diesem Beitrag.

Weitere Informationen zu Prof. Dr. Waldemar Pelz und seinen Publikationen


Fragebogen selbst erstellen, lizenzieren oder entwickeln lassen?

Kurz gesagt: Ein eigener Fragebogen bietet die größte Gestaltungsfreiheit, verursacht aber auch den höchsten Entwicklungs- und Prüfaufwand. Eine Lizenzlösung ist schneller einsetzbar. Eine unternehmensspezifische Entwicklung lohnt sich vor allem, wenn besondere Führungsanforderungen oder folgenreiche Personalentscheidungen berücksichtigt werden müssen.

Welche Lösung passt, hängt vom Zweck des Feedbacks, dem vorhandenen Befragungssystem, der Zahl der Teilnehmenden und den Anforderungen an die Messqualität ab.

Die Seite 360-Grad-Feedback-Fragebogen für Unternehmen unterstützt Sie bei der Entscheidung, ob Sie einen Fragebogen selbst erstellen, einen geprüften Fragebogen lizenzieren oder ein unternehmensspezifisches Instrument entwickeln lassen sollten.

Welche Lösung passt zu Ihrem Unternehmen?

In einem unverbindlichen Erstgespräch klären wir, ob ein vorhandener Fragebogen, eine Lizenzlösung oder eine unternehmensspezifische Entwicklung sinnvoll ist. Dabei besprechen wir Ziel, Aufwand, Datenschutz, Teilnehmerkreis, Befragungssystem und Auswertung.

Kontakt aufnehmen oder Termin vereinbaren