Vergleich der Ergebnisse einer auf künstlicher Intelligenz basierenden Bewertung mit den von Menschen durchgeführten Bewertungen
Wir veröffentlichen den Untersuchungsplan, bevor die Ergebnisse bekannt gegeben werden. Die Untersuchung besteht darin, die von der künstlichen Intelligenz zu einem bestimmten Gespräch gezogenen Schlussfolgerungen mit den Schlussfolgerungen unabhängiger menschlicher Bewerter zum selben Gespräch zu vergleichen. Die Methodik wurde bereits ausgearbeitet, und nun steht die Testphase bevor - auf dieser Seite wird beschrieben, was wir vorhaben, und nach der Veröffentlichung der Ergebnisse wird diese Seite unter dieser Adresse aktualisiert.
Metaskills Validierungsstudie - Konzeption
Warum einen Entwurf veröffentlichen, bevor die Ergebnisse vorliegen?
Wie ist es aufgebaut? Vergleich
Das gleiche Szenario, zweimal
Der Teilnehmer führt ein strukturiertes Gespräch mit einem auf künstlicher Intelligenz basierenden Avatar und parallel dazu dasselbe Szenario mit einem echten Schauspieler, der sich nach identischen Vorgaben verhält. Es ändert sich nur eine Variable; alle anderen bleiben unverändert.
Zwei unabhängige Gutachter aus einer Gruppe von Personen
Qualifizierte Prüfer analysieren die Transkripte, ohne Zugriff auf die von der künstlichen Intelligenz generierten Ergebnisse zu haben. Genau darum geht es: um die Unabhängigkeit - ein Prüfer, der die maschinengenerierte Antwort gesehen hat, gilt nicht mehr als Kontrollinstanz.
Vorlagen für Beobachtungsbögen
Die Bewerter verwenden spezielle Bewertungsbögen, die auf die zu bewertenden Kompetenzen zugeschnitten sind, und orientieren sich dabei an denselben Dimensionen, Grenzwerten und Leistungsstufen, wie sie im Modell festgelegt sind - sodass sowohl Menschen als auch Maschinen dieselbe Frage beantworten.
Vergleichen Sie die Daten und erstellen Sie anschließend einen Bericht
Die von der künstlichen Intelligenz generierten Ergebnisse sowie die Interpretationen des Verhaltens werden mit den Bewertungen derselben Gespräche durch Menschen verglichen. Die Ergebnisse, einschließlich der Fälle, in denen Abweichungen auftreten, werden unter dieser Adresse veröffentlicht.
Sechs Kompetenzen in der ersten Runde
Anpassungsfähigkeit
Den Ansatz anpassen, wenn sich die Situation ändert, ohne dabei das wesentliche Ergebnis aus den Augen zu verlieren.
Aktives Zuhören
Das Gesagte aufnehmen, überprüfen und widerspiegeln.
Durchsetzungsfähigkeit
Seinen Standpunkt vertreten und Grenzen setzen, ohne dass die Diskussion eskaliert.
Empathie
Die Gefühle des Gegenübers wahrnehmen und darauf eingehen.
Evidenzbasierter Ansatz
Eine Position eher auf Beweise als auf Status oder Umfang stützen.
Aufschlussreiche Klarheit
Eine komplexe Sache für die Person, die tatsächlich im Raum ist, verständlich machen.
Wer nimmt teil, und warum ist das wichtig?
Was diese Seite behauptet - und was nicht
Was das zeigt
- Sie zeigt ein fertiges Studiendesign: den Vergleich mit menschlichen Bewertern, die einbezogenen Kompetenzen, die Teilnehmergruppe und die Bewertungsinstrumente.
- Sie zeigt, was wir für einen fairen Test einer KI-Bewertung halten - und das ist dokumentiert, bevor es die Ergebnisse sind.
Was das nicht zeigt
- Sie zeigt nicht, dass die KI-Bewertung mit dem menschlichen Urteil übereinstimmt. Die Studien wurden noch nicht durchgeführt.
- Auf dieser Seite stehen keine Ergebnisse. Jede Zahl hier würde das Studiendesign beschreiben, nicht ein Ergebnis.
- Sie ist keine psychometrische Validierung des gesamten Kompetenzmodells. Die erste Runde umfasst sechs der achtzehn Kompetenzen.
- Sie sagt nichts über Lernwirksamkeit oder über Verhaltensänderung am Arbeitsplatz aus. Das sind eigene Fragen, die eigene Studien erfordern.
Einschränkungen, die wir bereits kennen
Einige davon können wir in der nächsten Runde beheben. Andere sind dieser Art von Studie eigen, und so zu tun, als wäre es anders, würde den Sinn der Veröffentlichung des Designs zunichtemachen.
- Die Studien wurden nicht durchgeführt. Alles hier ist ein Plan.
- Die erste Runde umfasst sechs von achtzehn Kompetenzen. Sie wird uns nicht sagen, ob die übrigen zwölf zuverlässig bewertet werden.
- Menschliche Bewerter sind kein Maßstab der Wahrheit. Auch sie sind untereinander uneinig, und Übereinstimmung zwischen KI und Bewerter ist ein Beleg für Konsistenz, nicht für Richtigkeit.
- Die Teilnehmergruppe besteht aus Fachkräften des Gesundheitswesens. Die Ergebnisse lassen sich nicht automatisch auf andere Branchen übertragen.
- Ein menschlicher Schauspieler, der ein Szenario spielt, ist nicht dasselbe wie ein echtes Gespräch mit echten Konsequenzen. Der Vergleich isoliert die Bewertung, nicht das, was auf dem Spiel steht.
- Dies ist interne Forschung, keine Peer-Review-Studie, und wir werden die Ergebnisse ebenso kennzeichnen, wenn sie vorliegen.
Quelle
Metaskills
2026-08-24
Das Studiendesign wurde von Metaskills in Zusammenarbeit mit einem externen Team aus Spezialisten für Psychometrie und Führungskräftebewertung erstellt. Das Design wurde bereits vor Beginn der Studien veröffentlicht; diese Seite wird unter derselben Adresse mit den Ergebnissen aktualisiert.
Entsprechende Beweise
Das Kompetenzmodell
Die 18 Kompetenzen, die vier Bereiche und die Struktur, die hier validiert werden.
Das KompetenzmodellBenutzerfreundlichkeit von avatarbasierten VR-Schulungen
Eine Studie, in der berichtet wird, dass 47 Teilnehmer die Trainingserfahrung bewertet haben, wobei die eigenen Grenzen der Studie angegeben wurden.
Benutzerfreundlichkeit von avatarbasierten VR-SchulungenDigital Twin
Das Kompetenzprofil, das sich aus dieser Logik ergibt, und wie es für einen Lernenden und ein Team aussieht.
Digital Twin