Metaskills
FORSCHUNG · DIGITAL TWIN · DER VALIDIERUNGSPROZESS IST IM GANGE

Vergleich der Ergebnisse einer auf künstlicher Intelligenz basierenden Bewertung mit den von Menschen durchgeführten Bewertungen

Wir veröffentlichen den Untersuchungsplan, bevor die Ergebnisse bekannt gegeben werden. Die Untersuchung besteht darin, die von der künstlichen Intelligenz zu einem bestimmten Gespräch gezogenen Schlussfolgerungen mit den Schlussfolgerungen unabhängiger menschlicher Bewerter zum selben Gespräch zu vergleichen. Die Methodik wurde bereits ausgearbeitet, und nun steht die Testphase bevor - auf dieser Seite wird beschrieben, was wir vorhaben, und nach der Veröffentlichung der Ergebnisse wird diese Seite unter dieser Adresse aktualisiert.

Metaskills Validierungsstudie - Konzeption

ValidierungMetaskillsLaufende ForschungStudienkonzept vorab veröffentlicht - Studien noch nicht abgeschlossen

Warum einen Entwurf veröffentlichen, bevor die Ergebnisse vorliegen?

Jeder Anbieter kann verkünden, dass seine KI mit dem Expertenurteil übereinstimmt, sobald die Zahlen vorliegen und die heiklen Varianten stillschweigend aussortiert wurden. Indem wir die Methode zuerst veröffentlichen, nehmen wir uns diese Möglichkeit selbst. Einfach ausgedrückt: Die im Folgenden beschriebenen Validierungsstudien wurden noch nicht durchgeführt. Nichts auf dieser Seite stellt ein Ergebnis dar. Was heute vorliegt, ist ein fertiges Studiendesign, ein definierter Umfang, eine definierte Teilnehmergruppe und die Bewertungsinstrumente, die die menschlichen Gutachter verwenden werden.

Wie ist es aufgebaut? Vergleich

1

Das gleiche Szenario, zweimal

Der Teilnehmer führt ein strukturiertes Gespräch mit einem auf künstlicher Intelligenz basierenden Avatar und parallel dazu dasselbe Szenario mit einem echten Schauspieler, der sich nach identischen Vorgaben verhält. Es ändert sich nur eine Variable; alle anderen bleiben unverändert.

2

Zwei unabhängige Gutachter aus einer Gruppe von Personen

Qualifizierte Prüfer analysieren die Transkripte, ohne Zugriff auf die von der künstlichen Intelligenz generierten Ergebnisse zu haben. Genau darum geht es: um die Unabhängigkeit - ein Prüfer, der die maschinengenerierte Antwort gesehen hat, gilt nicht mehr als Kontrollinstanz.

3

Vorlagen für Beobachtungsbögen

Die Bewerter verwenden spezielle Bewertungsbögen, die auf die zu bewertenden Kompetenzen zugeschnitten sind, und orientieren sich dabei an denselben Dimensionen, Grenzwerten und Leistungsstufen, wie sie im Modell festgelegt sind - sodass sowohl Menschen als auch Maschinen dieselbe Frage beantworten.

4

Vergleichen Sie die Daten und erstellen Sie anschließend einen Bericht

Die von der künstlichen Intelligenz generierten Ergebnisse sowie die Interpretationen des Verhaltens werden mit den Bewertungen derselben Gespräche durch Menschen verglichen. Die Ergebnisse, einschließlich der Fälle, in denen Abweichungen auftreten, werden unter dieser Adresse veröffentlicht.

Sechs Kompetenzen in der ersten Runde

Anpassungsfähigkeit

Den Ansatz anpassen, wenn sich die Situation ändert, ohne dabei das wesentliche Ergebnis aus den Augen zu verlieren.

Aktives Zuhören

Das Gesagte aufnehmen, überprüfen und widerspiegeln.

Durchsetzungsfähigkeit

Seinen Standpunkt vertreten und Grenzen setzen, ohne dass die Diskussion eskaliert.

Empathie

Die Gefühle des Gegenübers wahrnehmen und darauf eingehen.

Evidenzbasierter Ansatz

Eine Position eher auf Beweise als auf Status oder Umfang stützen.

Aufschlussreiche Klarheit

Eine komplexe Sache für die Person, die tatsächlich im Raum ist, verständlich machen.

Wer nimmt teil, und warum ist das wichtig?

Die Teilnehmergruppe besteht aus Fachkräften des Gesundheitswesens und klinischen Führungskräften, die sich bereit erklärt haben, an den Studien teilzunehmen. Dies ist eher eine bewusste Einschränkung als eine Frage der Zweckmäßigkeit. Kommunikationskompetenzen sind kontextabhängig. Ein Modell, das anhand von Übungen in Assessment-Centern für Hochschulabsolventen validiert wurde, sagt nur sehr wenig darüber aus, wie ein Facharzt einer verängstigten Familie eine Behandlungsentscheidung erklärt oder wie ein Stationsleiter während der Schicht Aufgaben neu verteilt. Wenn wir beabsichtigen, das Digital Twin im Gesundheitswesen einzusetzen, muss die Validierung mit Personen erfolgen, die solche Gespräche tatsächlich führen. Ein vorläufiger Vergleich, der während der Modellkalibrierung für eine einzelne Kompetenz durchgeführt wurde, floss in die Konzeption dieser Studie ein. Er war zu klein, um als Nachweis für die Genauigkeit zu dienen, und wir präsentieren ihn auch nicht als solchen - er zeigte uns jedoch, wo die Studie straffer gestaltet werden musste.

Was diese Seite behauptet - und was nicht

Was das zeigt

  • Sie zeigt ein fertiges Studiendesign: den Vergleich mit menschlichen Bewertern, die einbezogenen Kompetenzen, die Teilnehmergruppe und die Bewertungsinstrumente.
  • Sie zeigt, was wir für einen fairen Test einer KI-Bewertung halten - und das ist dokumentiert, bevor es die Ergebnisse sind.

Was das nicht zeigt

  • Sie zeigt nicht, dass die KI-Bewertung mit dem menschlichen Urteil übereinstimmt. Die Studien wurden noch nicht durchgeführt.
  • Auf dieser Seite stehen keine Ergebnisse. Jede Zahl hier würde das Studiendesign beschreiben, nicht ein Ergebnis.
  • Sie ist keine psychometrische Validierung des gesamten Kompetenzmodells. Die erste Runde umfasst sechs der achtzehn Kompetenzen.
  • Sie sagt nichts über Lernwirksamkeit oder über Verhaltensänderung am Arbeitsplatz aus. Das sind eigene Fragen, die eigene Studien erfordern.

Einschränkungen, die wir bereits kennen

Einige davon können wir in der nächsten Runde beheben. Andere sind dieser Art von Studie eigen, und so zu tun, als wäre es anders, würde den Sinn der Veröffentlichung des Designs zunichtemachen.

  • Die Studien wurden nicht durchgeführt. Alles hier ist ein Plan.
  • Die erste Runde umfasst sechs von achtzehn Kompetenzen. Sie wird uns nicht sagen, ob die übrigen zwölf zuverlässig bewertet werden.
  • Menschliche Bewerter sind kein Maßstab der Wahrheit. Auch sie sind untereinander uneinig, und Übereinstimmung zwischen KI und Bewerter ist ein Beleg für Konsistenz, nicht für Richtigkeit.
  • Die Teilnehmergruppe besteht aus Fachkräften des Gesundheitswesens. Die Ergebnisse lassen sich nicht automatisch auf andere Branchen übertragen.
  • Ein menschlicher Schauspieler, der ein Szenario spielt, ist nicht dasselbe wie ein echtes Gespräch mit echten Konsequenzen. Der Vergleich isoliert die Bewertung, nicht das, was auf dem Spiel steht.
  • Dies ist interne Forschung, keine Peer-Review-Studie, und wir werden die Ergebnisse ebenso kennzeichnen, wenn sie vorliegen.

Quelle

Metaskills

2026-08-24

Das Studiendesign wurde von Metaskills in Zusammenarbeit mit einem externen Team aus Spezialisten für Psychometrie und Führungskräftebewertung erstellt. Das Design wurde bereits vor Beginn der Studien veröffentlicht; diese Seite wird unter derselben Adresse mit den Ergebnissen aktualisiert.

Entsprechende Beweise

Methodik

Das Kompetenzmodell

Die 18 Kompetenzen, die vier Bereiche und die Struktur, die hier validiert werden.

Das Kompetenzmodell
Studie

Benutzerfreundlichkeit von avatarbasierten VR-Schulungen

Eine Studie, in der berichtet wird, dass 47 Teilnehmer die Trainingserfahrung bewertet haben, wobei die eigenen Grenzen der Studie angegeben wurden.

Benutzerfreundlichkeit von avatarbasierten VR-Schulungen
Produkt

Digital Twin

Das Kompetenzprofil, das sich aus dieser Logik ergibt, und wie es für einen Lernenden und ein Team aussieht.

Digital Twin
Validierung: KI-Bewertung gegen Assessoren | Metaskills