Metaskills
FORSCHUNG · DIGITAL TWIN · DER VALIDIERUNGSPROZESS IST IM GANGE

Vergleich der Ergebnisse einer auf künstlicher Intelligenz basierenden Bewertung mit den von Menschen durchgeführten Bewertungen

Wir veröffentlichen den Untersuchungsplan, bevor die Ergebnisse bekannt gegeben werden. Die Untersuchung besteht darin, die von der künstlichen Intelligenz zu einem bestimmten Gespräch gezogenen Schlussfolgerungen mit den Schlussfolgerungen unabhängiger menschlicher Bewerter zum selben Gespräch zu vergleichen. Die Methodik wurde bereits ausgearbeitet, und nun steht die Testphase bevor - auf dieser Seite wird beschrieben, was wir vorhaben, und nach der Veröffentlichung der Ergebnisse wird diese Seite unter dieser Adresse aktualisiert.

Metaskills Validierungsstudie - Konzeption

ValidierungMetaskillsLaufende ForschungStudienkonzept vorab veröffentlicht - Studien noch nicht abgeschlossen

Warum einen Entwurf veröffentlichen, bevor die Ergebnisse vorliegen?

Jeder Anbieter kann verkünden, dass seine KI mit dem Expertenurteil übereinstimmt, sobald die Zahlen vorliegen und die heiklen Varianten stillschweigend aussortiert wurden. Indem wir die Methode zuerst veröffentlichen, nehmen wir uns diese Möglichkeit selbst. Einfach ausgedrückt: Die im Folgenden beschriebenen Validierungsstudien wurden noch nicht durchgeführt. Nichts auf dieser Seite stellt ein Ergebnis dar. Was heute vorliegt, ist ein fertiges Studiendesign, ein definierter Umfang, eine definierte Teilnehmergruppe und die Bewertungsinstrumente, die die menschlichen Gutachter verwenden werden.

Wie ist es aufgebaut? Vergleich

1

Das gleiche Szenario, zweimal

Der Teilnehmer führt ein strukturiertes Gespräch mit einem auf künstlicher Intelligenz basierenden Avatar und parallel dazu dasselbe Szenario mit einem echten Schauspieler, der sich nach identischen Vorgaben verhält. Es ändert sich nur eine Variable; alle anderen bleiben unverändert.

2

Zwei unabhängige Gutachter aus einer Gruppe von Personen

Qualifizierte Prüfer analysieren die Transkripte, ohne Zugriff auf die von der künstlichen Intelligenz generierten Ergebnisse zu haben. Genau darum geht es: um die Unabhängigkeit - ein Prüfer, der die maschinengenerierte Antwort gesehen hat, gilt nicht mehr als Kontrollinstanz.

3

Vorlagen für Beobachtungsbögen

Die Bewerter verwenden spezielle Bewertungsbögen, die auf die zu bewertenden Kompetenzen zugeschnitten sind, und orientieren sich dabei an denselben Dimensionen, Grenzwerten und Leistungsstufen, wie sie im Modell festgelegt sind - sodass sowohl Menschen als auch Maschinen dieselbe Frage beantworten.

4

Vergleichen Sie die Daten und erstellen Sie anschließend einen Bericht

Die von der künstlichen Intelligenz generierten Ergebnisse sowie die Interpretationen des Verhaltens werden mit den Bewertungen derselben Gespräche durch Menschen verglichen. Die Ergebnisse, einschließlich der Fälle, in denen Abweichungen auftreten, werden unter dieser Adresse veröffentlicht.

Sechs Kompetenzen in der ersten Runde

Anpassungsfähigkeit

Den Ansatz anpassen, wenn sich die Situation ändert, ohne dabei das wesentliche Ergebnis aus den Augen zu verlieren.

Aktives Zuhören

Das Gesagte aufnehmen, überprüfen und widerspiegeln.

Durchsetzungsfähigkeit

Seinen Standpunkt vertreten und Grenzen setzen, ohne dass die Diskussion eskaliert.

Empathie

Die Gefühle des Gegenübers wahrnehmen und darauf eingehen.

Evidenzbasierter Ansatz

Eine Position eher auf Beweise als auf Status oder Umfang stützen.

Aufschlussreiche Klarheit

Eine komplexe Sache für die Person, die tatsächlich im Raum ist, verständlich machen.

Wer nimmt teil, und warum ist das wichtig?

Die Teilnehmergruppe besteht aus Fachkräften des Gesundheitswesens und klinischen Führungskräften, die sich bereit erklärt haben, an den Studien teilzunehmen. Dies ist eher eine bewusste Einschränkung als eine Frage der Zweckmäßigkeit. Kommunikationskompetenzen sind kontextabhängig. Ein Modell, das anhand von Übungen in Assessment-Centern für Hochschulabsolventen validiert wurde, sagt nur sehr wenig darüber aus, wie ein Facharzt einer verängstigten Familie eine Behandlungsentscheidung erklärt oder wie ein Stationsleiter während der Schicht Aufgaben neu verteilt. Wenn wir beabsichtigen, das Digital Twin im Gesundheitswesen einzusetzen, muss die Validierung mit Personen erfolgen, die solche Gespräche tatsächlich führen. Ein vorläufiger Vergleich, der während der Modellkalibrierung für eine einzelne Kompetenz durchgeführt wurde, floss in die Konzeption dieser Studie ein. Er war zu klein, um als Nachweis für die Genauigkeit zu dienen, und wir präsentieren ihn auch nicht als solchen - er zeigte uns jedoch, wo die Studie straffer gestaltet werden musste.

Quelle

Metaskills

2026-08-24

Das Studiendesign wurde von Metaskills in Zusammenarbeit mit einem externen Team aus Spezialisten für Psychometrie und Führungskräftebewertung erstellt. Das Design wurde bereits vor Beginn der Studien veröffentlicht; diese Seite wird unter derselben Adresse mit den Ergebnissen aktualisiert.

Entsprechende Beweise

Methodik

Das Kompetenzmodell

Die 18 Kompetenzen, die vier Bereiche und die Struktur, die hier validiert werden.

Das Kompetenzmodell
Studie

Benutzerfreundlichkeit von avatarbasierten VR-Schulungen

Eine Studie, in der berichtet wird, dass 47 Teilnehmer die Trainingserfahrung bewertet haben, wobei die eigenen Grenzen der Studie angegeben wurden.

Benutzerfreundlichkeit von avatarbasierten VR-Schulungen
Forschung

Forschung und wissenschaftliche Erkenntnisse

Alles, was wir veröffentlicht haben, mit Angabe der Quellen und Einschränkungen.

Forschung und wissenschaftliche Erkenntnisse