Vom Gespräch zum Profil: Fakten statt Eindrücke
Ein Kompetenzprofil ist nur dann aussagekräftig, wenn sich feststellen lässt, aus welchen Elementen es sich zusammensetzt. Auf dieser Seite wird beschrieben, was das Bewertungsmodul als Nachweis für das Vorhandensein einer bestimmten Kompetenz ansieht, was nicht als Nachweis gilt und warum ein einzelnes erfolgreiches Gespräch nicht ausreicht, um das Profil zu beeinflussen.
Metaskills Bewertungsmethodik, 2026
Was gilt als nachweisbares Ereignis?
Vier Dinge, nach denen wir fragen jedes Beweisstück
Spontaneität
Ist das Verhalten von selbst aufgetreten oder erst, nachdem der Avatar expliziten Druck ausgeübt hat? Beides wird erfasst. Die beiden Fälle bedeuten nicht dasselbe.
Zeitplanung
War das Gespräch bereits an einem Punkt angelangt, an dem es den Ausgang noch hätte beeinflussen können? Der richtige Satz, der drei Minuten zu spät kommt, führt zu einem anderen Ergebnis als der richtige Satz, der rechtzeitig kommt.
Auf die andere Person zugeschnitten
Wurde der Stil auf die tatsächlich Anwesenden abgestimmt - darauf, was sie emotional brauchten und wie viele Details sie verkraften konnten? Eine gut formulierte Erklärung, die sich an die falsche Person richtet, ist keine gute Kommunikation.
Verhältnismäßigkeit
War es vielleicht zu viel des Guten? Übermäßiges Einfühlungsvermögen untergräbt die Klarheit ebenso zuverlässig, wie übermäßige Durchsetzungskraft die Spannungen verschärft. Mehr von einer guten Eigenschaft führt nicht automatisch zu einem besseren Ergebnis.
Bestimmte Verhaltensweisen begrenzen das Ergebnis
Wie zuverlässig das Profil ist, laut ausgesprochen
Unzureichende Daten
Zu wenige Beispiele oder ausschließlich Beispiele aus ein und derselben Situation. Die Kompetenz wird als noch nicht bewertbar ausgewiesen. Wir ziehen es vor, eine Lücke aufzuzeigen, anstatt eine Zahl anzugeben, auf die sich niemand verlassen sollte.
Sich abzeichnendes Muster
Das Verhalten ist in mehr als einem Kontext aufgetreten. Das reicht für ein vorläufiges Feedback, das auch als solches gekennzeichnet ist - wobei die eingeschränkte Zuverlässigkeit im Bericht selbst erwähnt und nicht in einer Fußnote versteckt wird.
Validiertes Muster
Wiederholt in mehreren deutlich unterschiedlichen Kontexten, darunter auch schwierige Situationen und nicht nur angenehme. An diesem Punkt lohnt es sich, die Weiterentwicklung anhand dieses Profils zu planen.
Unter Druck stabil
Dieses Verhalten zeigt sich auch in angespannten Gesprächen und angesichts aktiven Widerstands seitens des Avatars, ohne dass dabei die Qualität leidet. Der höchste Status, den das Modell zuweist, und zugleich der seltenste.
Warum wir nicht annehmen im Durchschnitt
Zwei Schichten und eine harte Grenze
Was diese Seite behauptet und was nicht
Was das zeigt
- Die Seite beschreibt die Bewertungslogik: was als Beleg gilt, wie die Qualität beurteilt wird, wie die Konfidenz zugewiesen wird und warum die Aggregation kein Durchschnitt ist.
- Die Seite zeigt die Grenzen, die sich die Architektur selbst setzt - keine Diagnose der Persönlichkeit, keine statischen Etikettierungen, Übungen von der Bewertung ausgeschlossen.
- Die Seite erklärt, warum das Profil eine geringe Konfidenz offen ausweist, statt für alles eine Zahl zu produzieren.
Was das nicht zeigt
- Die Seite zeigt nicht, dass die KI-Bewertung mit dem Urteil menschlicher Fachleute übereinstimmt. Dieser Vergleich ist eine eigene Arbeit und läuft noch.
- Die Seite ist kein Nachweis für Lernwirksamkeit oder für verändertes Verhalten am Arbeitsplatz. Bewertungsmethodik und Trainingsergebnisse sind unterschiedliche Fragen.
- Die Seite ist keine Grundlage für Einstellung, Beförderung oder eine andere Personalentscheidung, und das System ist bewusst so gebaut, dass es sich daraus heraushält.
Einschränkungen
Dies ist eine Beschreibung, wie die Bewertung gestaltet ist, verfasst, bevor die Ergebnisse der Validierung vorliegen. Beide Hälften dieses Satzes sind wichtig.
- Die genauen Schwellenwerte hinter den vier Konfidenzstatus - wie viele Stichproben und wie viele Kontexte jeder von ihnen erfordert - bleiben intern. Würden wir sie veröffentlichen, könnten Menschen auf den Schwellenwert hin optimieren statt auf das Verhalten.
- Prompt-Strukturen und die Liste der begrenzenden Verhaltensweisen bleiben aus demselben Grund intern.
- Die Bewertung stützt sich auf das Transkript eines Gesprächs. Sie erfasst weder Körpersprache noch Tonfall noch sonst etwas außerhalb der Worte, und das ist auch nicht beabsichtigt.
- Große Sprachmodelle können inkonsistent sein. Die Gestaltung wirkt dem mit strukturierten Belegen, verpflichtenden Zitaten und einer Aggregation über mehrere Gespräche hinweg entgegen, aber sie lässt das Problem nicht verschwinden.
- Die Validierung im Vergleich zu unabhängigen menschlichen Bewertern läuft. Bis sie Ergebnisse liefert, beschreiben die Konfidenzstatus, wie viele Belege vorliegen, und keine nachgewiesene Vorhersagegenauigkeit.
Quelle
Metaskills
2026-08-24
Methodikhinweis, erstellt von Metaskills in Zusammenarbeit mit einem externen Team aus Spezialisten für Psychometrie und Führungskräftebeurteilung. Hierbei handelt es sich um einen internen Methodikhinweis und nicht um eine begutachtete Veröffentlichung.
Entsprechende Belege
Validierungsmethodik
Wie wir KI-generierte Bewertungen im Vergleich zu unabhängigen menschlichen Bewertern testen und was bisher noch nicht geschehen ist.
ValidierungsmethodikDigital Twin
Das Kompetenzprofil, das sich aus dieser Logik ergibt, und wie es für einen Lernenden und ein Team aussieht.
Digital TwinBenutzerfreundlichkeit von avatarbasierten VR-Schulungen
47 Teilnehmer bewerteten die Schulungserfahrung. Erkenntnisse zur Benutzerfreundlichkeit, die eindeutig als solche gekennzeichnet sind.
Benutzerfreundlichkeit von avatarbasierten VR-Schulungen