Od rozmowy do profilu: fakty, a nie wrażenia
Profil kompetencji ma wartość tylko wtedy, gdy można określić, z jakich elementów się składa. Na tej stronie opisano, co moduł oceny uznaje za dowód posiadania danej kompetencji, czego nie uznaje za dowód oraz dlaczego pojedyncza udana rozmowa nie wystarczy, by wpłynąć na profil.
Metaskills metodologia oceny, 2026 r.
Co uznaje się za zdarzenie dowodowe
Cztery pytania, które zadajemy w odniesieniu do każdego dowodu
Spontaniczność
Czy zachowanie to pojawiło się z własnej inicjatywy, czy dopiero po wywarciu wyraźnej presji przez awatara? Oba przypadki są rejestrowane. Nie oznaczają one tego samego.
Czas
Czy rozmowa dotarła do etapu, na którym mogło to jeszcze wpłynąć na jej wynik? Odpowiednie zdanie wypowiedziane trzy minuty za późno daje inny rezultat niż to samo zdanie wypowiedziane w odpowiednim momencie.
Dopasowanie się do drugiej osoby
Czy styl wypowiedzi został dostosowany do osób, które faktycznie tam były - do ich potrzeb emocjonalnych i tego, na ile szczegółowych informacji były w stanie przyjąć? Dobrze sformułowane wyjaśnienie skierowane do niewłaściwej osoby nie stanowi dobrej komunikacji.
Proporcjonalność
Czy było czegoś za dużo? Nadmierna empatia osłabia jasność myślenia równie skutecznie, jak nadmierna asertywność nasila napięcie. Nadmiar dobrego zachowania nie przekłada się automatycznie na wyższą ocenę.
Niektóre zachowania ograniczają wynik
Jak wysoki jest poziom pewności co do profilu, wyrażony na głos
Niewystarczające dane
Zbyt mała liczba przykładów lub wszystkie pochodzą z jednej i tej samej sytuacji. Kompetencja została oznaczona jako „jeszcze niepodlegająca ocenie”. Wolimy wskazać lukę niż podawać liczbę, na której nikt nie powinien się opierać.
Wyłaniający się wzór
Zjawisko to zaobserwowano w więcej niż jednym rodzaju kontekstu. To wystarczy do sformułowania wstępnej opinii, określonej właśnie jako wstępna - z zaznaczeniem ograniczonego stopnia pewności w treści raportu, a nie ukrytej w przypisie.
Zweryfikowany wzór
Powtarzane w kilku wyraźnie różniących się kontekstach, w tym w trudnych sytuacjach, a nie tylko w tych komfortowych. To właśnie w tym momencie profil zaczyna stanowić podstawę do planowania rozwoju.
Odporny na presję
Zachowanie to utrzymuje się nawet podczas bardzo napiętych rozmów oraz w obliczu aktywnego oporu ze strony awatara, bez utraty jakości. Jest to najwyższy status przyznawany przez model i jednocześnie najrzadszy.
Dlaczego nie obliczamy średniej
Dwie warstwy i twarda granica
Co ta strona twierdzi, a czego nie twierdzi
Co to pokazuje
- Opisuje logikę oceny: co uznaje się za dowód, jak ocenia się jego jakość, jak przypisywany jest poziom pewności i dlaczego agregacja nie jest średnią.
- Pokazuje granice, które architektura sama sobie narzuca - żadnego diagnozowania osobowości, żadnych statycznych etykiet, ćwiczenia wykluczone z oceny.
- Wyjaśnia, dlaczego profil otwarcie informuje o niskim poziomie pewności, zamiast podawać liczbę dla wszystkiego.
Czego to nie dowodzi
- Nie pokazuje, że ocena generowana przez sztuczną inteligencję jest zgodna z eksperckim osądem ludzi. To porównanie jest osobną pracą i wciąż jest w toku.
- Nie jest dowodem skuteczności uczenia się ani zmiany zachowania w pracy. Metodyka oceny i efekty szkolenia to różne pytania.
- Nie jest podstawą do zatrudnienia, awansu ani żadnej innej decyzji kadrowej, a system celowo zbudowano tak, by trzymał się od nich z daleka.
Ograniczenia
To jest opis tego, jak zaprojektowano ocenę, spisany zanim pojawiły się wyniki walidacji. Obie połowy tego zdania mają znaczenie.
- Dokładne progi stojące za czterema statusami pewności - ile próbek i ile kontekstów wymaga każdy z nich - pozostają wewnętrzne. Ich opublikowanie pozwoliłoby optymalizować działania pod próg zamiast pod zachowanie.
- Struktury promptów i lista zachowań ograniczających pozostają wewnętrzne z tego samego powodu.
- Ocena opiera się na transkrypcji rozmowy. Nie obejmuje mowy ciała, tonu głosu ani niczego innego poza słowami - i nie ma tego obejmować.
- Duże modele językowe potrafią być niekonsekwentne. Projekt przeciwdziała temu przez ustrukturyzowane dowody, wymagane cytaty i agregację z wielu rozmów, ale nie sprawia, że problem znika.
- Walidacja w zestawieniu z ocenami niezależnych ludzkich oceniających jest w toku. Dopóki nie przyniesie wyników, statusy pewności opisują, ile jest dowodów, a nie udowodnioną trafność predykcyjną.
Źródło
Metaskills
2026-08-24
Notatka metodologiczna przygotowana przez firmę Metaskills we współpracy z zewnętrznym zespołem specjalistów ds. psychometrii i oceny przywództwa. Jest to notatka metodologiczna o charakterze wewnętrznym, a nie publikacja poddana recenzji naukowej.
Powiązane dowody
Metodologia walidacji
W jaki sposób porównujemy oceny generowane przez sztuczną inteligencję z ocenami niezależnych ekspertów oraz czego jeszcze nie udało się osiągnąć.
Metodologia walidacjiDigital Twin
Profil kompetencji wynikający z tej logiki oraz to, jak wygląda on z perspektywy uczącego się i zespołu.
Digital TwinUżyteczność szkoleń VR opartych na awatarach
Czterdziestu siedmiu uczestników oceniło swoje wrażenia z szkolenia. Dane dotyczące użyteczności, wyraźnie oznaczone jako takie.
Użyteczność szkoleń VR opartych na awatarach