Metaskills
BADANIA · DIGITAL TWIN · TRWA PROCES WALIDACJI

Porównanie wyników oceny opartej na sztucznej inteligencji z ocenami przeprowadzonymi przez ludzi

Publikujemy plan badania przed ogłoszeniem wyników. Badanie polega na porównaniu wniosków wyciąganych przez sztuczną inteligencję na podstawie danej rozmowy z wnioskami niezależnych, ludzkich ekspertów dotyczącymi tej samej rozmowy. Metodologia została już opracowana, a przed nami faza testów - na tej stronie opisano, co zamierzamy zrobić, a po opublikowaniu wyników strona ta zostanie zaktualizowana pod tym adresem.

Metaskills badanie walidacyjne - projekt

WalidacjaMetaskillsBadanie w tokuOpublikowany z wyprzedzeniem plan badania - badania kliniczne jeszcze nie zakończone

Po co publikować projekt przed ogłoszeniem wyników?

Każdy dostawca może ogłosić, że jego AI zgadza się z oceną ekspertów, gdy wyniki są już znane, a niewygodne przypadki zostały po cichu pominięte. Opublikowanie metody z wyprzedzeniem odbiera nam taką możliwość. Mówiąc wprost: opisane poniżej próby walidacyjne nie zostały jeszcze przeprowadzone. Nic na tej stronie nie stanowi wyniku. Na dziś istnieje ukończony projekt badania, zdefiniowany zakres, określona grupa uczestników oraz narzędzia oceny, z których będą korzystać ludzcy ewaluatorzy.

Jak zbudowane jest porównanie

1

Ten sam scenariusz, dwa razy

Uczestnik prowadzi ustrukturyzowaną rozmowę z awatarem opartym na sztucznej inteligencji oraz, równolegle, ten sam scenariusz z udziałem prawdziwego aktora działającego zgodnie z identycznymi parametrami. Zmienia się tylko jedna zmienna; wszystkie pozostałe pozostają niezmienne.

2

Dwóch niezależnych oceniających z grupy ludzi

Wykwalifikowani oceniający analizują transkrypcje bez dostępu do wyników generowanych przez sztuczną inteligencję. Chodzi właśnie o niezależność - oceniający, który zapoznał się z odpowiedzią generowaną przez maszynę, nie stanowi już elementu kontrolnego.

3

Szablony arkuszy obserwacyjnych

Oceniający korzystają ze specjalnych arkuszy opracowanych pod kątem kompetencji objętych oceną, kierując się tymi samymi wymiarami, granicami i poziomami opanowania, jakie określa model, dzięki czemu zarówno ludzie, jak i maszyny odpowiadają na to samo pytanie.

4

Porównaj, a następnie sporządź raport

Wyniki wygenerowane przez sztuczną inteligencję oraz interpretacje zachowań są porównywane z ocenami tych samych rozmów dokonanymi przez ludzi. Wyniki, w tym przypadki rozbieżności, zostaną opublikowane pod tym adresem.

Sześć kompetencji w pierwszej rundzie

Zdolność dostosowywania się

Dostosowywanie podejścia w miarę rozwoju sytuacji, nie tracąc z oczu tego, co naprawdę ma znaczenie.

Aktywne słuchanie

Wychwytywanie, weryfikowanie i odzwierciedlanie tego, co faktycznie zostało powiedziane.

Asertywność

Utrzymywanie stanowiska i wyznaczanie granic bez eskalacji sporu.

Empatia

Dostrzeganie uczuć drugiej osoby i reagowanie na nie.

Podejście oparte na dowodach naukowych

Oparcie stanowiska na dowodach, a nie na statusie czy sile głosu.

Wnikliwa jasność

Wyjaśnienie skomplikowanej sprawy osobie, która faktycznie znajduje się w tym pomieszczeniu.

Kto bierze w tym udział i dlaczego ma to znaczenie

Grupa uczestników składa się z pracowników ochrony zdrowia i kierowników klinicznych, którzy wyrazili zgodę na udział w badaniach. Jest to raczej celowe ograniczenie niż kwestia wygody. Kompetencje komunikacyjne są związane z konkretnym kontekstem. Model zweryfikowany na podstawie ćwiczeń przeprowadzanych w centrach oceny absolwentów niewiele mówi o sytuacji, w której konsultant wyjaśnia decyzję dotyczącą leczenia przestraszonej rodzinie lub kierownik oddziału przydziela na nowo obowiązki w trakcie zmiany. Jeśli zamierzamy wykorzystać model kompetencji w zarządzaniu oddziałami (Digital Twin) w ochronie zdrowia, walidacja musi odbywać się z udziałem osób, które faktycznie prowadzą takie rozmowy. Wstępne porównanie, przeprowadzone w odniesieniu do jednej kompetencji podczas kalibracji modelu, wpłynęło na projekt niniejszego badania. Było ono zbyt małe, by stanowić dowód dokładności, i nie przedstawiamy go jako takiego - wskazało nam jednak, w jakich obszarach badanie musiało być bardziej rygorystyczne.

Co ta strona twierdzi, a czego nie twierdzi

Co to pokazuje

  • Pokazuje ukończony projekt badania: porównanie z ludzkimi oceniającymi, kompetencje objęte oceną, grupę uczestników i narzędzia oceny.
  • Pokazuje, co uznajemy za uczciwy test oceny AI - i jest to zapisane, zanim pojawią się wyniki.

Czego to nie dowodzi

  • Nie pokazuje, że ocena AI zgadza się z oceną człowieka. Próby nie zostały jeszcze przeprowadzone.
  • Na tej stronie nie ma żadnych wyników. Każda liczba, która by się tu pojawiła, opisywałaby projekt badania, a nie wynik.
  • To nie jest psychometryczna walidacja całego modelu kompetencji. Pierwsza runda obejmuje sześć z osiemnastu kompetencji.
  • Nie mówi nic o skuteczności uczenia się ani o zmianie zachowań w pracy. To odrębne pytania i wymagają odrębnych badań.

Ograniczenia, które już znamy

Część z nich możemy usunąć w kolejnej rundzie. Inne są nieodłączne dla tego rodzaju badania, a udawanie, że jest inaczej, przekreślałoby sens publikowania projektu badania.

  • Próby nie zostały przeprowadzone. Wszystko, co tu opisano, jest planem.
  • Pierwsza runda obejmuje sześć kompetencji z osiemnastu. Nie powie nam, czy pozostałe dwanaście jest ocenianych rzetelnie.
  • Ludzcy oceniający nie są wzorcem prawdy. Oni również nie zgadzają się między sobą, a zgodność między AI a oceniającym jest dowodem spójności, a nie poprawności.
  • Grupę uczestników stanowią pracownicy ochrony zdrowia. Wyniki nie przeniosą się automatycznie na inne branże.
  • Prawdziwy aktor odgrywający scenariusz to nie to samo, co realna rozmowa o realnych konsekwencjach. Porównanie izoluje ocenę, a nie stawkę.
  • To badanie wewnętrzne, a nie badanie recenzowane naukowo, i tak samo oznaczymy wyniki, gdy się pojawią.

Źródło

Metaskills

2026-08-24

Projekt badania opracowany przez firmę Metaskills we współpracy z zewnętrznym zespołem specjalistów w dziedzinie psychometrii i oceny przywództwa. Projekt opublikowano przed rozpoczęciem badań; wyniki zostaną zamieszczone na tej stronie pod tym samym adresem.

Powiązane dowody

Metodologia

Model kompetencji

18 kompetencji, cztery obszary oraz struktura, które są obecnie poddawane walidacji.

Model kompetencji
Badanie

Użyteczność szkoleń VR opartych na awatarach

W badaniu tym podano, że 47 uczestników oceniło swoje wrażenia z treningu, przy czym wskazano na pewne ograniczenia tego badania.

Użyteczność szkoleń VR opartych na awatarach
Produkt

Digital Twin

Profil kompetencji wynikający z tej logiki oraz to, jak wygląda on z perspektywy uczącego się i zespołu.

Digital Twin