Porównanie wyników oceny opartej na sztucznej inteligencji z ocenami przeprowadzonymi przez ludzi
Publikujemy plan badania przed ogłoszeniem wyników. Badanie polega na porównaniu wniosków wyciąganych przez sztuczną inteligencję na podstawie danej rozmowy z wnioskami niezależnych, ludzkich ekspertów dotyczącymi tej samej rozmowy. Metodologia została już opracowana, a przed nami faza testów - na tej stronie opisano, co zamierzamy zrobić, a po opublikowaniu wyników strona ta zostanie zaktualizowana pod tym adresem.
Metaskills badanie walidacyjne - projekt
Po co publikować projekt przed ogłoszeniem wyników?
Jak zbudowane jest porównanie
Ten sam scenariusz, dwa razy
Uczestnik prowadzi ustrukturyzowaną rozmowę z awatarem opartym na sztucznej inteligencji oraz, równolegle, ten sam scenariusz z udziałem prawdziwego aktora działającego zgodnie z identycznymi parametrami. Zmienia się tylko jedna zmienna; wszystkie pozostałe pozostają niezmienne.
Dwóch niezależnych oceniających z grupy ludzi
Wykwalifikowani oceniający analizują transkrypcje bez dostępu do wyników generowanych przez sztuczną inteligencję. Chodzi właśnie o niezależność - oceniający, który zapoznał się z odpowiedzią generowaną przez maszynę, nie stanowi już elementu kontrolnego.
Szablony arkuszy obserwacyjnych
Oceniający korzystają ze specjalnych arkuszy opracowanych pod kątem kompetencji objętych oceną, kierując się tymi samymi wymiarami, granicami i poziomami opanowania, jakie określa model, dzięki czemu zarówno ludzie, jak i maszyny odpowiadają na to samo pytanie.
Porównaj, a następnie sporządź raport
Wyniki wygenerowane przez sztuczną inteligencję oraz interpretacje zachowań są porównywane z ocenami tych samych rozmów dokonanymi przez ludzi. Wyniki, w tym przypadki rozbieżności, zostaną opublikowane pod tym adresem.
Sześć kompetencji w pierwszej rundzie
Zdolność dostosowywania się
Dostosowywanie podejścia w miarę rozwoju sytuacji, nie tracąc z oczu tego, co naprawdę ma znaczenie.
Aktywne słuchanie
Wychwytywanie, weryfikowanie i odzwierciedlanie tego, co faktycznie zostało powiedziane.
Asertywność
Utrzymywanie stanowiska i wyznaczanie granic bez eskalacji sporu.
Empatia
Dostrzeganie uczuć drugiej osoby i reagowanie na nie.
Podejście oparte na dowodach naukowych
Oparcie stanowiska na dowodach, a nie na statusie czy sile głosu.
Wnikliwa jasność
Wyjaśnienie skomplikowanej sprawy osobie, która faktycznie znajduje się w tym pomieszczeniu.
Kto bierze w tym udział i dlaczego ma to znaczenie
Co ta strona twierdzi, a czego nie twierdzi
Co to pokazuje
- Pokazuje ukończony projekt badania: porównanie z ludzkimi oceniającymi, kompetencje objęte oceną, grupę uczestników i narzędzia oceny.
- Pokazuje, co uznajemy za uczciwy test oceny AI - i jest to zapisane, zanim pojawią się wyniki.
Czego to nie dowodzi
- Nie pokazuje, że ocena AI zgadza się z oceną człowieka. Próby nie zostały jeszcze przeprowadzone.
- Na tej stronie nie ma żadnych wyników. Każda liczba, która by się tu pojawiła, opisywałaby projekt badania, a nie wynik.
- To nie jest psychometryczna walidacja całego modelu kompetencji. Pierwsza runda obejmuje sześć z osiemnastu kompetencji.
- Nie mówi nic o skuteczności uczenia się ani o zmianie zachowań w pracy. To odrębne pytania i wymagają odrębnych badań.
Ograniczenia, które już znamy
Część z nich możemy usunąć w kolejnej rundzie. Inne są nieodłączne dla tego rodzaju badania, a udawanie, że jest inaczej, przekreślałoby sens publikowania projektu badania.
- Próby nie zostały przeprowadzone. Wszystko, co tu opisano, jest planem.
- Pierwsza runda obejmuje sześć kompetencji z osiemnastu. Nie powie nam, czy pozostałe dwanaście jest ocenianych rzetelnie.
- Ludzcy oceniający nie są wzorcem prawdy. Oni również nie zgadzają się między sobą, a zgodność między AI a oceniającym jest dowodem spójności, a nie poprawności.
- Grupę uczestników stanowią pracownicy ochrony zdrowia. Wyniki nie przeniosą się automatycznie na inne branże.
- Prawdziwy aktor odgrywający scenariusz to nie to samo, co realna rozmowa o realnych konsekwencjach. Porównanie izoluje ocenę, a nie stawkę.
- To badanie wewnętrzne, a nie badanie recenzowane naukowo, i tak samo oznaczymy wyniki, gdy się pojawią.
Źródło
Metaskills
2026-08-24
Projekt badania opracowany przez firmę Metaskills we współpracy z zewnętrznym zespołem specjalistów w dziedzinie psychometrii i oceny przywództwa. Projekt opublikowano przed rozpoczęciem badań; wyniki zostaną zamieszczone na tej stronie pod tym samym adresem.
Powiązane dowody
Model kompetencji
18 kompetencji, cztery obszary oraz struktura, które są obecnie poddawane walidacji.
Model kompetencjiUżyteczność szkoleń VR opartych na awatarach
W badaniu tym podano, że 47 uczestników oceniło swoje wrażenia z treningu, przy czym wskazano na pewne ograniczenia tego badania.
Użyteczność szkoleń VR opartych na awatarachDigital Twin
Profil kompetencji wynikający z tej logiki oraz to, jak wygląda on z perspektywy uczącego się i zespołu.
Digital Twin