Metaskills
BADANIA · DIGITAL TWIN · TRWA PROCES WALIDACJI

Porównanie wyników oceny opartej na sztucznej inteligencji z ocenami przeprowadzonymi przez ludzi

Publikujemy plan badania przed ogłoszeniem wyników. Badanie polega na porównaniu wniosków wyciągniętych przez sztuczną inteligencję na temat danej rozmowy z wnioskami niezależnych oceniających-ludzi dotyczącymi tej samej rozmowy. Metodologia została już opracowana, a przed nami faza testów - na tej stronie opisano, co zamierzamy zrobić, a po opublikowaniu wyników strona ta zostanie zaktualizowana pod tym adresem.

Metaskills badanie walidacyjne - projekt

WalidacjaMetaskillsBadanie w tokuOpublikowany z wyprzedzeniem plan badania - badania kliniczne jeszcze nie zakończone

Po co publikować projekt przed ogłoszeniem wyników?

Każdy dostawca może ogłosić, że jego sztuczna inteligencja pokrywa się z opinią ekspertów, gdy tylko pojawią się dane liczbowe, a niewygodne warianty zostaną po cichu pominięte. Opublikowanie najpierw samej metody jest sposobem na pozbawienie się tej możliwości. Mówiąc wprost: opisane poniżej badania walidacyjne nie zostały jeszcze przeprowadzone. Żadna z informacji na tej stronie nie stanowi wyniku. To, co mamy dzisiaj, to gotowy projekt badania, określony zakres, zdefiniowana grupa uczestników oraz narzędzia oceny, z których będą korzystać oceniający.

Jak zbudowane jest porównanie

1

Ten sam scenariusz, dwa razy

Uczestnik prowadzi ustrukturyzowaną rozmowę z awatarem opartym na sztucznej inteligencji oraz, równolegle, ten sam scenariusz z udziałem prawdziwego aktora działającego zgodnie z identycznymi parametrami. Zmienia się tylko jedna zmienna; wszystkie pozostałe pozostają niezmienne.

2

Dwóch niezależnych oceniających z grupy ludzi

Wykwalifikowani oceniający analizują transkrypcje bez dostępu do wyników generowanych przez sztuczną inteligencję. Chodzi właśnie o niezależność - oceniający, który zapoznał się z odpowiedzią generowaną przez maszynę, nie stanowi już elementu kontrolnego.

3

Szablony arkuszy obserwacyjnych

Oceniający korzystają ze specjalnych arkuszy opracowanych pod kątem kompetencji objętych oceną, kierując się tymi samymi wymiarami, granicami i poziomami opanowania, jakie określa model - dzięki czemu zarówno ludzie, jak i maszyny odpowiadają na to samo pytanie.

4

Porównaj, a następnie sporządź raport

Wyniki wygenerowane przez sztuczną inteligencję oraz interpretacje zachowań są porównywane z ocenami tych samych rozmów dokonanymi przez ludzi. Wyniki, w tym przypadki rozbieżności, zostaną opublikowane pod tym adresem.

Sześć kompetencji w pierwszej rundzie

Zdolność dostosowywania się

Dostosowywanie podejścia w miarę rozwoju sytuacji, nie tracąc z oczu tego, co naprawdę ma znaczenie.

Aktywne słuchanie

Wychwytywanie, weryfikowanie i odzwierciedlanie tego, co faktycznie zostało powiedziane.

Asertywność

Utrzymywanie stanowiska i wyznaczanie granic bez eskalacji sporu.

Empatia

Dostrzeganie uczuć drugiej osoby i reagowanie na nie.

Podejście oparte na dowodach naukowych

Oparcie stanowiska na dowodach, a nie na statusie czy wielkości.

Wnikliwa jasność

Wyjaśnienie skomplikowanej sprawy osobie, która faktycznie znajduje się w tym pomieszczeniu.

Kto bierze w tym udział i dlaczego ma to znaczenie

Grupa uczestników składa się z pracowników ochrony zdrowia i kierowników klinicznych, którzy wyrazili zgodę na udział w badaniach. Jest to raczej celowe ograniczenie niż kwestia wygody. Kompetencje komunikacyjne są związane z konkretnym kontekstem. Model zweryfikowany na podstawie ćwiczeń przeprowadzanych w centrach oceny absolwentów niewiele mówi o sytuacji, w której konsultant wyjaśnia decyzję dotyczącą leczenia przestraszonej rodzinie lub kierownik oddziału przydziela na nowo obowiązki w trakcie zmiany. Jeśli zamierzamy wykorzystać model kompetencji w zarządzaniu oddziałami (Digital Twin) w ochronie zdrowia, walidacja musi odbywać się z udziałem osób, które faktycznie prowadzą takie rozmowy. Wstępne porównanie, przeprowadzone w odniesieniu do jednej kompetencji podczas kalibracji modelu, wpłynęło na projekt niniejszego badania. Było ono zbyt małe, by stanowić dowód dokładności, i nie przedstawiamy go jako takiego - wskazało nam jednak, w jakich obszarach badanie musiało być bardziej rygorystyczne.

Źródło

Metaskills

2026-08-24

Projekt badania opracowany przez firmę Metaskills we współpracy z zewnętrznym zespołem specjalistów w dziedzinie psychometrii i oceny przywództwa. Projekt opublikowano przed rozpoczęciem badań; wyniki zostaną zamieszczone na tej stronie pod tym samym adresem.

Powiązane dowody

Metodologia

Model kompetencji

18 kompetencji, cztery obszary oraz struktura, które są obecnie poddawane walidacji.

Model kompetencji
Badanie

Użyteczność szkoleń VR opartych na awatarach

W badaniu tym podano, że 47 uczestników oceniło swoje wrażenia z treningu, przy czym wskazano na pewne ograniczenia tego badania.

Użyteczność szkoleń VR opartych na awatarach
Badania

Badania i dane naukowe

Wszystko, co opublikowaliśmy, wraz z podanymi źródłami i zastrzeżeniami.

Badania i dane naukowe