Metaskills
INVESTIGACIÓN · DIGITAL TWIN · EL PROCESO DE VALIDACIÓN ESTÁ EN MARCHA

Comparación de los resultados de una evaluación basada en la inteligencia artificial con las evaluaciones realizadas por personas

Publicamos el plan del estudio antes de dar a conocer los resultados. El estudio consiste en comparar las conclusiones extraídas por la inteligencia artificial sobre una conversación determinada con las conclusiones de evaluadores humanos independientes relativas a esa misma conversación. La metodología ya se ha elaborado y ahora nos espera la fase de pruebas: en esta página se describe lo que tenemos previsto hacer y, una vez publicados los resultados, esta página se actualizará en esta dirección.

Metaskills estudio de validación - diseño

ValidaciónMetaskillsInvestigación en cursoDiseño del estudio publicado con antelación: ensayos aún no finalizados

¿Por qué publicar un diseño antes de conocer los resultados?

Cualquier proveedor puede afirmar que su IA coincide con el criterio de los expertos una vez que se dispone de los datos y se han descartado discretamente las variantes problemáticas. Publicar primero el método es una forma de privarnos de esa opción. Por lo tanto, en términos sencillos: los ensayos de validación que se describen a continuación aún no se han llevado a cabo. Nada de lo que figura en esta página constituye un resultado. Lo que existe a día de hoy es un diseño de estudio definitivo, un alcance definido, un grupo de participantes definido y las herramientas de evaluación que utilizarán los evaluadores humanos.

¿Cómo se estructura una comparación?

1

El mismo guion, dos veces

El participante mantiene una conversación estructurada con un avatar basado en inteligencia artificial y, al mismo tiempo, desarrolla el mismo escenario con un actor real que actúa siguiendo parámetros idénticos. Solo cambia una variable; todas las demás permanecen inalteradas.

2

Dos evaluadores independientes de un grupo de personas

Los evaluadores cualificados analizan las transcripciones sin tener acceso a los resultados generados por la inteligencia artificial. Se trata precisamente de la independencia: un evaluador que haya consultado la respuesta generada por la máquina ya no constituye un elemento de control.

3

Plantillas de hojas de observación

Los evaluadores utilizan hojas de evaluación específicas, elaboradas en función de las competencias objeto de evaluación, y se guían por los mismos criterios, límites y niveles de dominio que establece el modelo, lo que garantiza que tanto las personas como las máquinas respondan a la misma pregunta.

4

Compare y, a continuación, elabore un informe

Los resultados generados por la inteligencia artificial y las interpretaciones de los comportamientos se comparan con las evaluaciones de esas mismas conversaciones realizadas por personas. Los resultados, incluidos los casos de discrepancias, se publicarán en esta dirección.

Seis competencias en la primera ronda

Capacidad de adaptación

Adaptar el enfoque a medida que evoluciona la situación, sin perder de vista el resultado que realmente importa.

Escucha activa

Captar, analizar y reflejar lo que realmente se ha dicho.

Asertividad

Mantener una postura y establecer límites sin que la conversación se intensifique.

Empatía

Percibir lo que siente la otra persona y responder en consecuencia.

Enfoque basado en la evidencia

Basar una postura en las pruebas, en lugar de en el estatus o el volumen.

Claridad perspicaz

Hacer que un tema complejo resulte comprensible para la persona que se encuentra allí presente.

Quiénes participan y por qué es importante

El grupo de participantes está formado por profesionales sanitarios y responsables clínicos que han aceptado participar en los ensayos. Se trata de una limitación deliberada, más que de una elección por conveniencia. Las competencias comunicativas dependen del contexto. Un modelo validado a partir de ejercicios de centros de evaluación para titulados universitarios aporta muy poca información sobre un especialista que explica una decisión terapéutica a una familia asustada, o sobre un jefe de planta que reasigna tareas en mitad de un turno. Si pretendemos que el modelo Digital Twin se utilice en el ámbito sanitario, la validación debe realizarse con personas que realmente mantengan ese tipo de conversaciones. Una comparación preliminar, realizada sobre una única competencia durante la calibración del modelo, sirvió de base para el diseño de este estudio. Su tamaño era demasiado reducido para constituir una prueba de precisión y no la presentamos como tal; nos indicó en qué aspectos el estudio debía ser más riguroso.

Lo que esta página afirma y lo que no

Qué demuestra

  • Muestra un diseño de estudio terminado: la comparación con evaluadores humanos, las competencias incluidas, el grupo de participantes y las herramientas de evaluación.
  • Muestra lo que consideramos una prueba justa de una evaluación basada en inteligencia artificial - y queda por escrito antes que los resultados.

Qué no demuestra

  • No muestra que la evaluación de la IA coincida con el criterio humano. Los ensayos aún no se han llevado a cabo.
  • En esta página no hay resultados. Cualquier cifra que apareciera aquí describiría el diseño, no un resultado.
  • No es una validación psicométrica de todo el modelo de competencias. La primera ronda abarca seis de las dieciocho competencias.
  • No dice nada sobre la eficacia del aprendizaje ni sobre el cambio de comportamiento en el trabajo. Son cuestiones distintas y requieren estudios distintos.

Limitaciones que ya conocemos

Algunas podemos corregirlas en la siguiente ronda. Otras son inherentes a este tipo de estudio, y fingir lo contrario echaría por tierra el sentido de publicar el diseño.

  • Los ensayos no se han llevado a cabo. Todo lo que figura aquí es un plan.
  • La primera ronda abarca seis competencias de dieciocho. No nos dirá si las doce restantes se evalúan de forma fiable.
  • Los evaluadores humanos no son la verdad de referencia. También discrepan entre sí, y la coincidencia entre la IA y el evaluador es prueba de consistencia, no de acierto.
  • El grupo de participantes está formado por profesionales sanitarios. Los resultados no se trasladan automáticamente a otros sectores.
  • Un actor humano que interpreta un escenario no es lo mismo que una conversación real con consecuencias reales. La comparación aísla la evaluación, no lo que hay en juego.
  • Se trata de investigación interna, no de un estudio revisado por pares, y etiquetaremos los resultados de la misma manera cuando lleguen.

Fuente

Metaskills

2026-08-24

Diseño del estudio elaborado por Metaskills junto con un equipo externo de especialistas en psicometría y evaluación del liderazgo. El diseño se publicó antes del inicio de los ensayos; esta página se actualizará con los resultados en la misma dirección.

Relacionado pruebas

Metodología

El modelo de competencias

Las 18 competencias, los cuatro ámbitos y la estructura que se están validando en este caso.

El modelo de competencias
Estudio

Usabilidad de la formación en realidad virtual basada en avatares

Un estudio en el que se ha informado de lo siguiente: 47 participantes que han valorado la experiencia formativa, con indicación de sus propias limitaciones.

Usabilidad de la formación en realidad virtual basada en avatares
Producto

Digital Twin

El perfil de competencias que genera esta lógica, y cómo se traduce para un alumno y para un equipo.

Digital Twin
Validar la evaluación de IA frente a humanos | Metaskills