Comparación de los resultados de una evaluación basada en la inteligencia artificial con las evaluaciones realizadas por personas
Publicamos el plan del estudio antes de dar a conocer los resultados. El estudio consiste en comparar las conclusiones extraídas por la inteligencia artificial sobre una conversación determinada con las conclusiones de evaluadores humanos independientes relativas a esa misma conversación. La metodología ya se ha elaborado y ahora nos espera la fase de pruebas: en esta página se describe lo que tenemos previsto hacer y, una vez publicados los resultados, esta página se actualizará en esta dirección.
Metaskills estudio de validación - diseño
¿Por qué publicar un diseño antes de conocer los resultados?
¿Cómo se estructura una comparación?
El mismo guion, dos veces
El participante mantiene una conversación estructurada con un avatar basado en inteligencia artificial y, al mismo tiempo, desarrolla el mismo escenario con un actor real que actúa siguiendo parámetros idénticos. Solo cambia una variable; todas las demás permanecen inalteradas.
Dos evaluadores independientes de un grupo de personas
Los evaluadores cualificados analizan las transcripciones sin tener acceso a los resultados generados por la inteligencia artificial. Se trata precisamente de la independencia: un evaluador que haya consultado la respuesta generada por la máquina ya no constituye un elemento de control.
Plantillas de hojas de observación
Los evaluadores utilizan hojas de evaluación específicas, elaboradas en función de las competencias objeto de evaluación, y se guían por los mismos criterios, límites y niveles de dominio que establece el modelo, lo que garantiza que tanto las personas como las máquinas respondan a la misma pregunta.
Compare y, a continuación, elabore un informe
Los resultados generados por la inteligencia artificial y las interpretaciones de los comportamientos se comparan con las evaluaciones de esas mismas conversaciones realizadas por personas. Los resultados, incluidos los casos de discrepancias, se publicarán en esta dirección.
Seis competencias en la primera ronda
Capacidad de adaptación
Adaptar el enfoque a medida que evoluciona la situación, sin perder de vista el resultado que realmente importa.
Escucha activa
Captar, analizar y reflejar lo que realmente se ha dicho.
Asertividad
Mantener una postura y establecer límites sin que la conversación se intensifique.
Empatía
Percibir lo que siente la otra persona y responder en consecuencia.
Enfoque basado en la evidencia
Basar una postura en las pruebas, en lugar de en el estatus o el volumen.
Claridad perspicaz
Hacer que un tema complejo resulte comprensible para la persona que se encuentra allí presente.
Quiénes participan y por qué es importante
Lo que esta página afirma y lo que no
Qué demuestra
- Muestra un diseño de estudio terminado: la comparación con evaluadores humanos, las competencias incluidas, el grupo de participantes y las herramientas de evaluación.
- Muestra lo que consideramos una prueba justa de una evaluación basada en inteligencia artificial - y queda por escrito antes que los resultados.
Qué no demuestra
- No muestra que la evaluación de la IA coincida con el criterio humano. Los ensayos aún no se han llevado a cabo.
- En esta página no hay resultados. Cualquier cifra que apareciera aquí describiría el diseño, no un resultado.
- No es una validación psicométrica de todo el modelo de competencias. La primera ronda abarca seis de las dieciocho competencias.
- No dice nada sobre la eficacia del aprendizaje ni sobre el cambio de comportamiento en el trabajo. Son cuestiones distintas y requieren estudios distintos.
Limitaciones que ya conocemos
Algunas podemos corregirlas en la siguiente ronda. Otras son inherentes a este tipo de estudio, y fingir lo contrario echaría por tierra el sentido de publicar el diseño.
- Los ensayos no se han llevado a cabo. Todo lo que figura aquí es un plan.
- La primera ronda abarca seis competencias de dieciocho. No nos dirá si las doce restantes se evalúan de forma fiable.
- Los evaluadores humanos no son la verdad de referencia. También discrepan entre sí, y la coincidencia entre la IA y el evaluador es prueba de consistencia, no de acierto.
- El grupo de participantes está formado por profesionales sanitarios. Los resultados no se trasladan automáticamente a otros sectores.
- Un actor humano que interpreta un escenario no es lo mismo que una conversación real con consecuencias reales. La comparación aísla la evaluación, no lo que hay en juego.
- Se trata de investigación interna, no de un estudio revisado por pares, y etiquetaremos los resultados de la misma manera cuando lleguen.
Fuente
Metaskills
2026-08-24
Diseño del estudio elaborado por Metaskills junto con un equipo externo de especialistas en psicometría y evaluación del liderazgo. El diseño se publicó antes del inicio de los ensayos; esta página se actualizará con los resultados en la misma dirección.
Relacionado pruebas
El modelo de competencias
Las 18 competencias, los cuatro ámbitos y la estructura que se están validando en este caso.
El modelo de competenciasUsabilidad de la formación en realidad virtual basada en avatares
Un estudio en el que se ha informado de lo siguiente: 47 participantes que han valorado la experiencia formativa, con indicación de sus propias limitaciones.
Usabilidad de la formación en realidad virtual basada en avataresDigital Twin
El perfil de competencias que genera esta lógica, y cómo se traduce para un alumno y para un equipo.
Digital Twin