Metaskills
INVESTIGACIÓN · GEMELO DIGITAL · METODOLOGÍA

De la conversación al perfil: hechos, no impresiones

Un perfil de competencias solo tiene valor si se puede determinar de qué elementos se compone. En esta página se describe qué considera el módulo de evaluación como prueba de que se posee una competencia determinada, qué no se considera como prueba y por qué una sola conversación satisfactoria no basta para influir en el perfil.

Metaskills metodología de evaluación, 2026

MetodologíaMetaskillsNota metodológicaNota metodológica - parte de la serie Digital Twin

¿Qué se considera un hecho probatorio?

La unidad con la que trabaja el motor no es una impresión general de la conversación. Se trata de un «evento probatorio»: un momento concreto de la transcripción en el que algo que hizo la persona demuestra una competencia en acción, que se puede citar y localizar. Hay una regla que subyace a todo lo demás en esta página: la mera aparición de un comportamiento no es suficiente. Alguien puede pronunciar las palabras de una disculpa, formular una pregunta de verificación o nombrar una emoción, pero nada de ello cuenta si se produjo en el momento equivocado, no se dirigió a la persona que tenía delante o solo se produjo tras haber sido presionado para ello. Por eso, cada hecho probatorio se somete a una evaluación de calidad, en lugar de ser simplemente una casilla que se marca.

Cuatro preguntas que nos planteamos sobre cada elemento de prueba

Espontaneidad

¿Se produjo ese comportamiento por iniciativa propia o solo después de que el avatar ejerciera una presión explícita? Ambos casos quedan registrados. No significan lo mismo.

Calendario

¿Llegó a ese punto de la conversación en el que aún podía cambiar el resultado? La frase adecuada dicha tres minutos demasiado tarde da un resultado diferente al de la frase adecuada dicha a tiempo.

Adaptarse a la otra persona

¿Se adaptó el estilo a las personas que realmente estaban presentes -a lo que necesitaban emocionalmente y a la cantidad de detalles que podían asimilar-? Una explicación bien elaborada dirigida a la persona equivocada no constituye una buena comunicación.

Proporcionalidad

¿Hubo un exceso de ello? La empatía excesiva socava la claridad con la misma certeza con la que la asertividad excesiva agrava la tensión. Un mayor grado de un comportamiento positivo no se traduce automáticamente en una mejor puntuación.

Algunos comportamientos limitan el resultado

No todo lo que se dice en una conversación tiene sentido. Existe un conjunto definido de comportamientos destructivos que actúa como un limitador, más que como una deducción: comportamientos que perjudican a la otra persona o a la relación laboral, en lugar de limitarse a no ayudar. Qué comportamientos forman parte de ese conjunto forma parte del modelo y se mantiene interno; el principio es lo que merece la pena publicar. Si uno de ellos se produce en un momento decisivo del escenario, limita la puntuación que se puede alcanzar para la competencia relacionada, y los comportamientos positivos que se den en otras partes de la misma conversación no compensan esa pérdida. Esto es deliberado. En una conversación clínica o de gestión real, una acción perjudicial no se compensa con cinco acciones positivas, y una evaluación que fingiera lo contrario estaría transmitiendo una lección errónea.

El grado de fiabilidad del perfil, expresado en voz alta

1

Datos insuficientes

El número de muestras es demasiado reducido, o bien todas proceden de un mismo tipo de situación. Se indica que la competencia aún no se puede evaluar. Preferimos señalar una laguna antes que ofrecer una cifra en la que nadie debería confiar.

2

Patrón emergente

Este comportamiento se ha observado en más de un tipo de contexto. Es suficiente para ofrecer una valoración preliminar, que se ha calificado como tal -con el grado de confianza limitado indicado en el informe, y no oculto en una nota al pie-.

3

Patrón validado

Se repite en varios contextos claramente distintos, incluyendo situaciones difíciles y no solo aquellas en las que uno se siente cómodo. Es en este punto donde el perfil empieza a merecer la pena a la hora de planificar su desarrollo.

4

Se mantiene firme ante la presión

Este comportamiento se mantiene en conversaciones muy tensas y ante la resistencia activa del avatar, sin que la calidad se vea mermada. Es el nivel más alto que asigna el modelo, y el más escaso.

Por qué no calculamos una media

Se prohíbe expresamente que el motor calcule una simple media aritmética de las puntuaciones de las sesiones. La media entre un rendimiento sólido en una conversación sencilla y uno deficiente bajo presión da como resultado una cifra mediocre que no describe ninguna de las dos situaciones, y oculta lo único que realmente importa saber: qué situaciones maneja esta persona y cuáles no. En su lugar, la agregación analiza el patrón: cuánta evidencia hay, cuán variados son los contextos, cuán difíciles fueron los escenarios y si la calidad se mantiene cuando la conversación se complica. La diversidad de contextos es un requisito, no un extra: un comportamiento confirmado únicamente en un tipo de relación y con un tipo de interlocutor no se convierte en un patrón confirmado, por mucho que se repita en ese contexto. Antes de todo esto se aplica un filtro más. La práctica guiada, en la que el alumno recibe indicaciones durante la conversación, queda excluida de los datos de evaluación. La práctica sirve para aprender; si se tuviera en cuenta, embellecería el perfil.

Dos capas y un límite definido

La evaluación se lleva a cabo en dos niveles distintos. El primero analiza una conversación completa y no hace nada más: compara la transcripción con el escenario y el perfil del avatar, y devuelve eventos de evidencia estructurados. No está permitido extraer conclusiones sobre la persona. La segunda capa opera a lo largo de numerosas conversaciones. Busca patrones, incluida la interferencia entre competencias -el caso en el que una escucha activa muy marcada enmascara discretamente un déficit real en asertividad o en la toma de decisiones- y es esta capa la que asigna el nivel de confianza y redacta la justificación del nivel de competencia. La clave radica precisamente en la distinción entre ambas. El juicio sobre una persona solo puede basarse en pruebas recopiladas a lo largo de numerosas situaciones, nunca a partir de una sola conversación. Y ahí se detiene: la arquitectura impide diagnosticar rasgos de personalidad estables y prohíbe etiquetas estáticas como «usted es una persona empática». La retroalimentación describe el comportamiento en un contexto, indica el grado de confianza que lo respalda y señala el siguiente escenario que merece la pena practicar.

Fuente

Metaskills

2026-08-24

Nota metodológica elaborada por Metaskills, en colaboración con un equipo externo de especialistas en psicometría y evaluación del liderazgo. Se trata de una nota metodológica interna, no de una publicación sometida a revisión por pares.

Relacionado pruebas

Metodología

Metodología de validación

Cómo estamos comparando las evaluaciones generadas por IA con las realizadas por evaluadores humanos independientes, y lo que aún no ha sucedido.

Metodología de validación
Producto

Digital Twin

El perfil de competencias que genera esta lógica, y cómo se traduce para un alumno y para un equipo.

Digital Twin
Estudio

Usabilidad de la formación en realidad virtual basada en avatares

Cuarenta y siete participantes evaluaron la experiencia formativa. Datos sobre la usabilidad, claramente identificados como tales.

Usabilidad de la formación en realidad virtual basada en avatares
Medir competencias a partir del comportamiento | Metaskills