Metaskills
INVESTIGACIÓN · DIGITAL TWIN · MARCO DE PROYECTO

Privacidad, parcialidad y el factor humano

Cuando la inteligencia artificial analiza cómo ha gestionado una persona determinada una conversación difícil, las decisiones de diseño relacionadas con dicho análisis revisten la misma importancia que el propio análisis. En esta página se describe el marco en el que se basa la herramienta Digital Twin: qué datos puede tener en cuenta la herramienta de evaluación, cómo se contrarrestan los sesgos conocidos y en qué momentos del proceso interviene el ser humano.

Metaskills marco de diseño, 2026

MetodologíaMetaskillsNota metodológicaMarco de diseño: consulte la página de seguridad para conocer qué sistemas están actualmente en funcionamiento en el entorno de producción

En qué consiste esta página y en qué no consiste

Esta página describe un marco de diseño: los principios y las restricciones según los cuales se está desarrollando el sistema de gestión de datos (Digital Twin). No se trata de una descripción del sistema de producción y no debe interpretarse como tal. Si necesita saber qué está en funcionamiento en la actualidad -dónde se almacenan los datos, quién puede acceder a ellos, qué establecen los contratos-, esa es la página de seguridad, y es la única página que consideramos la fuente fidedigna sobre el estado actual. La clave está en mantener ambas cosas diferenciadas: un principio de diseño y un control implementado son cosas distintas, y al confundirlos es como los proveedores acaban prometiendo una infraestructura que no tienen.

Los cuatro principios en los que se basa la evaluación

1

Reduzca al mínimo lo que ve el modelo

El motor de evaluación necesita el contenido de una conversación, no la identidad de la persona que la mantuvo. El principio de diseño consiste en eliminar los datos identificativos de la información que se envía al modelo, dejando únicamente un resumen despersonalizado del comportamiento.

2

Mantenga la identidad separada de los análisis

La identidad de una persona y lo que indica su perfil de competencias están concebidos para almacenarse en lugares distintos, unidos mediante una referencia, en lugar de guardarse juntos. Una filtración de datos no debería revelar ambas partes a una persona.

3

Sin datos biométricos, por diseño

El diseño excluye la identificación biométrica y la elaboración de perfiles biométricos, así como, con ello, el seguimiento ocular, el análisis de microexpresiones faciales y el vídeo de las cámaras de las gafas: la evaluación se basa en lo que se ha dicho, no en la persona que lo ha dicho. Lo que esto significa para el producto tal y como se presenta hoy en día se explica en la página de seguridad, que es el único lugar donde ofrecemos esa respuesta.

4

Únicamente con fines formativos

La Digital Twin está concebida como una herramienta de desarrollo. No se ha diseñado para servir de base a decisiones de contratación, promoción o medidas disciplinarias, y toda la lógica de la evaluación -el comportamiento en su contexto, la confianza manifestada, la ausencia de diagnóstico de la personalidad- se deriva de esa elección.

Las cuestiones que se plantean antes de todo esto

Hay dos cuestiones que se plantean antes que cualquier otra en esta página: si los datos de los clientes se utilizan para entrenar modelos y dónde se almacenan realmente dichos datos. Ambas preguntas se responden en la página de seguridad, y hemos optado deliberadamente por no repetir las respuestas aquí. Un compromiso redactado en dos lugares, en cuatro idiomas, es un compromiso que, a la larga, acabará diciendo dos cosas diferentes; por lo tanto, hay una página que las recoge y otra que se actualiza cuando se producen cambios. El marco que aquí se describe se refiere al funcionamiento previsto de la evaluación. No sustituye a la documentación técnica y contractual, y en caso de discrepancia entre ambas, prevalece la página de seguridad.

Cuatro tipos de sesgos contra los que luchamos en el diseño

Sesgo de la elocuencia

Los modelos lingüísticos favorecen a quienes hablan con fluidez. A una persona que tartamudea, que se expresa en una segunda lengua o que utiliza un lenguaje coloquial se le puede restar puntuación por la forma en que lo ha dicho, en lugar de por lo que ha dicho.

Género y prejuicios basados en estereotipos

La misma firmeza puede interpretarse como decisiva en un orador y como agresiva en otro. Los datos de entrenamiento recogen estos patrones; un motor de evaluación los reproducirá a menos que se le impida hacerlo.

Prejuicio cultural

Las normas de comunicación varían. Un modelo entrenado principalmente en una comunicación directa y de bajo contexto subestimará sistemáticamente a aquellas personas cuya cultura profesional sea más indirecta.

Alucinación evaluativa

El modo de fallo específico de esta aplicación: una valoración segura y bien redactada de algo que no ocurrió en absoluto durante la conversación.

La medida correctiva que se encarga de la mayor parte del trabajo

Cada uno de esos sesgos se contrarresta de la misma manera: la evaluación se basa en lo que se ha dicho, no en cómo ha sonado ni en quién parecía estar diciéndolo. Se indica al motor que ignore los nombres, los pronombres y los indicadores demográficos si se mencionan, y que pase por alto los errores gramaticales, las vacilaciones y los modismos para centrarse en la intención subyacente. Esa es la solución de diseño frente a los sesgos relacionados con la elocuencia y los estereotipos. En lo que respecta a las interpretaciones erróneas, la norma es más estricta. Una valoración debe citar las palabras exactas de la transcripción que la justifiquen. Si la cita no figura allí, la evaluación se rechaza en lugar de presentarse: una afirmación sobre el comportamiento de alguien que no se sustente en un momento citable no es un hallazgo, sino una suposición con buena gramática. Nada de esto elimina el sesgo. Lo que hace es eliminar las vías más fáciles que conducen a él y hacer visibles las restantes; por eso el estudio de validación se lleva a cabo comparándolo con evaluadores humanos, en lugar de con nuestras propias expectativas.

Cuando el ser humano sigue formando parte del proceso

Un modelo de evaluación, si no se supervisa, se desvía. Los criterios se relajan, un mismo comportamiento obtiene puntuaciones diferentes en marzo respecto a las de enero, y nadie se da cuenta porque no hay un punto de referencia con el que compararlo. El marco responde a esto mediante una supervisión con intervención humana: evaluadores de comportamiento cualificados revisan, de forma ciega, muestras anonimizadas de transcripciones y comparan sus valoraciones con las generadas por el sistema. Cuando hay discrepancias, se recalibran los criterios. Se trata de la misma comparación que constituye el núcleo del estudio de validación, el cual se lleva a cabo como un control continuo y no como una acción puntual. Un alumno también puede solicitar una revisión humana de los comentarios con los que no esté de acuerdo. Los comentarios automatizados que no pueden cuestionarse no son comentarios, sino un veredicto, y este sistema no está diseñado para emitir veredictos.

Lo que esta página afirma y lo que no afirma

Qué demuestra

  • Muestra los principios de diseño en los que se basa la evaluación: minimización de datos, mantener la identidad separada de los análisis, sin datos biométricos, uso únicamente formativo.
  • Nombra cuatro tipos de sesgos conocidos y las decisiones de diseño adoptadas frente a cada uno de ellos - incluida la exigencia de que toda valoración cite la transcripción.
  • Muestra en qué punto interviene la supervisión humana: auditorías cruzadas ciegas de muestras anonimizadas y revisión humana a petición.

Qué no demuestra

  • No es una descripción de la infraestructura de producción. Lo que está en funcionamiento hoy figura en la página de seguridad, y es esa página la que rige.
  • No afirma que la evaluación esté libre de sesgos. Afirma que hay sesgos concretos, nombrados, contra los que se diseña y que se están sometiendo a prueba.
  • No es un certificado de cumplimiento legal ni asesoramiento jurídico. La documentación de protección de datos se gestiona por vía contractual, no a través de una página web.

Limitaciones

Se trata de un marco de diseño, redactado en el momento en el que el diseño ya está fijado y la medición todavía no.

  • Los principios de diseño no son controles implementados. Si necesita garantías sobre el sistema actual, consulte la página de seguridad y la documentación contractual.
  • Aquí la mitigación de sesgos está diseñada y razonada, todavía no medida. No hemos realizado una auditoría formal de sesgos entre grupos demográficos, y no afirmamos haberla hecho.
  • La evaluación lee una transcripción. Eso protege frente a algunos sesgos - el aspecto, el acento, la forma de hablar - y no hace nada frente al sesgo que llevan las propias palabras.
  • La supervisión humana depende de los evaluadores. Su calibración es un límite real de lo buena que puede ser la comprobación, y es un límite que también nos alcanza a nosotros.
  • El marco se redactó para el contexto sanitario y de liderazgo. Otros contextos pueden traer consigo tipos de sesgos que no hemos tenido en cuenta.

Fuente

Metaskills

2026-08-24

Marco de diseño elaborado por Metaskills. En él se describen los principios sobre los que se basa Digital Twin, no el estado del sistema de producción; para ello, consulte la página de seguridad.

Relacionado páginas

Seguridad

Seguridad y protección de datos

Lo que está en funcionamiento actualmente en el entorno de producción: dónde se almacenan los datos, quién tiene acceso a ellos y qué es lo que contemplan los contratos.

Seguridad y protección de datos
Metodología

Cómo el comportamiento se convierte en prueba

La lógica de evaluación que estos principios condicionan: los hechos probatorios, el grado de confianza y los límites de la inferencia.

Cómo el comportamiento se convierte en prueba
Producto

Digital Twin

El perfil de competencias que genera esta lógica, y cómo se traduce para un alumno y para un equipo.

Digital Twin
Sesgo, privacidad y supervisión humana | Metaskills