Data masking_TDM
21/03/2022

Data Masking, ¿qué es y qué ventajas tiene?

Los datos son uno de los activos centrales de cualquier organización, pero también una de sus mayores responsabilidades. Cada vez que una copia de la base de datos de producción sale hacia un entorno de desarrollo, pruebas o formación, la información personal que contiene queda expuesta a más manos de las necesarias. El data masking existe para resolver ese problema: permite trabajar con datos que se comportan como los reales sin poner en circulación la información sensible original.

Según el informe Cost of a Data Breach de IBM, el coste medio de una filtración de datos alcanzó los 5,05 millones de dólares en 2025. Buena parte de ese riesgo se concentra donde menos se vigila, en los entornos de no producción, precisamente los que suelen manejar copias de datos reales sin protección.

En esta guía revisamos qué es el data masking, en qué se diferencia de conceptos cercanos como la anonimización, la seudonimización y la ofuscación, qué técnicas existen y, con más detalle, cómo se aplica al enmascaramiento de datos de prueba, uno de los usos donde la integridad de los datos marca la diferencia.

Guía gratuita de introducción al TDM

¿Qué es el data masking?

El data masking, o enmascaramiento de datos, es el proceso de transformar la información sensible de una base de datos para proteger su confidencialidad manteniendo su utilidad. El resultado es un conjunto de datos nuevo, con el mismo formato, la misma estructura y el mismo sentido que el original, pero del que resulta imposible recuperar la información real.

La idea de fondo es sencilla. Un nombre sigue pareciendo un nombre, un número de tarjeta sigue teniendo la longitud y el formato de una tarjeta, una fecha sigue siendo una fecha coherente. Los sistemas que consumen esos datos no notan la diferencia y siguen funcionando con normalidad, pero ninguna persona que acceda a ellos puede identificar al titular real.

Dos propiedades definen un buen enmascaramiento. La primera es que preserva el formato de los datos originales, de modo que las aplicaciones que los procesan no necesitan cambios en su lógica. La segunda es que, en la mayoría de las técnicas, el proceso no permite revertir el dato para llegar al valor original. Estas dos características son las que convierten al data masking en una herramienta habitual allí donde se necesitan datos con estructura realista sin exponer información personal, como el desarrollo y las pruebas de software.

Data masking, anonimización, seudonimización y ofuscación

Estos cuatro términos aparecen a menudo juntos y a veces se usan como sinónimos, pero conviene ordenarlos porque describen cosas distintas.

La ofuscación de datos es el término más amplio. Engloba todos los procesos orientados a transformar información sensible para que no sea accesible por personas no autorizadas. El data masking es una de las técnicas que caben dentro de la ofuscación, junto con otras como el cifrado o la tokenización.

El data masking es una de esas técnicas de ofuscación. Reemplaza los datos originales por valores ficticios que conservan formato y coherencia, y se emplea sobre todo cuando se necesita mantener la información utilizable para pruebas, análisis o desarrollo.

La anonimización describe el resultado, no la técnica. Un dato está anonimizado cuando se ha suprimido de forma irreversible cualquier posibilidad de identificar a la persona a la que pertenece. Se genera así un conjunto de datos único y nuevo, sin vuelta atrás. Es el objetivo que muchas técnicas de masking persiguen.

La seudonimización se diferencia de la anterior en un punto clave, es reversible. Los datos sensibles se sustituyen por seudónimos o tokens y el proceso queda cifrado por una clave que permite recuperar el dato original. El resultado son dos conjuntos, uno con la información seudonimizada y otro con la real. El RGPD la reconoce como medida de protección, pero no la considera equivalente a la anonimización, porque el dato sigue existiendo y puede reidentificarse con la clave.

En resumen, la ofuscación es el paraguas, el data masking es una técnica dentro de él, la anonimización es el resultado irreversible que se busca en muchos casos y la seudonimización es una variante reversible sujeta a clave.

¿Qué datos sensibles se enmascaran?

Un dato sensible es cualquier información que, por permitir identificar a una persona o entidad, requiere protección especial. La clasificación concreta varía según el país y la normativa, y el artículo 9 del RGPD detalla categorías de especial protección, pero hay un conjunto que se considera privado de forma prácticamente universal:

  • Nombre completo
  • Documento de identidad (DNI, NIE, pasaporte)
  • Teléfono
  • Correo electrónico
  • Dirección postal
  • Cuenta bancaria
  • Tarjetas de débito o crédito
  • Matrícula del vehículo (relevante, por ejemplo, en aseguradoras)
  • Datos médicos que puedan ayudar a identificar a la persona
  • Cualquier otro dato que permita localizar o singularizar a un individuo

El primer paso de cualquier proyecto de enmascaramiento consiste, de hecho, en localizar dónde vive esta información dentro de los sistemas. Volveremos sobre ello más adelante.

¿Qué tipos de Data Masking existen?

Una vez que conocemos qué datos debemos proteger es fundamental diferenciar entre los distintos tipos de Data Masking que existen:

  • Data Masking Estático

Parte de una copia de la base de datos de producción y genera un conjunto de datos enmascarado y persistente. La información conserva su contexto y su integridad referencial, de modo que puede reutilizarse tantas veces como haga falta en entornos de pruebas o desarrollo. Es la opción natural cuando se necesita un dataset coherente y estable con el que trabajar.

  • Data Masking Dinámico

Actúa sobre los datos en tránsito, en tiempo real. Reemplaza la información confidencial en el momento de la consulta y deja el dato original intacto en reposo, revelando más o menos información según el perfil que accede. Es útil para controlar el acceso a datos en producción, pero no produce un conjunto reutilizable para pruebas. Por ese motivo, para entornos de prueba icaria trabaja con enmascaramiento estático, que es el que entrega un dataset coherente y aprovechable a lo largo del ciclo de desarrollo.

También puede interesarte: Encuentra los datos que necesitas para probar

Técnicas de Data Masking

Teniendo claro los aspectos anteriores, vamos a conocer las distintas técnicas de Data Masking que podemos encontrarnos.

Bajo el enmascaramiento conviven varias técnicas. Cada una ofrece un equilibrio distinto entre seguridad, utilidad y reversibilidad, y en la práctica suelen combinarse según el tipo de dato y el nivel de protección que se busca.

  • Sustitución. Reemplaza el dato real por un valor ficticio con apariencia realista. Un nombre como «Álvaro Pérez» se cambia por otro nombre plausible, de modo que el registro sigue teniendo sentido sin comprometer a nadie.
  • Barajado (shuffling). Utiliza los valores reales de una columna pero los reordena entre registros. El conjunto sigue pareciendo real y mantiene sus propiedades estadísticas, pero se rompe la correspondencia con el individuo original.
  • Anulación o eliminación. Convierte el dato en un valor nulo o inexistente para quien no está autorizado a verlo. Es una técnica sencilla, útil cuando el dato no aporta nada al entorno de destino.
  • Cifrado. Transforma la información mediante algoritmos, de forma que solo quien dispone de la clave puede acceder al contenido. Es una de las técnicas más robustas, aunque también de las más costosas en rendimiento.
  • Codificación aleatoria (scramble). Mezcla los caracteres del dato en un orden aleatorio para que no se revele el contenido original. Es una técnica básica, adecuada solo para ciertos tipos de campo.
  • Tokenización. Sustituye el dato sensible por un token sin significado que puede usarse en los sistemas sin exponer el original. A diferencia del cifrado o el hashing, permite recuperar el valor real bajo condiciones controladas, lo que la hace habitual en entornos financieros.
  • Hashing con salt. Aplica una función de hashing y añade un valor aleatorio (salt) a cada entrada. Así, dos datos idénticos generan hashes distintos, lo que dificulta los ataques que buscan patrones o coincidencias.
  • Perturbación. Introduce ruido controlado en los valores, por ejemplo modificando cifras o fechas de manera sistemática. Los resultados siguen siendo válidos para análisis, pero se dificulta la identificación directa.
  • Generación de datos sintéticos. Crea datos ficticios que mantienen las características y patrones estadísticos de los originales sin contener información personal. Permite generar tantas copias como se necesiten a partir de un dato semilla.
  • Reducción o minimización. Elimina o resume los detalles que no son necesarios para el propósito del entorno de destino, conservando solo lo relevante (por ejemplo, el código postal en lugar de la dirección completa). Reduce la superficie de datos personales, pero por sí sola no anonimiza, porque los valores que se conservan pueden actuar como cuasi-identificadores y permitir la reidentificación si se cruzan con otras fuentes. Por eso rara vez se usa aislada, se combina con otras técnicas y se evalúa frente al riesgo de reidentificación.

Ventajas del Data Masking


Aplicar enmascaramiento de datos aporta beneficios que van más allá del cumplimiento normativo:

  • Reduce la superficie de exposición. Al eliminar el acceso directo a los datos originales, el impacto de un incidente o de un acceso no autorizado se limita de forma notable, también dentro de la propia organización.
  • Facilita el cumplimiento normativo. Permite trabajar con datos en entornos no protegidos o de desarrollo respetando marcos como el RGPD o el estándar PCI DSS, al blindar los datos personales reales.
  • Mantiene el valor de los datos. Los conjuntos enmascarados siguen siendo útiles para pruebas, análisis, desarrollo y aprendizaje automático, de modo que la organización sigue aprovechando su información sin renunciar a la protección.
  • Preserva el formato. Al conservar la estructura original, los sistemas que consumen los datos siguen funcionando sin cambios en su lógica ni en su diseño.
  • Es escalable y configurable. Un mismo conjunto de políticas de enmascaramiento puede aplicarse sobre múltiples bases de datos, definiéndose una sola vez.

El data masking en entornos de prueba

Para desarrollar y validar software con calidad hacen falta datos que se parezcan a los de producción. El problema es que copiar producción tal cual hacia desarrollo, pruebas o formación significa poner datos personales reales en manos de perfiles (desarrollo, QA, soporte) que no necesitan verlos. Ese es el punto ciego donde se concentra buena parte del riesgo, y donde el enmascaramiento de datos de prueba (también llamado disociación de datos) resuelve la tensión entre necesitar datos realistas y no poder exponer los reales.

Un enmascaramiento de datos de prueba bien hecho transforma los datos originales en otros que parecen reales pero no lo son, y que pueden compartirse con usuarios internos y externos sin preocuparse por el RGPD (o normativas similares) ni por una posible brecha. El efecto sobre el desarrollo es directo, se testea más rápido, se reducen los cuellos de botella asociados a la espera de datos y, por la semejanza con los datos reales, el software resultante se ajusta mejor a la lógica de negocio.

El reto de la integridad referencial

La dificultad técnica del enmascaramiento de datos de prueba no está en cambiar un valor por otro, sino en hacerlo de forma coherente en todo el sistema. Si un cliente se enmascara con un identificador en una tabla, ese mismo identificador tiene que enmascararse igual en todas las tablas y aplicaciones donde aparezca. De lo contrario, las relaciones entre datos se rompen y el conjunto deja de servir para probar.

Esto es la integridad referencial, y mantenerla entre distintas aplicaciones es lo que separa una herramienta de enmascaramiento real de un simple reemplazo de campos. En arquitecturas enterprise, donde un mismo dato viaja por decenas de sistemas y muchas de sus relaciones no están declaradas formalmente en la base de datos, conservar esa coherencia es la parte difícil del problema.

Cómo se aborda un proyecto de enmascaramiento de datos de prueba

Un proyecto de enmascaramiento de datos de prueba sigue una secuencia ordenada. Estos son los pasos habituales:

  • Documentación y seguimiento. Se recopila la documentación disponible y se establecen las reuniones de seguimiento del proyecto.
  • Inventario de información sensible. Se identifica qué datos son sensibles y deben protegerse.
  • Sincronización del metamodelo. Se sincroniza el metamodelo de las bases de datos, que describe su estructura y relaciones.
  • Mapa de datos sensibles. Se ejecuta e itera el mapa que localiza dónde reside la información sensible dentro de los sistemas.
  • Configuración de los campos disociables. Se configuran los campos identificados en el mapa que deben enmascararse.
  • Ejecuciones controladas en modo depuración. Se lanzan las primeras ejecuciones sin persistencia para detectar errores de configuración.
  • Ejecuciones completas en depuración. Se ejecuta el proceso completo, todavía en modo depuración, y se comprueba el resultado.
  • Correcciones e iteraciones. Se ajusta la configuración de los disociadores y se atienden nuevas necesidades detectadas.
  • Puesta en producción. Con una instalación estable, se despliega el entorno definitivo y se configura el servicio.

El modo depuración es una parte central del proceso. La primera ejecución casi siempre revela ajustes pendientes, disociadores mal configurados o incompatibilidades con sistemas concretos, y es el momento de corregirlos antes de pasar a ejecuciones completas con persistencia.

En esta fase también se optimiza el rendimiento, estudiando las tablas que más tardan (normalmente las más grandes), revisando sus claves primarias, particionando las tablas oportunas y ajustando los parámetros de conexión. Estas optimizaciones son las que permiten completar disociaciones de grandes volúmenes de registros en plazos ajustados.

icaria TDM demostración

Cómo icaria TDM aplica el data masking a los datos de prueba

icaria TDM es la plataforma de gestión de datos de prueba de icaria Technology. La plataforma es capaz de generar datos reales para pruebas fiables: datos que se comportan como los de producción, disociados de la información sensible y con la integridad referencial intacta entre aplicaciones.

La solución va más allá de reemplazar campos. Estas son las capacidades que la diferencian de una herramienta que se limita a enmascarar:

  • Mapa de datos sensibles. Antes de enmascarar, icaria TDM localiza, clasifica y sigue el rastro de la información sensible dentro de la organización, un paso esencial para saber qué proteger y evitar el desgobierno del dato. ¿Quieres saber más acerca de la localización de datos sensibles? Chequea nuestro artículo.
  • Integridad referencial entre aplicaciones. El enmascaramiento se propaga de forma coherente por todos los sistemas donde viaja un mismo dato, de modo que el conjunto resultante sigue siendo válido para probar.
  • Automatización. Reduce el tiempo necesario para preparar y entregar datos de prueba seguros, lo que ayuda a acelerar el ciclo de desarrollo (CI/CD) sin comprometer la protección ni el cumplimiento.
  • Integraciones. Se conecta con plataformas diversas para encajar en los procesos de desarrollo ya existentes.

El resultado es que los equipos disponen de los datos que necesitan, en el momento en que los necesitan y tantas veces como haga falta, con la información sensible protegida de principio a fin.

Preguntas frecuentes

¿El data masking y la anonimización son lo mismo?

No exactamente. El data masking es una técnica de transformación de datos, mientras que la anonimización describe un resultado, el de suprimir de forma irreversible la posibilidad de identificar a una persona. Muchas técnicas de masking persiguen ese resultado, pero no todas lo alcanzan.

¿El data masking es reversible?

Depende de la técnica. La mayoría de las técnicas de enmascaramiento producen datos irreversibles. Otras, como la tokenización, permiten recuperar el valor original bajo condiciones controladas, y la seudonimización es reversible mediante una clave.

¿El data masking ayuda a cumplir con el RGPD?

Sí. Al eliminar el acceso a los datos personales reales en entornos no protegidos, el enmascaramiento facilita el cumplimiento del RGPD y de otros marcos como el PCI DSS. La responsabilidad del cumplimiento sigue siendo de la organización, pero el masking reduce de forma sustancial la exposición.

¿Conviene enmascaramiento estático o dinámico para entornos de prueba?

El estático. Genera un conjunto de datos persistente y coherente que puede reutilizarse a lo largo del desarrollo. El dinámico protege datos en tránsito en producción, pero no entrega un dataset reutilizable para pruebas.

¿Qué es la integridad referencial en el enmascaramiento?

Es la propiedad que hace que un mismo dato se enmascare igual en todas las tablas y aplicaciones donde aparece. Sin ella, las relaciones entre datos se rompen y el conjunto deja de ser útil para probar software.

¿Se pueden usar datos enmascarados en producción?

El data masking está pensado para entornos de no producción: pruebas, desarrollo, formación y análisis. En producción se emplean otros controles, como el enmascaramiento dinámico, que regula el acceso sin alterar el dato en reposo.

Más sobre icaria TDM

Si tu organización necesita datos de prueba realistas sin exponer información sensible, icaria TDM puede ayudarte a conseguirlo con la integridad referencial intacta. Solicita una demostración sin compromiso y descubre lo que la plataforma puede hacer por tus entornos de desarrollo.

Compartir
Financiado por
Certificados y reconocimientos
magnifiercrossmenuchevron-down