La gestión de datos de prueba (TDM, por sus siglas en inglés) determina la velocidad y la fiabilidad del desarrollo de software. Cuando los equipos no confían en los datos de sus entornos de prueba, el testing pierde valor y aparecen cuellos de botella. En su informe 3 Steps to Improve Test Data Management for Software Engineering (enero de 2025), Gartner propone tres pasos para mejorar esta práctica. Desde icaria Technology, compartimos ese marco, con una diferencia relevante en el modo de generar los datos que explicamos más adelante.
La gestión de datos de prueba es el conjunto de prácticas y herramientas que preparan y entregan los datos que necesitan los entornos de prueba. Su objetivo es que esos datos estén disponibles cuando el equipo los pide, que sean coherentes con el caso de prueba y que cumplan con la normativa de protección de datos.
Igual que evolucionan los entornos de prueba y los modelos de datos, las prácticas de TDM también requieren revisión continua. Según Gartner, el uso de datos personales en entornos de desarrollo y prueba es una preocupación persistente para los responsables de ingeniería de software, sobre todo con normativas como el RGPD y la CPRA, cuya aplicación se ha intensificado.
Un TDM deficiente actúa como cuello de botella y erosiona la confianza de los equipos en la calidad de sus productos. Cuando los desarrolladores esperan datos conformes que se ajusten a sus requisitos de prueba, se generan restricciones de productividad.
Los datos de Gartner ayudan a dimensionar el problema:
A esto se suma la presión regulatoria. Las autoridades europeas de protección de datos acumulan sanciones por miles de millones de euros desde 2022 (encuesta de DLA Piper citada por Gartner). Un buen TDM reduce ese riesgo al evitar que la información sensible circule por entornos menos protegidos.

Gartner recomienda que desarrolladores, testers y equipos de dirección traten la provisión de datos de prueba como una cuestión estratégica. Un TDM efectivo mejora la eficiencia de las pruebas y la entrega, refuerza la gestión de riesgos al evitar el uso indebido de datos sensibles en entornos menos seguros, y mejora la experiencia de desarrollo.
La experiencia de desarrollo pesa cada vez más en la retención de talento. Según una encuesta de Stack Overflow recogida en el informe, para más del 53% de los desarrolladores la prioridad principal es que se cuide esa experiencia. Un TDM que hace el testing más fluido contribuye directamente a ese objetivo.
Los productos, el código y los modelos de datos evolucionan sin pausa, y las relaciones entre datos no solo viven en las bases de datos, también en el propio código fuente. Por eso Gartner propone integrar el TDM en los procesos actuales de desarrollo y prueba, con apoyo de equipos de plataforma o de capacitación.
Para sostener esa mejora en el tiempo, el informe sugiere un ciclo iterativo tipo PDCA (Plan, Do, Check, Act):
Como tercer paso, Gartner recomienda promover el uso de datos sintéticos en las pruebas de software. El informe describe los datos sintéticos como una clase de datos generados de forma artificial en lugar de obtenidos de observaciones del mundo real, y los propone como sustituto seguro cuando el dato de producción es caro, no está disponible, está desequilibrado o no se puede usar por motivos regulatorios.
Gartner enumera varias técnicas de generación que ofrecen los distintos fabricantes: lógica basada en reglas, redes generativas antagónicas (GAN), grandes modelos de lenguaje (LLM) y autoencoders variacionales (VAE). Cada técnica tiene sus propios requisitos de entrada y resulta óptima para un caso de uso diferente.
Aquí es donde conviene detenerse, porque no todas las técnicas de generación resuelven el mismo problema.

No todos los casos de uso de generación de datos sintéticos son iguales. Generar un fichero de pruebas para un entorno de Big Data implica poca variación de tecnologías y pocos tipos de datos, con un volumen enorme de registros. Las aplicaciones de soporte al negocio plantean lo contrario: el volumen no es el obstáculo, y la dificultad está en las estructuras, porque los modelos de datos son complejos, las dependencias entre datos son numerosas y con frecuencia intervienen varias tecnologías de persistencia a la vez.
Pensemos en generar un cliente sintético para probar la contratación de un producto nuevo. En ese proceso participan las aplicaciones de CRM, facturación, cobros y provisión del servicio. Cada una tiene su base de datos, con su propia tecnología, su modelo y sus dependencias con las demás. En este tipo de aplicaciones la técnica de generación condiciona el resultado. La fidelidad que exige el testing integrado se obtiene partiendo de una estructura real y coherente. Generar registros de la nada, sin ese anclaje, difícilmente reproduce la integridad referencial entre sistemas que estas pruebas necesitan.
Por eso icaria TDM genera los datos sintéticos a partir de la estructura real. Sobre una estructura de datos coherente, creada por las propias aplicaciones, se aplican reglas de generación que modifican solo los atributos necesarios. Así se obtienen clientes completos, con sus cuentas, contratos, movimientos, servicios, facturas y reclamaciones, para varias aplicaciones a la vez y con distintas tecnologías de base de datos, manteniendo la coherencia que requieren las pruebas que afectan a varios sistemas.
El resultado es lo que llamamos real world data: datos muy parecidos a los del mundo real, despojados de la información sensible que no debería salir de producción. Reproducen el comportamiento de los datos reales sin contener información personal identificable, y presentan las características que las pruebas de aplicaciones de negocio necesitan:
El detalle del método de generación de icaria TDM (el dominio de datos, la instancia real, el catálogo de reglas y el flujo de autoservicio en tres pasos) está desarrollado en nuestro artículo sobre qué son los datos sintéticos y qué utilidades tienen.

Es el conjunto de prácticas y herramientas que preparan y entregan datos disponibles, coherentes y conformes para los entornos de prueba de software.
Llevar el TDM a la estrategia de negocio, invertir en gestión y orquestación continuas con un ciclo de mejora tipo PDCA, y generar datos sintéticos para acelerar la automatización.
Los datos sintéticos genéricos se generan de forma artificial, a veces desde cero. El real world data de icaria parte de una estructura de datos real y coherente, sobre la que se aplican reglas de generación, de modo que conserva profundidad histórica, relaciones complejas e integridad referencial entre aplicaciones, sin información personal identificable.
Porque las pruebas que afectan a varias aplicaciones a la vez necesitan integridad referencial entre sistemas. Esa coherencia se obtiene con más fidelidad cuando se parte de una estructura real que cuando se generan registros sin ese anclaje.
Gartner, 3 Steps to Improve Test Data Management for Software Engineering, Ross Power, Alys Woodward, Jim Scheibmeir, Joachim Herschmann, Thomas Murphy, 28 de enero de 2025 (ID G00818798).
GARTNER es una marca registrada y de servicio de Gartner, Inc. y/o sus filiales. Todos los derechos reservados. Las opiniones de Gartner recogidas en este artículo son interpretaciones y paráfrasis realizadas por icaria Technology y no representan un respaldo de Gartner a icaria Technology ni a ningún producto. Gartner no avala a ningún proveedor, producto o servicio mencionado en sus publicaciones.
