Conoce Atico34 - Solicita presupuesto
Inteligencia artificialLOPDGDD & RGPD

Datos sintéticos: Qué son y cómo les afecta el RGPD

El avance de la tecnología y el crecimiento del volumen de datos han hecho que la protección y privacidad de la información sean cada vez más importantes. En este contexto, los datos sintéticos han surgido como una alternativa para procesar, almacenar y analizar información sensible sin comprometer la privacidad. En las siguientes líneas explicamos qué son los datos sintéticos y en qué medida están regulados por el RGPD (Reglamento General de Protección de Datos).

¿Qué son los datos sintéticos?

Los datos sintéticos son conjuntos de datos generados artificialmente que imitan los datos reales en términos de estructura y características estadísticas, sin copiar información exacta o identificable de individuos reales. Su principal objetivo es crear un recurso que simule de la manera más fiel posible los datos reales, para que puedan usarse en pruebas, simulaciones y análisis de datos sin vulnerar la privacidad de la información o exponer datos sensibles.

A diferencia del proceso de anonimización de datos, en el que se eliminan o alteran identificadores personales en un conjunto de datos real, los datos sintéticos son completamente ficticios y generados a partir de algoritmos que mantienen la distribución estadística de los datos originales. Por ello se están empezando a usar sobre todo en sectores que requieren grandes volúmenes de datos para entrenar sistemas de inteligencia artificial (IA), probar software o realizar investigaciones sin vulnerar la privacidad de las personas.

Cómo decimos, los datos sintéticos no son datos aleatorios, sino que crean para reproducir los datos reales para que al usarse, permitan obtener resultados o conclusiones similares a las que se obtendrían con datos reales en casos de uso específicos.

Por ejemplo, no se trata de escoger nombres y apellidos, junto a un código postal de manera aleatoria, para crear una base de datos de supuestos clientes, sino de «enriquecer» ese dato del código postal con el nivel de gasto asociado a esa área o su nivel de renta.

¿Cómo se crean los datos sintéticos?

Para generar datos sintéticos se usan algoritmos avanzados y técnicas que permiten replicar la complejidad de los datos reales sin afectar a la privacidad de los mismos, es decir, que, aunque se utilicen datos reales para crear datos sintéticos, la privacidad de los primeros no se verá comprometida (o no debería hacerlo si el proceso se ha realizado adecuadamente).

Si bien, la mayoría de datos sintéticos se producen manualmente usando bases de datos SQL para extraer y anonimizar datos y limpiarlos posteriormente usando lenguajes de programación estándar, actualmente se ha empezado a extender el uso de otras técnicas más avanzadas, basadas en machine learning. Entre ellas, las siguientes:

  • Redes generativas antagónicas (GAN): Esta técnica se basa en la competencia entre dos redes neuronales: un generador, que produce datos sintéticos, y un discriminador, que evalúa si los datos creados son reales o falsos. A través de múltiples iteraciones, el generador mejora su capacidad de producir datos más realistas al intentar “engañar” al discriminador. Las GAN son ampliamente utilizadas en sectores que requieren simulaciones precisas, como el de imágenes médicas, debido a su habilidad para generar datos detallados y de alta calidad.
  • Codificadores automáticos variacionales (VAE): Este tipo de modelo genera datos sintéticos a través de la compresión y descompresión de la información en un espacio de características. Los VAE crean una representación comprimida de los datos reales y, desde esa representación, producen datos nuevos que mantienen las características estadísticas del conjunto original. A diferencia de los GAN, los VAE se emplean en situaciones donde se requiere una estructura de datos similar a la real, como en el análisis de lenguaje y datos secuenciales.
  • Modelos basados en transformadores: Estas arquitecturas, conocidas por su uso en procesamiento de lenguaje natural (PLN), pueden aplicarse también para crear datos sintéticos. Los transformadores procesan información mediante un mecanismo de atención que capta relaciones contextuales complejas en los datos, lo que da como resultado una generación de datos coherente y contextual. Son ideales para crear secuencias de datos en aplicaciones como simulación de conversaciones o análisis de patrones de conducta.

A través de estos y otros métodos se pueden crear datos sintéticos precisos, cada uno con aplicaciones específicas que favorecen distintos tipos de datos y niveles de complejidad en la simulación.

Beneficios de los datos sintéticos

Entre los principales beneficios del uso de datos sintéticos destacan:

  • La protección de la privacidad desde el diseño, puesto que no contienen datos reales y se minimiza el riesgo de vulneraciones de datos personales en pruebas, entrenamientos y análisis.
  • Las empresas pueden desarrollar y entrenar sistemas de IA sin necesidad de acceder a grandes volúmenes de datos reales, que no solo pueden ser difíciles de obtener por cuestiones legales, sino porque en la realidad no existen en el volumen necesario para llevar a cabo un análisis efectivo.
  • En el desarrollo del software, permiten realizar pruebas exhaustivas en escenarios controlados, especialmente cuando es inevitable utilizar datos reales por limitaciones legales o éticas.
  • Contribuyen a reducir los costes y agilizar los procesos asociados a la recolección y almacenamiento seguro de la información.
  • En sectores con una regulación más estricta de la privacidad, como la salud, las finanzas o el transporte, permiten llevar a cabo análisis y pruebas sin comprometer la seguridad de los datos reales.

Desafíos y limitaciones de los datos sintéticos

Los datos sintéticos también presentan una serie de desafíos y limitaciones que se deben conocer:

  • Aunque los datos sintéticos intentan imitar datos reales, mantener un alto grado de realismo sin perder la protección de la privacidad es complejo. Modelar comportamientos humanos complejos y dinámicos con precisión representa aún un reto.
  • En algunos casos, los datos sintéticos no pueden captar todos los matices de los datos reales, lo que puede limitar su utilidad en ciertos análisis. La falta de generalización es especialmente importante en sistemas de IA que se entrenan con estos datos, que pueden quedar limitados.
  • Si los datos sintéticos están demasiado cerca de los datos reales en términos de estructura o patrones, existe un riesgo potencial de reidentificación.
  • La creación de datos sintéticos supone una elevada complejidad técnica que requiere de conocimientos avanzados y recursos computacionales significativos, lo que no siempre está al alcance de todas las organizaciones.

Aunque los datos sintéticos pueden mitigar riesgos de privacidad, es fundamental asegurarse de que su creación y uso cumplen con las correspondientes normativas y estándares éticos aplicables, ya que hay organismos que consideran que estos datos deben someterse a una evaluación de impacto en la privacidad.

Datos sintéticos y RGPD

El RGPD no menciona directamente los datos sintéticos, pero dado que para su creación se usan, en algunos casos, datos personales reales, se produce una actividad de tratamiento de datos que sí debe cumplir la normativa. Por lo tanto, se deben tener en cuenta los siguientes aspectos del RGPD:

  • Evaluación de impacto: Cuando los datos sintéticos se crean a partir de datos personales reales de categorías especiales, puede ser necesario llevar a cabo una evaluación de impacto de protección de datos (EIDP) para garantizar que el proceso de creación no supone riesgos para la privacidad de los interesados.
  • Finalidad del tratamiento: Si los datos sintéticos se generan a partir de datos personales, se debe informar a los interesados de esta finalidad de uso.
  • Riesgos de reidentificación: Se deben implementar medidas de seguridad que aseguren que los datos sintéticos no pueden vincularse de ninguna manera a personales identificables.

Cabe señalar que el uso de datos sintéticos contribuye a cumplir el principio de minimización de datos, en tanto en cuanto elimina la necesidad de trabajar directamente con datos personales en diferentes escenarios.

Al crear datos sintéticos a partir de conjuntos de datos reales, se deben aplicar medidas de seguridad en base al riesgo de reidentificación que pueda existir. Por lo tanto, es necesario evaluar la anonimidad de los datos sintéticos obtenidos a partir de un conjunto de datos reales, para asegurar que estos no contienen información de personas identificadas o identificables.

Por el contrario, si los datos sintéticos no se han creado de conjuntos de datos reales, es decir, son completamente sintéticos, no sería de aplicación el RGPD.

tarifas proteccion datos 

Aplicaciones de los datos sintéticos

Los datos sintéticos tienen múltiples usos y aplicaciones, especialmente dentro del ámbito de la inteligencia artificial y el aprendizaje automático; el uso de datos sintéticos permite llevar a cabo procesos de simulación, prueba y validación de modelos de IA cuando no hay datos reales en la cantidad necesaria o incluso no existen, ya que la situación que se quiere proyectar y simular no se ha producido en el mundo real o no hay suficientes históricos de datos para poder sacar conclusiones adecuadas.

Asimismo, los datos sintéticos también se usan para verificar y validar sistemas que representan situaciones anómalas o atípicas, escenarios límite o que tienen muy poca probabilidad de suceder, para poder hacer proyecciones futuras y estar preparados si esos escenarios eventualmente se producen.

En relación con la economía de los datos y la creación de espacios de datos, donde las organizaciones pueden intercambiar este tipo de información, los datos sintéticos se convierten en un elemento valioso para evitar la filtración de información confidencial de las organizaciones que participan en estos espacios.

Además de estos usos, hay otras aplicaciones específicas para los datos sintéticos, entre las que destacamos las siguientes:

  • Desarrollo y prueba de algoritmos, ya que permiten probar y validar sistemas o modelos de IA antes de introducir datos reales.
  • Entrenamiento de modelos de aprendizaje automático sin comprometer la privacidad de la información.
  • Realización de pruebas de seguridad informática y de resiliencia al simular ciberataques en entornos controlados, para identificar vulnerabilidades y desarrollar estrategias de defensa acordes.
  • En investigaciones médicas y científicas sin poner en riesgo la privacidad de información sensible como son los datos de salud.
  • En la prueba y verificación de software y aplicaciones, para identificar situaciones y comportamientos de los usuarios y poder responder ante ellas.
  • Simulaciones en el ámbito empresarial e industrial para realizar análisis de riesgos y escenarios hipotéticos, que ayuden a tomar decisiones informadas futuras.

En definitiva, el uso de datos sintéticos puede ayudar a responsables y encargados del tratamiento a aplicar un enfoque con el que puede ser más fácil cumplir con el RGPD, especialmente dentro del ámbito del desarrollo de IA y modelos de aprendizaje automático, así como otros tipos de soluciones de software, puesto que se evita el uso de datos reales o, como mínimo, se limita la exposición de información sensible.

Así mismo, al usar datos sintéticos se pueden suplir datos reales insuficientes o que ni siquiera existen, para poder simular y proyectar posibles escenarios en diferentes ámbitos, que ayuden a prepararse de cara al futuro y poder así tomar decisiones informadas en función del escenario que se produzca.