Los datos sintéticos, utilizados en ciencia de datos y aprendizaje automático, son datos generados artificialmente que permiten a investigadores y desarrolladores probar y mejorar algoritmos sin poner en riesgo la privacidad ni la seguridad de los datos reales.
Qué son los datos sintéticos
Los datos sintéticos son, en esencia, datos artificiales creados de forma algorítmica. Están diseñados para imitar las características de los datos del mundo real sin incluir información auténtica. Muy usados en ciencia de datos y aprendizaje automático, los datos sintéticos permiten probar y mejorar algoritmos sin comprometer la privacidad o la seguridad de los datos reales. También pueden servir para ampliar conjuntos de datos existentes, especialmente cuando los datos originales son limitados o están sesgados.
La generación de datos sintéticos se consigue mediante métodos estadísticos, aprendizaje automático o una combinación de ambos para crear datos que reflejen la estructura y los patrones de los datos originales. Por ejemplo, las Generative Adversarial Networks (GANs), una familia de marcos de aprendizaje automático en la que dos redes neuronales compiten entre sí, se emplean con frecuencia. Las GANs funcionan con una red generadora que crea instancias sintéticas y otra, la discriminadora, que evalúa su autenticidad. Con este proceso, la generadora aprende a producir datos cada vez más realistas.
También existen varias herramientas comerciales para generar datos sintéticos, como MOSTLY AI y Hazy.
Aplicaciones reales de los datos sintéticos
Los datos sintéticos se aplican en múltiples ámbitos:
- Vehículos autónomos. Empresas como Waymo y Tesla usan datos sintéticos para entrenar sus algoritmos de conducción autónoma. Crean entornos virtuales que imitan escenarios reales, permitiendo que los algoritmos aprendan a reaccionar ante distintas situaciones sin los riesgos de las pruebas en el mundo real.
- Sanidad. Se emplean datos sintéticos para generar historiales clínicos con fines de investigación. Así, los equipos trabajan con datos que mantienen las propiedades estadísticas de los datos de pacientes reales sin comprometer su privacidad. Por ejemplo, pueden generarse imágenes realistas de órganos o tejidos para entrenar algoritmos que reconozcan patrones y detecten anomalías en imágenes reales de pacientes. Esto permite diagnósticos y planes de tratamiento más precisos y eficientes, sin requerir grandes volúmenes de datos reales. Aprende a tratar información sensible con un curso de privacidad y anonimización de datos en Python o R.
- Finanzas. Los datos sintéticos se utilizan para simular mercados financieros y así probar estrategias de trading y modelos de riesgo sin necesidad de datos reales de mercado. Por ejemplo, en modelos de riesgo de crédito, los datos sintéticos permiten simular características de prestatarios y su comportamiento crediticio, lo que ayuda a probar y afinar modelos sin exponer información sensible de clientes. Esto puede mejorar la precisión del scoring y reducir el riesgo de impago.
- Aprendizaje automático. Una forma habitual de mejorar el rendimiento y la precisión de los modelos es usar datos sintéticos. Ayudan a abordar problemas como el desbalanceo de clases y a reducir sesgos en los conjuntos de datos existentes.
¿Cuáles son las limitaciones de los datos sintéticos?
Pese a sus ventajas, los datos sintéticos también tienen limitaciones:
- Calidad. La calidad depende de los algoritmos de generación. Si no capturan bien la distribución subyacente de los datos reales, los datos sintéticos no serán representativos.
- Sesgo. Los datos sintéticos se generan a partir de supuestos, algoritmos o modelos concretos. Si esos supuestos están sesgados o no reflejan fielmente la realidad, el sesgo se traslada a los datos sintéticos y puede producir modelos o predicciones distorsionadas.
- Dificultad para capturar eventos raros. Los sucesos poco frecuentes o atípicos de los datos reales pueden no reflejarse adecuadamente en los datos sintéticos. Representar con precisión estos casos excepcionales es complejo y afecta al rendimiento de modelos entrenados solo con datos sintéticos.
- Complejidad. Generar datos sintéticos de alta calidad puede ser complejo y exigir conocimientos avanzados de técnicas de ML y recursos computacionales significativos.
Uso de datos sintéticos en proyectos
Gartner prevé que, para 2024, el 60% de los datos utilizados para desarrollar aplicaciones de aprendizaje automático y analítica serán generados artificialmente. Esta tendencia se debe al alto coste y la dificultad de recopilar y depurar datos reales.
Por ejemplo, es difícil conseguir datos reales sobre fraude bancario, cáncer de mama, coches autónomos o ataques de malware. Y, aunque los obtengas, limpiar y procesar esos datos para tareas de ML puede requerir mucho tiempo y recursos.
Además, uso la librería de Python faker para generar conjuntos de datos de prueba para bases de datos y distintas aplicaciones. Sin embargo, no resulta útil para aplicaciones de ML porque genera datos a partir de un conjunto limitado. Para aprendizaje automático, utilizo GANs condicionales para generar datos tabulares sintéticos, lo que ha mejorado el rendimiento y la estabilidad de los modelos.
Si estás abordando un problema de ML especializado, quizá necesites explorar técnicas de generación de datos sintéticos adaptadas a tus requisitos concretos. Obtener datos desactualizados en Kaggle o Accuriqin no es una solución flexible.
¿Quieres aprender más sobre IA y aprendizaje automático? Echa un vistazo a estos recursos:
Preguntas frecuentes
¿Los datos sintéticos son datos reales?
No, los datos sintéticos no son datos reales. Son datos artificiales generados algorítmicamente para imitar las características de los datos del mundo real.
¿Se pueden usar datos sintéticos para aprendizaje automático?
Sí, los datos sintéticos se usan a menudo para entrenar modelos de aprendizaje automático, sobre todo cuando los datos reales son escasos, caros de recopilar o sensibles desde el punto de vista de la privacidad.
¿Los datos sintéticos cumplen con la privacidad?
Sí. Como los datos sintéticos no contienen información personal real, pueden utilizarse sin riesgo de incumplir normativas de privacidad.
¿En qué se diferencian los datos sintéticos de los datos simulados?
Los datos simulados se crean con modelos matemáticos para replicar un escenario real, mientras que los datos sintéticos se generan algorítmicamente para imitar las características de los datos reales sin contener información auténtica.
¿Pueden los datos sintéticos reemplazar completamente a los datos reales en aprendizaje automático?
No. Los datos sintéticos pueden complementar a los datos reales, pero no sustituirlos por completo. Los datos del mundo real siguen siendo necesarios para validar y mejorar la precisión de los modelos.
¿Cómo se valida la precisión de los datos sintéticos?
La validez de los datos sintéticos puede comprobarse comparando sus propiedades y patrones estadísticos con los de los datos reales. También puede compararse la precisión de modelos entrenados con datos sintéticos frente a los entrenados con datos reales.
¿Se pueden usar datos sintéticos con todo tipo de algoritmos de aprendizaje automático?
Los datos sintéticos pueden emplearse con muchos tipos de algoritmos de ML, aunque su eficacia variará según el algoritmo y la naturaleza de los datos generados.
¿Es caro generar datos sintéticos?
Generar datos sintéticos de alta calidad puede ser complejo y requerir muchos recursos, pero existen herramientas y plataformas comerciales que lo facilitan y abaratan.
Soy un científico de datos certificado que disfruta creando aplicaciones de aprendizaje automático y escribiendo blogs sobre ciencia de datos. Actualmente me centro en la creación de contenidos, la edición y el trabajo con grandes modelos lingüísticos.




