Anonimización Inteligente de Datos Sensibles
PDF

Palabras clave

anonimización de datos
generación de datos sintéticos
privacidad diferencial
aprendizaje federado
redes generativas adversarias (GAN)
CTGAN
inteligencia artificial en salud.

Cómo citar

García Arias , A. M. ., González Díaz, D. C. ., & González Cifuentes, H. A. . (2026). Anonimización Inteligente de Datos Sensibles . Formación Estratégica, 7(1), 101–115. Recuperado a partir de https://formacionestrategica.com/index.php/foes/article/view/245

Resumen

La anonimización de datos clínicos requiere equilibrar la protección de la privacidad con la preservación de la utilidad estadística. Este estudio compara tres enfoques híbridos basados en aprendizaje automático —un modelo autoencoder–GAN, un CTGAN con privacidad diferencial y un esquema simulado de aprendizaje federado con privacidad diferencial— aplicados al dataset clínico eICU-CRD. Los modelos fueron evaluados mediante métricas de similitud estructural, preservación de correlaciones y riesgo de reidentificación. Los resultados muestran que el enfoque autoencoder–GAN ofrece la mayor fidelidad estadística, mientras que CTGAN con privacidad diferencial alcanza el mejor balance entre utilidad y protección formal. El enfoque federado, aunque menos preciso, proporciona mayores garantías en escenarios distribuidos. Se desarrolló además un prototipo funcional basado en CTGAN + DP que genera datos sintéticos plausibles y cuantifica su desviación respecto al conjunto real. Los hallazgos evidencian que los modelos generativos con mecanismos formales de privacidad constituyen alternativas viables para la anonimización en salud digital, siempre que se integren en marcos robustos de gobernanza y ética del dato.

PDF

Referencias

Amiri, F., Sánchez, D., & Domingo-Ferrer, J. (2025). Enhancing efficiency and data utility in longitudinal data anonymization. Information Sciences, 704, 121949. https://doi.org/10.1016/j.ins.2025.121949

Caruccio, L., Desiato, D., Polese, G., Tortora, G., & Zannone, N. (2022). A decision-support framework for data anonymization with application to machine learning processes. Information Sciences, 613, 1–32. https://doi.org/10.1016/j.ins.2022.09.004

Congreso de la República de Colombia. (2012). Ley 1581 de 2012: Por la cual se dictan disposiciones generales para la protección de datos personales. Diario Oficial de la República de Colombia. Recuperado de https://www.funcionpublica.gov.co/eva/gestornormativo/norma.php?i=49981

European Parliament and Council of the European Union. (2016). Regulation (EU) 2016/679 of the European Parliament and of the Council of 27 April 2016 on the protection of natural persons with regard to the processing of personal data and on the free movement of such data (General Data Protection Regulation). Official Journal of the European Union. Recuperado de https://eur-lex.europa.eu/eli/reg/2016/679/oj

Girka, A., Terziyan, V., Gavriushenko, M., & Gontarenko, A. (2021). Anonymization as homeomorphic data space transformation for privacy-preserving deep learning. Procedia Computer Science, 176, 221–230.

Goldberger, A. L., Amaral, L. A. N., Glass, L., Hausdorff, J. M., Ivanov, P. C., Mark, R. G., ... Stanley, H. E. (2000). PhysioBank, PhysioToolkit, and PhysioNet: Components of a new research resource for complex physiologic signals. Circulation, 101(23), e215–e220. https://doi.org/10.1161/01.CIR.101.23.e215

Hyrup, T., Lautrup, A. D., Zimek, A., & Schneider-Kamp, P. (2025). A systematic review of privacy-preserving techniques for synthetic tabular health data. Health Data Science. https://doi.org/10.1007/s44248-025-00022-w

Jamshidi, M. A., Veisi, H., Mojahedian, M. M., & Aref, M. R. (2023). Adjustable privacy using autoencoder-based learning structure. Neurocomputing. Recuperado de https://www.sciencedirect.com/science/article/pii/S0925231223011669

Johnson, A., Pollard, T., Badawi, O., & Raffa, J. (2021). eICU Collaborative Research Database Demo (Version 2.0.1). PhysioNet. https://doi.org/10.13026/4mxk-na84

Kitchenham, B. (2004). Procedures for performing systematic reviews (Technical Report TR/SE-0401). Keele University. Recuperado de https://www.cs.keele.ac.uk/pages/tr05/

Majeed, A., & Hwang, S. O. (2020). Anonymization techniques for privacy preserving data publishing: A comprehensive survey. IEEE Access, 9, 8512–8545. https://doi.org/10.1109/ACCESS.2020.3045700

McIntosh, F., Murina, S., Chen, L., Vargas, H. A., & Becker, A. S. (2025). Keeping private patient data off the cloud: A comparison of local LLMs for anonymizing radiology reports. Imaging Informatics in Medicine. Recuperado de https://www.sciencedirect.com/science/article/pii/S3050577125000180

Nguyen, G., et al. (2025). Landscape of machine learning evolution: Privacy-preserving federated learning frameworks and tools. Artificial Intelligence Review. https://doi.org/10.1007/s10462-024-11036-2

Olatunji, I. E., Rauch, J., Katzensteiner, M., & Khosla, M. (2021). A review of anonymization for healthcare data. Big Data, 9(6), 433–454. https://doi.org/10.1089/big.2021.0169

Page, M. J., et al. (2021). The PRISMA 2020 statement: An updated guideline for reporting systematic reviews. BMJ, 372, n71. https://doi.org/10.1136/bmj.n71

Pati, S., et al. (2024). Privacy preservation for federated learning in health care. Patterns, 5(6), 100891. https://doi.org/10.1016/j.patter.2024.100891

Pollard, T. J., Johnson, A. E., Raffa, J. D., Celi, L. A., Mark, M., & Badawi, O. (2018). The eICU Collaborative Research Database, a freely available multi-center database for critical care research. Scientific Data, 5, 180178. https://doi.org/10.1038/sdata.2018.178

Puri, V., Kaur, P., & Sachdeva, S. (2023). (k, m, t)-anonymity: Enhanced privacy for transactional data. Concurrency and Computation: Practice and Experience. https://doi.org/10.1002/cpe.7020

SDV Developers. (2024). Synthetic Data Vault (SDV) documentation. Recuperado de https://docs.sdv.dev/sdv/

Sinaci, A. A., et al. (2024). Privacy-preserving federated machine learning on FAIR health data: A real-world application. Computational and Structural Biotechnology Journal, 24, 136–145. https://doi.org/10.1016/j.csbj.2024.02.014

Sopaoglu, U., & Abul, O. (2021). Classification utility aware data stream anonymization. Applied Soft Computing, 111, 107706.

Steeg, K., et al. (2024). Re-identification of anonymised MRI head images with publicly available software: Investigation of the current risk to patient privacy. iScience. Recuperado de https://www.sciencedirect.com/science/article/pii/S2589537024005091

Sun, C., van Soest, J., & Dumontier, M. (2023). Generating synthetic personal health data using conditional GANs with differential privacy. Journal of Biomedical Informatics, 143, 104404. https://doi.org/10.1016/j.jbi.2023.104404

Tian, H., Zheng, X., Zhang, X., & Zeng, D. D. (2021). ε-k anonymization and adversarial training of graph neural networks for privacy preservation in social networks. Computer Communications, 176, 139–149.

U.S. Department of Health and Human Services. (1996). Health Insurance Portability and Accountability Act (HIPAA) of 1996. Recuperado de https://www.hhs.gov/hipaa/for-professionals/privacy/index.html

Wang, Z., Myles, P., & Tucker, A. (2021). Generating and evaluating cross-sectional synthetic electronic healthcare data: Preserving data utility and patient privacy. Computational Intelligence, 37(2), 819–851. https://doi.org/10.1111/coin.12427

Xu, L., Skoularidou, M., Cuesta-Infante, A., & Veeramachaneni, K. (2019). Modeling tabular data using conditional GAN. En Advances in Neural Information Processing Systems.

Zhang, C., et al. (2025). DMRP: Privacy-preserving deep learning model with dynamic masking and random permutation. Journal of Information Security and Applications, 89, 103987. https://doi.org/10.1016/j.jisa.2025.103987

Creative Commons License

Esta obra está bajo una licencia internacional Creative Commons Atribución 4.0.

Descargas

Los datos de descargas todavía no están disponibles.