Resumen
La anonimización de datos clínicos requiere equilibrar la protección de la privacidad con la preservación de la utilidad estadística. Este estudio compara tres enfoques híbridos basados en aprendizaje automático —un modelo autoencoder–GAN, un CTGAN con privacidad diferencial y un esquema simulado de aprendizaje federado con privacidad diferencial— aplicados al dataset clínico eICU-CRD. Los modelos fueron evaluados mediante métricas de similitud estructural, preservación de correlaciones y riesgo de reidentificación. Los resultados muestran que el enfoque autoencoder–GAN ofrece la mayor fidelidad estadística, mientras que CTGAN con privacidad diferencial alcanza el mejor balance entre utilidad y protección formal. El enfoque federado, aunque menos preciso, proporciona mayores garantías en escenarios distribuidos. Se desarrolló además un prototipo funcional basado en CTGAN + DP que genera datos sintéticos plausibles y cuantifica su desviación respecto al conjunto real. Los hallazgos evidencian que los modelos generativos con mecanismos formales de privacidad constituyen alternativas viables para la anonimización en salud digital, siempre que se integren en marcos robustos de gobernanza y ética del dato.
Referencias
Amiri, F., Sánchez, D., & Domingo-Ferrer, J. (2025). Enhancing efficiency and data utility in longitudinal data anonymization. Information Sciences, 704, 121949. https://doi.org/10.1016/j.ins.2025.121949
Caruccio, L., Desiato, D., Polese, G., Tortora, G., & Zannone, N. (2022). A decision-support framework for data anonymization with application to machine learning processes. Information Sciences, 613, 1–32. https://doi.org/10.1016/j.ins.2022.09.004
Congreso de la República de Colombia. (2012). Ley 1581 de 2012: Por la cual se dictan disposiciones generales para la protección de datos personales. Diario Oficial de la República de Colombia. Recuperado de https://www.funcionpublica.gov.co/eva/gestornormativo/norma.php?i=49981
European Parliament and Council of the European Union. (2016). Regulation (EU) 2016/679 of the European Parliament and of the Council of 27 April 2016 on the protection of natural persons with regard to the processing of personal data and on the free movement of such data (General Data Protection Regulation). Official Journal of the European Union. Recuperado de https://eur-lex.europa.eu/eli/reg/2016/679/oj
Girka, A., Terziyan, V., Gavriushenko, M., & Gontarenko, A. (2021). Anonymization as homeomorphic data space transformation for privacy-preserving deep learning. Procedia Computer Science, 176, 221–230.
Goldberger, A. L., Amaral, L. A. N., Glass, L., Hausdorff, J. M., Ivanov, P. C., Mark, R. G., ... Stanley, H. E. (2000). PhysioBank, PhysioToolkit, and PhysioNet: Components of a new research resource for complex physiologic signals. Circulation, 101(23), e215–e220. https://doi.org/10.1161/01.CIR.101.23.e215
Hyrup, T., Lautrup, A. D., Zimek, A., & Schneider-Kamp, P. (2025). A systematic review of privacy-preserving techniques for synthetic tabular health data. Health Data Science. https://doi.org/10.1007/s44248-025-00022-w
Jamshidi, M. A., Veisi, H., Mojahedian, M. M., & Aref, M. R. (2023). Adjustable privacy using autoencoder-based learning structure. Neurocomputing. Recuperado de https://www.sciencedirect.com/science/article/pii/S0925231223011669
Johnson, A., Pollard, T., Badawi, O., & Raffa, J. (2021). eICU Collaborative Research Database Demo (Version 2.0.1). PhysioNet. https://doi.org/10.13026/4mxk-na84
Kitchenham, B. (2004). Procedures for performing systematic reviews (Technical Report TR/SE-0401). Keele University. Recuperado de https://www.cs.keele.ac.uk/pages/tr05/
Majeed, A., & Hwang, S. O. (2020). Anonymization techniques for privacy preserving data publishing: A comprehensive survey. IEEE Access, 9, 8512–8545. https://doi.org/10.1109/ACCESS.2020.3045700
McIntosh, F., Murina, S., Chen, L., Vargas, H. A., & Becker, A. S. (2025). Keeping private patient data off the cloud: A comparison of local LLMs for anonymizing radiology reports. Imaging Informatics in Medicine. Recuperado de https://www.sciencedirect.com/science/article/pii/S3050577125000180
Nguyen, G., et al. (2025). Landscape of machine learning evolution: Privacy-preserving federated learning frameworks and tools. Artificial Intelligence Review. https://doi.org/10.1007/s10462-024-11036-2
Olatunji, I. E., Rauch, J., Katzensteiner, M., & Khosla, M. (2021). A review of anonymization for healthcare data. Big Data, 9(6), 433–454. https://doi.org/10.1089/big.2021.0169
Page, M. J., et al. (2021). The PRISMA 2020 statement: An updated guideline for reporting systematic reviews. BMJ, 372, n71. https://doi.org/10.1136/bmj.n71
Pati, S., et al. (2024). Privacy preservation for federated learning in health care. Patterns, 5(6), 100891. https://doi.org/10.1016/j.patter.2024.100891
Pollard, T. J., Johnson, A. E., Raffa, J. D., Celi, L. A., Mark, M., & Badawi, O. (2018). The eICU Collaborative Research Database, a freely available multi-center database for critical care research. Scientific Data, 5, 180178. https://doi.org/10.1038/sdata.2018.178
Puri, V., Kaur, P., & Sachdeva, S. (2023). (k, m, t)-anonymity: Enhanced privacy for transactional data. Concurrency and Computation: Practice and Experience. https://doi.org/10.1002/cpe.7020
SDV Developers. (2024). Synthetic Data Vault (SDV) documentation. Recuperado de https://docs.sdv.dev/sdv/
Sinaci, A. A., et al. (2024). Privacy-preserving federated machine learning on FAIR health data: A real-world application. Computational and Structural Biotechnology Journal, 24, 136–145. https://doi.org/10.1016/j.csbj.2024.02.014
Sopaoglu, U., & Abul, O. (2021). Classification utility aware data stream anonymization. Applied Soft Computing, 111, 107706.
Steeg, K., et al. (2024). Re-identification of anonymised MRI head images with publicly available software: Investigation of the current risk to patient privacy. iScience. Recuperado de https://www.sciencedirect.com/science/article/pii/S2589537024005091
Sun, C., van Soest, J., & Dumontier, M. (2023). Generating synthetic personal health data using conditional GANs with differential privacy. Journal of Biomedical Informatics, 143, 104404. https://doi.org/10.1016/j.jbi.2023.104404
Tian, H., Zheng, X., Zhang, X., & Zeng, D. D. (2021). ε-k anonymization and adversarial training of graph neural networks for privacy preservation in social networks. Computer Communications, 176, 139–149.
U.S. Department of Health and Human Services. (1996). Health Insurance Portability and Accountability Act (HIPAA) of 1996. Recuperado de https://www.hhs.gov/hipaa/for-professionals/privacy/index.html
Wang, Z., Myles, P., & Tucker, A. (2021). Generating and evaluating cross-sectional synthetic electronic healthcare data: Preserving data utility and patient privacy. Computational Intelligence, 37(2), 819–851. https://doi.org/10.1111/coin.12427
Xu, L., Skoularidou, M., Cuesta-Infante, A., & Veeramachaneni, K. (2019). Modeling tabular data using conditional GAN. En Advances in Neural Information Processing Systems.
Zhang, C., et al. (2025). DMRP: Privacy-preserving deep learning model with dynamic masking and random permutation. Journal of Information Security and Applications, 89, 103987. https://doi.org/10.1016/j.jisa.2025.103987

Esta obra está bajo una licencia internacional Creative Commons Atribución 4.0.

