Edición 206 - Servicios legales: Protección de datos & PI 2025
¿Pueden usarse datos personales para entrenar modelos de inteligencia artificial? Un análisis desde el régimen de protección de datos en Colombia

Por Isabela de la Barrera, asociada del área de Propiedad Intelectual de Holland & Knight
Aunque el avance de la inteligencia artificial resulta tan fascinante como útil en la vida cotidiana, pocas veces nos detenemos a pensar en el verdadero costo de su desarrollo: la entrega silenciosa y constante de nuestra información personal. Una de las piezas fundamentales de esta tecnología es el uso de datos, incluidos, de manera particular, los datos personales. Por ende, al ver lo rápido que se dan estos avances y lo indispensable que se han vuelto estas herramientas en el día a día, es hora de hacerse la pregunta: ¿pueden utilizarse datos personales para entrenar modelos de inteligencia artificial?
Para iniciar, es importante tener en cuenta que los modelos de IA, especialmente aquellos basados en aprendizaje automático y aprendizaje profundo, requieren grandes cantidades de datos para poder identificar patrones, realizar predicciones y ofrecer respuestas más precisas a las infinitas preguntas que se les hacen por día. Bajo este modelo de funcionamiento, los datos personales resultan valiosos ya que permiten a la IA llegar a conocer a sus usuarios y predecir sus comportamientos y preferencias.

El entrenamiento de un modelo con datos personales puede incluir desde historiales de navegación y ubicación, hasta interacciones en redes sociales o contenidos multimedia. Lo preocupante es que muchas veces esta recolección de información no es del todo transparente, ni en sus finalidades ni en sus alcances ya que se oculta bajo términos amplios como “mejorar nuestros servicios” o “personalizar la experiencia del usuario”, sin dejar claro que los datos se están utilizando para entrenar sistemas complejos de IA.
Ahora, según la Ley 1581 de 2012, el consentimiento previo, expreso e informado es la base legal principal para el tratamiento de datos personales en Colombia. A diferencia del Reglamento General de Protección de Datos (RGPD) europeo, el interés legítimo no se reconoce como base autónoma, aunque puede considerarse dentro de un análisis de proporcionalidad y necesidad.
En el uso de datos personales para entrenar modelos de inteligencia artificial, la evaluación legal y ética del tratamiento debe incluir una revisión rigurosa de su finalidad, proporcionalidad, calidad de la información y garantías ofrecidas a los titulares. Un aspecto clave es la forma en que se informa al titular sobre el uso de sus datos. Muchas plataformas, al actualizar sus políticas de privacidad, recurren a expresiones genéricas como “mejorar nuestros servicios mediante inteligencia artificial” o “entrenar modelos automatizados”, lo que dificulta entender con claridad el alcance del tratamiento y su finalidad específica. Esto plantea dudas sobre si el consentimiento otorgado puede considerarse verdaderamente informado y específico.
El uso de datos personales para entrenar IA sin base legal clara, consentimiento específico o justificación robusta basada en un interés legítimo ponderado, puede entrar en tensión con el régimen colombiano. Frente a este reto, el Gobierno radicó el Proyecto de Ley 447 de 2024 que busca transformar a Colombia en PotencIA Digital mediante el uso de datos del Estado para producir tecnología e inteligencia artificial propia, respetando la privacidad y garantizando el uso responsable de la información pública.
El entrenamiento de IA con datos personales implica riesgos como la pérdida de control y la posible reidentificación. Por eso, la propuesta legislativa promueve el uso de datos anónimos o pseudoanónimos, mayores exigencias de transparencia y evaluaciones de impacto, además de asegurar el respeto por el Habeas Data. También, contempla que las entidades públicas generen datos interoperables, útiles para decisiones de política pública y el desarrollo tecnológico nacional, sin comprometer los derechos de los titulares. El reto, en definitiva, está en encontrar un equilibrio entre el impulso a la innovación tecnológica y la garantía efectiva de los derechos fundamentales.
La clave está en equilibrar la innovación con la salvaguarda de los derechos fundamentales: sin datos seguros, no hay IA sostenible.
Junio 2025