Mapa de ciclo de vida de datos en IA

Resumen

Dibujar un mapa de ciclo de vida de datos convierte cada riesgo ético en un punto físico con un nombre humano al lado. Si trabajas con sistemas de IA y quieres ubicar dónde se esconden los riesgos de privacidad, esta guía te muestra los 10 pasos, las cuatro zonas de frontera y el peligro del join.

Un mapa traza el recorrido completo de un dato, desde que entra al sistema hasta que se elimina. Pensalo como un paquete postal: quieres saber quién lo tocó, a dónde fue y si alguien lo abrió. Sin ese mapa, los riesgos se esconden entre equipos, sistemas o contratos, y alguien puede recolectar datos personales sin saberlo o cruzarlos con otra tabla hasta crear información identificable.

¿Cuáles son los 10 pasos del ciclo de vida de datos en IA?

Para cualquier sistema con IA, el recorrido tiene diez pasos mínimos y cada uno es a la vez un punto de control técnico y ético [00:53].

  1. Recolección: define dónde entran los datos, con qué base legal y si el usuario lo sabe. Una ciudad que instala cámaras para gestionar tráfico debe preguntarse si los ciudadanos lo saben y si la ley lo permite.
  2. Clasificación: etiqueta qué es público, privado o sensible. Si combinas el desempeño de empleados con su nombre y un número de identificación, esa mezcla ya es información personal identificable.
  3. Limpieza y preparación: corriges errores y detectas sesgos históricos. Un modelo que predice deserción escolar con datos de barrios desatendidos castigará a esos mismos barrios si nadie atrapa el sesgo aquí.
  4. Anonimización o seudonimización: enmascarar identificadores cuando no son estrictamente necesarios.
  5. Almacenamiento y control de acceso: quién ve qué, por cuánto tiempo y con registro de quién accedió.
  6. Entrenamiento del modelo: qué versión de datos usó y quién lo aprobó. Sin ese registro no puedes rastrear la causa ni defenderte.
  7. Validación y prueba de equidad: un scoring crediticio puede funcionar bien en promedio pero negar préstamos a ciertos códigos postales. Las métricas de equidad lo detectan antes de producción.
  8. Despliegue y monitoreo: los datos cambian con el tiempo, lo que se conoce como deriva de datos, y el rendimiento se degrada. Un sistema médico con IA necesita un doctor humano revisando sus sugerencias.
  9. Registro de salidas y explicabilidad: cada decisión debe poder explicarse a una persona no técnica. Esto es la IA explicable.
  10. Retención y eliminación: los datos tienen fecha de vencimiento. Regulaciones como el GDPR dan derecho a solicitar un borrado [04:15].

¿Qué son las cuatro zonas de frontera donde se pierde el control?

Estos diez pasos se organizan en cuatro zonas donde normalmente se pierde el control de los datos [04:35].

  • Zona de producto: lo que el usuario ve. ¿Sabe qué datos entrega realmente?
  • Zona de datos: la materia prima. En América Latina, la ley 25.326 de Argentina o la LGPD de Brasil definen qué se permite.
  • Zona de modelo: donde los datos se vuelven inteligencia. Si usas un modelo externo como Llama o DeepSeek, importa con qué datos fueron entrenados.
  • Zona de proveedores: cada proveedor es un punto donde los datos salen de tu control. Si un hospital usa un chatbot externo y un paciente comparte síntomas, ¿a dónde van esos datos?

Cada vez que los datos cruzan una zona, debería existir una regla explícita.

¿Por qué el join es el paso más peligroso para la privacidad?

El join significa combinar dos conjuntos de datos, y es probablemente el paso más riesgoso [05:52]. Un dataset hospitalario tiene IDs y condiciones de salud, sin nombres. Un registro gubernamental tiene IDs y nombres. Si los unes, cada condición de salud tiene nombre y apellido. El dato personal no existía hasta que hiciste el join.

¿Cuántos datos bastan para identificar a una persona? La investigación muestra que tres atributos (código postal, fecha de nacimiento y género) pueden ser suficientes para identificar a alguien. Incluso las inferencias cuentan: si el sistema deduce una condición de salud a partir de recetas bajas en azúcar, eso ya es un dato personal.

¿Qué metadatos hacen auditable cada punto del mapa?

Los metadatos son la etiqueta del paquete, no el contenido [06:47]. Cada punto necesita como mínimo un identificador único, marca de tiempo, base legal, actor responsable con nombre y apellido, clasificación del dato, destino de transferencias y transformaciones aplicadas.

Sin esto no puedes responder tres preguntas básicas: quién recolectó el dato, por qué se compartió y dónde está ahora. Y algo clave: cada etapa necesita un dueño con nombre y apellido, porque si todos somos responsables, entonces nadie lo es.

¿Qué es una evidencia válida en una auditoría de datos? Una evidencia debe estar fechada, firmada por un responsable, ser específica y almacenarse de forma segura. En lugar de "se verificó el sesgo", escribe algo concreto: "encontramos una brecha del 12% en los códigos postales X, Y y Z, evaluado el 10 de mayo".

¿Cómo se ve el mapa en un caso real de bot de soporte?

Aterricemos todo en un bot que procesa tickets de cliente [07:50]. Sus entradas son el ticket desde un formulario o CRM, el historial de interacciones, una base de conocimientos y datos del producto vía API. El cliente envía el ticket, se limpia y normaliza, se enriquece con contexto, se construye el prompt, el modelo genera un borrador, pasa por controles y recién ahí se envía o va a un humano.

El punto más crítico es la detección y redacción de información personal. Si alguien escribe "Me llamo María, tarjeta termina en cuatro, cinco, seis, siete", eso nunca debería llegar en texto plano a un modelo externo. Se detecta, se reemplaza por marcadores y recién ahí sale.

¿Cuáles son los tres puntos de riesgo y sus controles?

El caso concentra tres riesgos principales, cada uno con controles concretos [08:52].

  • Captura de entrada (privacidad): el usuario comparte datos personales sin darse cuenta. Controles: filtrado de datos personales, consentimiento activo y retención limitada.
  • Procesamiento del modelo (seguridad): las conversaciones pueden usarse para entrenamiento. Controles: barreras de seguridad, permisos por rol y revisión humana.
  • Almacenamiento y proveedores (terceros): cuando los datos salen, pierdes el control. Controles: minimización, límite de retención y auditoría de proveedores.

Analizados juntos, si alguien pregunta por medicamentos para el corazón: primero se captura una señal de salud, luego el modelo aprende de ella y por último puede terminar en manos de terceros. Todo esto cabe en una hoja simple con riesgo, paso del proceso, dueño, acción, fecha, evidencia y próxima revisión.

Ahora te toca a ti. Juan, de Colombia, trabaja en una fintech que quiere usar IA para aprobar créditos con historial financiero, ubicación geográfica y comportamiento digital. Identifica en qué paso aparece un riesgo de privacidad, un posible join peligroso y propón un control concreto. Dejame en los comentarios tu análisis o un caso real en el que hayas trabajado.