Skip links
Data scraping, límites y posibilidades según las autoridades

Data scraping, límites y posibilidades según las autoridades

El data scraping o scraping de datos es una técnica automatizada que permite, de forma automatizada, recorrer una web recopilando y almacenando información para luego utilizarla para diversos fines, entre otros, crear bases de datos, entrenar algoritmos, monitorizar usuarios, generar leads o conocer el sentimiento u opinión de los usuarios sobre algo, alguien o una entidad.

El data scraping o scraping de datos es una técnica automatizada que permite, de forma automatizada, recorrer una web recopilando y almacenando información para luego utilizarla para diversos fines, entre otros, crear bases de datos, entrenar algoritmos, monitorizar usuarios, generar leads o conocer el sentimiento u opinión de los usuarios sobre algo, alguien o una entidad.

Sin duda es una herramienta que plantea un sinfín de posibilidades y oportunidades, pero también riesgos de cumplimiento ya que entre toda esa información que “raspa” o “scrapea”, casi siempre también se recogen datos personales. Al usar herramientas de scraping debemos tener en cuenta su impacto en la privacidad y en el derecho a la protección de los datos de las personas afectadas.

Por lo anterior nos encontramos con que cada vez son más las autoridades de control, o autoridades de protección de datos, que tienen puesto el punto de mira en esta técnica, en cómo usarla de forma adecuada y en tener claros sus límites. Y sí, efectivamente más ahora con la entrada en juego de la inteligencia artificial y su potencialidad para estos fines.

En este artículo, te contamos más sobre estos posicionamientos de las autoridades, y en particular, de las líneas rojas que han marcado.

¿Qué dicen las autoridades de protección de datos sobre data scraping?

El posicionamiento de las autoridades de protección de datos es cada vez más consistente en determinar los riesgos supone para el derecho a la protección de datos de los usuarios, en particular de aquellos que interactúan en redes sociales y páginas de acceso público. Sobre su posicionamiento tenemos dos tipos, el primero uno individual y completamente de Estado, y otro conjunto con un efecto menos directo pero de mayor impacto global.

Posicionamientos conjuntos de Autoridades de Protección de Datos sobre data scraping

Primera declaración conjunta en el marco de la GPA. 2023

En agosto de 2023, en el marco de la Asamblea Global de Privacidad (GPA por sus siglas en inglés), varias autoridades de control se pronunciaron mediante la primera Declaración Conjunta en torno a la protección de datos en redes sociales e internet, estableciendo bases para que las personas y las organizaciones identifiquen acciones sobre data scraping con la finalidad de mitigar riesgos, entendiendo que las técnicas de data scraping vulneran los derechos de las personas e incluso, podrían conllevar un incumplimiento normativo.

Segunda declaración conjunta en el marco de la GPA. 2024

En esta misma línea, y dando seguimiento a la Declaración de 2023, en el marco de la GPA celebrada en el mes de octubre de 2024, las autoridades de protección de datos realizaron una segunda Declaración Conjunta en la que, luego de haber consultado a la industria, comparten buenas prácticas y orientaciones más precisas para que empresas y redes sociales garanticen la protección de los datos de sus usuarios frente a las técnicas automáticas de extracción y procesamiento de datos personales.

Entre otras, las autoridades de Argentina, Canadá, España, México y Colombia, han suscripto esta última Declaración Conjunta.

Puntos clave de la Declaración Conjunta sobre data scraping de octubre de 2024

En esta última Declaración Conjunta se resalta que:

  • Aunque los datos personales estén a disposición del público general, siguen estando cubiertos por la normativa reguladora de protección de datos. Algo que cobra especial relevancia, por ejemplo, en lo que respecta a redes sociales y espacios similares
  • Los responsables de tratamiento deben implementar medidas de seguridad que garanticen la protección de la privacidad y revisar y actualizar esas medidas, teniendo en cuenta el desarrollo y los avances tecnológicos.
  • Si bien las PYME suelen no tener los mismos recursos financieros o capacidades técnicas que las organizaciones globales, esto no las exime de su responsabilidad de protegerse contra el scraping ilegal. Muchas pequeñas y medianas empresas almacenan grandes cantidades de datos personales de acceso público, que deberían estar protegidos mediante una combinación de múltiples capas de controles técnicos y procedimentales contra el data scraping.
  • El mero hecho de que exista un acuerdo o relación contractual, no legaliza de por sí la práctica de data scraping. Además, la transparencia debe quedar garantizada en todo caso y, cuando sea necesario, será preciso requerir el consentimiento del interesado
  • No se puede ignorar el papel cada vez más determinante de las inteligencias artificiales y, si bien pueden aportar beneficios, también conllevan importantes riesgos, por lo que es indispensable cumplir la legislación que las regula.

Pronunciamiento de las Autoridades de Control en Europa sobre el data scraping.

Hasta ahora, en Europa, hay tres ejemplos claros -aunque no son los únicos- de países cuyas autoridades de control nacionales se han pronunciado sobre el data scraping y su impacto en la protección de datos.

Países Bajos – guía sobre los riesgos legales del data scraping

La Autoridad Holandesa de Protección de Datos (Autoriteit Persoonsgegevens) publicó la guía sobre los riesgos legales del data scraping, que parte de la base de aclarar que, prácticamente siempre que se utilicen estas técnicas, habrá datos personales implicados y, por tanto, aplica el RGPD.

La autoridad entiende que el uso de scraping puede suponer importantes riesgos en materia de privacidad, puesto que se recopilan grandes cantidades de información sobre numerosos aspectos de la vida de una persona, pudiendo incluir datos especialmente protegidos, como información sobre salud o antecedentes penales.
Este organismo considera que es muy difícil encontrar una legitimación. No es viable el consentimiento pero tampoco ve con buenos ojos el interés legítimo. La postura de la autoridad holandesa es rígida.

Su guía plantea algunos ejemplos en los que la extracción de datos podría llegar a ser legal: información extraída de webs de noticias públicas, de tiendas online o de foros públicos. También ocurriría esto con información que las personas hacemos manifiesta e inequívocamente pública, pero siempre que quede totalmente clara esa intencionalidad.

Italia – guía sobre el data scraping

La autoridad de control italiana ha centrado su guía sobre data scraping en cómo proteger los datos personales que se utilizan para entrenar modelos de IA. Su postura es más flexible y plantea la opción de poder recurrir a un interés legítimo para justificar estos tratamientos, si bien aún está pendiente que emita una decisión definitiva al respecto. Con lo que sí cuenta es con algunas medidas de seguridad recomendables para limitar o restringir un mal uso del scraping:

  • Creación de áreas reservadas, para eliminar datos de disponibilidad pública
  • Inclusión de cláusulas anti-scraping en los términos de servicio web
  • Seguimiento de tráfico web, para identificar flujos anormales de datos
  • Medidas específicas contra bots

Francia – en su plan de acción de inteligencia artificial

Francia dispone de un plan de acción relacionado con la inteligencia artificial, que incluye referencias al data scraping. La CNIL, la autoridad de control francesa, presta especial atención a la práctica llevada a cabo por ciertos fabricantes de modelos de IA que extraen datos de Internet para entrenar sus sistemas, considerando prioritarios:

  • La protección de los datos disponibles públicamente en la web
  • La protección contra prejuicios y discriminación
  • Los desafíos de seguridad que plantea usar estas herramientas
  • Las consecuencias para los derechos de las personas sobre sus datos

Como recurso adicional y muestra de su compromiso, la CNIL también dispone de un documento en el que señala cuatro pasos fundamentales que deben seguirse para diseñar un sistema de IA que tenga en cuenta la protección de datos personales. Están desarrollados en el documento, pero se resumen en valorar:

  • El objetivo del sistema que desea desarrollar
  • El método a utilizar y cómo afectará a los conjuntos de datos
  • La validez de decisiones tomadas previamente
  • Las fuentes de datos empleadas y, dentro de ellas, la selección de los datos estrictamente necesarios, teniendo en cuenta su utilidad y el impacto que pueden tener sobre los derechos y libertades de las personas.

Opinión del Comité Europeo de Protección de datos en modelos de IA. Mención hacía el data scraping

El Comité Europeo de Protección de Datos publicó, el 18 de noviembre de 2024, su Opinión sobre modelos de IA, y menciona de forma directa el data scraping como una práctica común para recopilar datos personales con fines de entrenamiento de modelos de IA, y hace énfasis en la necesidad de mitigar los riesgos asociados a esta técnica. Entre las recomendaciones específicas la más relevante es el de excluir el scraping de publicaciones concretas que presenten riesgos particulares, ciertas categorías de datos o fuentes, y sitios web que se opongan claramente al scraping. Además, el CEPD sugiere definir criterios precisos de recolección y adoptar medidas para eliminar o anonimizar datos personales antes de la etapa de entrenamiento.

En cuanto a la base legal para el scraping, el CEPD no descarta la posibilidad de utilizar el interés legítimo como legitimación para el entrenamiento de modelos de IA con datos obtenidos mediante data scraping. Sin embargo, enfatiza la necesidad de realizar una evaluación caso por caso elaborando un análisis de intereses legítimos conforme el art. 5.1.f del RGPD.

El CEPD planea emitir directrices específicas sobre web scraping en el contexto de la IA generativa en el futuro.

¿Qué líneas rojas sacamos en claro de estos pronunciamientos?

Si has llegado hasta aquí, ya sabes que el uso de estas técnicas implicará, casi siempre, tratamiento de datos personales, y, por tanto, debemos cumplir con la normativa de protección de datos, cuando no además con la de inteligencia artificial. Cumplir será una tarea compleja pero viable siempre que se aplique la privacidad por diseño y por defecto, y en el caso concreto sea viable su legitimación; ahora bien, podría ser una pesadilla en particular si  si hay datos sensibles en juego que, con carácter general, estará prohibido utilizar.

A modo de resumen de todo lo anterior, es indispensable tener en cuenta, que:

  1. Al realizar data scraping, con toda probabilidad estarás tratando datos personales
  2. Cuando se tratan datos personales debemos necesariamente cumplir con la normativa de protección de datos  (RGPD en Europa + LOPDdgg en España; la normativa nacional en Latinoamérica). Este cumplimiento partirá de un cumplimiento desde el diseño, sobre todo de tener una buena legitimación para el tratamiento.
  3. Pueden existir casos de uso potencialmente legales, como los ya comentados pero para poder hacer uso de ellos el cumplimiento ha de ser estricto, documentado y muy bien sustentado.
  4. Se debe analizar el impacto que el data scraping puede tener en las personas, sus derechos y libertades y en posibles sesgos, discriminaciones y prejuicios. Según el caso de la correspondiente evaluación de impacto en la protección de datos.
  5. Si usas el interés legítimo tendrás que contar con análisis de intereses legítimos.
  6. Si además usas del data scraping para entrenar, o cualquier otra tarea relacionada con una inteligencia artificial, tendrás también que cumplir la legislación de inteligencia artificial. Ahí es nada.

En definitiva,

Aún son muchos los interrogantes que se plantean a la hora de analizar la legalidad y los riesgos de hacer data scraping. En cualquier caso, como se suele decir: “siempre es mejor prevenir que curar”, y para ello la privacidad desde el diseño es indispensable.

En este artículo y en los recursos analizados, cuentas con pinceladas de gran importancia sobre estas técnicas, pero si necesitas asesoría especializada, en Dataseg nos encantará echarte una mano. Puedes contactarnos a través de este formulario