Resumo
- O EDPB diz que uma abordagem do Tribunal de Justiça de 2019 sobre mecanismos de busca pode ser pertinente para dados sensíveis coletados de forma incidental e residual no scraping para IA, mas exige quatro condições avaliadas caso a caso.
- O projeto conecta essa possibilidade restrita a controles antes e depois da coleta, durante o desenvolvimento do modelo e após sua implantação. A consulta pública termina em 30 de outubro de 2026.
Uma página aberta ao público pode conter dados pessoais que um desenvolvedor de IA não pretendia coletar. O que fazer se uma coleta em larga escala encontrar informações sobre a saúde, as opiniões políticas, a origem étnica ou a orientação sexual de alguém? O Comitê Europeu para a Proteção de Dados (EDPB) trata do problema no projeto das Diretrizes 03/2026 sobre scraping da web para o desenvolvimento de IA generativa. O prazo para comentários vai até 30 de outubro, às 23h59 CET. O documento ainda está em consulta: não é uma regra final nem uma nova exceção ao GDPR.
O ponto de partida é separar o tratamento intencional do dado residual. Se uma organização busca coletar deliberadamente categorias especiais de dados pessoais, o artigo 9(2) do GDPR exige uma exceção específica, além de uma base legal prevista no artigo 6. O projeto analisa em separado a situação em que esses dados aparecem apesar das medidas destinadas a impedir a coleta. O EDPB considera que parte do raciocínio do Tribunal de Justiça no caso de 2019 GC e outros contra a CNIL (C‑136/17) pode ser relevante. A decisão tratou de indexação e remoção de resultados por mecanismos de busca, não do treinamento de modelos de IA generativa. Portanto, o projeto não a transforma em autorização pronta para desenvolvedores de modelos.
O texto propõe quatro condições para uma análise individual. O tratamento precisa ter semelhanças relevantes com a atividade de um mecanismo de busca considerada pelo Tribunal; os dados devem ser incidentais e residuais, e não objeto de tratamento deliberado; o controlador deve ter dificuldade ou impossibilidade de avaliar se os dados estão presentes e impedir sua coleta; e deve adotar medidas, dentro de suas responsabilidades, poderes e capacidades, para impedir a divulgação. Se os fatos não atenderem a esses critérios, o raciocínio relativo aos mecanismos de busca não cria uma saída geral para as exigências do artigo 9.
Os controles dão conteúdo prático à palavra “incidental”. Antes da coleta, o controlador deve definir critérios precisos, aplicar filtros e excluir sites que estruturalmente contenham dados sensíveis; o projeto cita como exemplo sites usados principalmente por menores. Depois da coleta, dados residuais devem ser apagados imediatamente ou assim que forem identificados. Um pedido individual deve levar à exclusão quando apresentar indícios plausíveis de que os dados estão proibidos pelo artigo 9.
Durante o desenvolvimento do modelo, o controlador deve testar a extração de informações e a resistência a ataques à privacidade, além de filtrar respostas que revelem esses dados. Após a implantação, o fornecedor do sistema de IA deve monitorar continuamente as saídas, reforçar filtros ou restringir instruções se surgirem informações sensíveis e considerar o desaprendizado do modelo — ou um método de efeito equivalente — quando o avanço tecnológico permitir.
O EDPB também espera que o controlador demonstre que as quatro condições se aplicam e que as medidas adotadas são pertinentes e eficazes. A verificação periódica deve cobrir tanto o desenvolvimento quanto o uso; controles ineficazes exigem medidas adicionais ou diferentes. A prestação de contas passa a depender de registros operacionais coerentes: critérios de coleta, fontes excluídas, exclusões realizadas, testes do modelo, incidentes nas saídas e providências posteriores. Chamar a coleta de “incidental” não substitui essa evidência.
Essa análise de categorias especiais é diferente da avaliação de legítimo interesse. O fato de uma página ser pública não significa que a pessoa consentiu com o scraping de seus dados para uma finalidade específica, e a ausência de uma regra robots.txt não é consentimento para os fins do GDPR. Restrições impostas pelo site ainda podem influenciar as expectativas razoáveis das pessoas na ponderação do legítimo interesse. Esses sinais afetam os fatos da análise, mas não substituem a base legal nem os requisitos do artigo 9.
Na prática, o projeto desloca a pergunta para antes da coleta. Se dados sensíveis são difíceis de reconhecer apenas porque a organização faz uma coleta indiscriminada, essa dificuldade não prova, por si só, que o tratamento seja residual. A abordagem proposta pergunta se o controlador tomou medidas viáveis para impedir a coleta, se consegue detectar e remover o que escapou dos filtros e se consegue evitar que o modelo reproduza a informação. A consulta permite que organizações e pessoas questionem a clareza desses critérios antes da versão final do EDPB.
Fontes
Briefing para membros
Contexto aprofundado do perfil
Faça login com o nível de assinatura correto para desbloquear o briefing completo e as notas das fontes.
Apenas para Strategic Circle
Strategic Circle
Aberto a todos os leitores. Desbloqueie Briefings de perfil após se inscrever e fazer login.
Junte-se ao Strategic CircleSomente para Leadership Alliance
Leadership Alliance
Para proprietários e gestores qualificados de ativos de PI; faça login para desbloquear os briefings da Leadership Alliance.
Junte-se ao Leadership Alliance
