A escala muda o problema
Ler uma decisão no portal de um tribunal e reunir milhares de decisões pelo nome das partes não são apenas versões rápida e lenta da mesma atividade. A coleta em escala cria um objeto novo: uma base pesquisável, combinável e capaz de revelar relações que não estavam visíveis em cada documento isolado.
É por isso que “estava na internet” responde tão pouco. Uma página pode ser pública sem que todo conteúdo esteja livre de proteção de dados pessoais, sigilo, direitos de terceiros ou condições de acesso. A automação acrescenta volume; a indexação acrescenta contexto; o uso posterior acrescenta consequência.
A LGPD é particularmente clara sobre dados pessoais de acesso público: o tratamento deve considerar a finalidade, a boa-fé e o interesse público que justificaram a disponibilização. Mesmo quando o dado foi tornado manifestamente público pelo titular, permanecem os princípios e os direitos previstos na lei. Publicidade pode influenciar a análise; não a encerra.
O caso de uso vem antes do robô. Monitorar processos indicados por clientes, pesquisar precedentes sobre uma tese, treinar um modelo e publicar um perfil sobre determinada pessoa são projetos juridicamente diferentes, ainda que partam das mesmas páginas.
A fonte não é só um endereço
Antes de programar a coleta, procure o canal que o órgão ou a entidade preparou para aquele tipo de acesso. API, conjunto de dados abertos ou arquivo oficial para download tende a ser mais estável e mais fácil de auditar do que a extração da interface destinada à consulta humana. Também reduz a chance de sobrecarregar o serviço ou interpretar como dado uma parte meramente visual da página.
Termos de uso, licenças, políticas e limites técnicos precisam ser lidos no contexto. Um arquivo robots.txt, sozinho, não decide a licitude da coleta. Tampouco toda restrição contratual tem o mesmo alcance. Mas contornar autenticação, barreiras técnicas ou limites deliberados é bem diferente de consumir um canal oficial documentado.
Quando a origem é um repositório de terceiros, surge uma pergunta adicional: aquela cópia reproduz de modo completo e atual o documento oficial? Sem resposta, a facilidade de acesso pode esconder um acervo truncado, desatualizado ou sem autoridade.
Este roteiro não resolve sozinho direitos autorais, proteção de bases de dados, sigilo ou o efeito contratual de cada termo de uso. Esses temas dependem do conteúdo e da relação concreta. A regra prática é não tratar LGPD como se fosse a única camada jurídica da coleta.
O dado coletado precisa carregar sua história
Em pesquisa jurídica, um texto sem origem e data envelhece mal. Pode ter sido corrigido, substituído, revogado ou simplesmente extraído com erro. A resposta produzida por uma IA será tão confiável quanto a possibilidade de voltar ao documento que a sustenta.
Cada item relevante deveria conservar um núcleo de proveniência:
- órgão ou entidade de origem e URL oficial;
- data da coleta e data do documento;
- identificador, versão ou número oficial;
- método de acesso e transformações realizadas, como OCR ou anonimização;
- regra de atualização ou descarte.
Hash e cópia do original podem ser necessários quando a integridade tiver peso, mas não devem virar armazenamento indefinido por padrão. A mesma disciplina que preserva a fonte deve limitar o excesso: coletar só o necessário, controlar acesso, separar original de texto processado e eliminar o que perdeu a finalidade.
Essa trilha também melhora a qualidade da pesquisa. Um sistema que distingue acórdão, minuta, notícia e ato revogado erra menos do que outro que transforma tudo em fragmentos de texto equivalentes.
Uma base não recebe licença para todos os usos futuros
É comum o projeto começar como busca interna e, depois, alguém sugerir usar o mesmo material para treinar uma IA ou oferecer uma consulta pública. Essa passagem não é um detalhe de produto.
Na busca interna, o acervo pode permanecer sob acesso limitado e sempre remeter à fonte. Treinamento ou ajuste de modelo tende a multiplicar cópias, ampliar retenção e dificultar correção ou eliminação. A publicação aumenta a audiência. O perfilamento pode reunir fatos dispersos para tirar conclusões sobre pessoas. Cada mudança altera riscos, agentes envolvidos e expectativas dos titulares.
Quando houver dados pessoais, é preciso identificar a hipótese legal aplicável ao caso. Consentimento é apenas uma possibilidade. O legítimo interesse, quando cabível, exige finalidade concreta, necessidade e balanceamento com os direitos e as expectativas do titular; não se aplica ao tratamento de dados pessoais sensíveis. Se o resultado alimentar decisão unicamente automatizada que afete interesses de uma pessoa, o art. 20 da LGPD também precisa entrar no desenho.
Uma ficha do fluxo de IA ajuda a tornar visíveis entrada, finalidade, saída, revisão e retenção. Ela não substitui análise jurídica; impede que uma finalidade nova seja tratada como continuação automática da anterior.
A decisão de coletar deve caber em um parágrafo
Antes da primeira execução, a equipe deveria conseguir registrar, em linguagem simples, o que será coletado, para qual tarefa, por qual canal, por quanto tempo e com que acesso. O mesmo registro precisa dizer o que não será feito: não contornar barreiras, não reunir identificadores desnecessários, não usar a base para treinamento ou publicação sem nova avaliação.
Se essa decisão exige uma página de expressões vagas, o projeto ainda não está delimitado. “Montar uma base jurídica com IA” não é finalidade; é uma descrição de tecnologia.
O teste de maturidade aparece depois da coleta. Quando uma fonte corrige um documento, o acervo consegue acompanhar? Quando um titular exerce um direito aplicável, a organização sabe onde o dado está? Quando a IA cita um trecho, o advogado encontra o original? Sem essas respostas, a base pode ser volumosa, mas ainda não é confiável.
Perguntas frequentes
Web scraping é permitido no Brasil?
Não há uma autorização ou proibição geral para qualquer situação. A resposta depende da fonte, do modo de acesso, do conteúdo, da finalidade, dos dados pessoais, das condições aplicáveis e do uso posterior. O fato de a coleta ser tecnicamente possível não basta.
Dados publicados na internet continuam protegidos pela LGPD?
Sim, quando forem dados pessoais dentro do escopo da lei. O acesso público influencia a análise, mas não elimina finalidade, necessidade, transparência, segurança e direitos do titular.
Posso usar legítimo interesse para qualquer base pública?
Não. O legítimo interesse exige análise da situação concreta, necessidade e balanceamento com direitos e expectativas do titular. Essa hipótese não se aplica a dados pessoais sensíveis.
Pesquisa interna e treinamento de IA podem usar o mesmo acervo?
Não automaticamente. Treinamento pode mudar finalidade, retenção, número de cópias, fornecedores e possibilidade de eliminação. O novo uso requer avaliação própria.
Fontes oficiais brasileiras
- Planalto — Lei nº 13.709/2018, Lei Geral de Proteção de Dados Pessoais
- ANPD — Guia Orientativo sobre Legítimo Interesse
- ANPD — Direitos dos titulares, inclusive revisão de decisões automatizadas
- ANPD — parâmetros observados em fiscalização de tratamento de dados
- ANPD — Guia de Segurança da Informação para Agentes de Tratamento de Pequeno Porte