Qual é a diferença entre janela de contexto, memória e RAG?
Janela de contexto, memória e RAG não são sinônimos. A janela de contexto é o espaço de informação que o modelo recebe para produzir uma resposta naquele momento. Memória é a preservação selecionada de estado ou informação útil entre interações ou etapas. RAG, sigla de retrieval-augmented generation, é a recuperação de informação em uma base separada para colocá-la no contexto da resposta.
Essa distinção importa porque muitos erros de projeto começam com uma pergunta vaga: “como faço a IA lembrar tudo?”. Um fluxo jurídico não precisa que tudo seja lembrado. Ele precisa que cada tarefa receba a informação necessária, na versão correta, com uma origem que possa ser conferida.
O NIST define RAG como um sistema que combina um modelo com um sistema separado de recuperação ou base de conhecimento. A busca identifica informação relevante e a fornece ao modelo para formular a resposta. Isso permite atualizar o conteúdo disponível sem retreinar o modelo, mas não transforma a base em fonte perfeita nem garante que o trecho correto será recuperado.
A janela de contexto é mais imediata. Ela pode conter a instrução, os fatos do caso, um documento, trechos recuperados, o histórico recente e regras de formato. Seu limite não é apenas uma barreira técnica. Mesmo quando cabe muito texto, informação irrelevante pode diluir a pergunta, aumentar custo e dificultar a conferência.
Memória tem outra função. Pode guardar, por exemplo, a preferência de formato de uma equipe, uma etapa já concluída, um identificador de tarefa ou uma decisão humana que deve orientar o próximo passo. Em trabalho jurídico, memória não deve ser confundida com acervo oficial: uma anotação persistida pode ficar desatualizada, incompleta ou fora de contexto.
A pergunta certa antes da escolha
Antes de escolher a arquitetura, pergunte: “essa informação pertence apenas a esta tarefa, precisa continuar disponível depois ou deve ser buscada novamente na fonte autorizada?”. A resposta aponta a camada adequada e reduz a tentação de colocar tudo em uma conversa longa.
Quando a janela de contexto é a melhor escolha?
A janela de contexto é a melhor escolha quando a tarefa depende de um conjunto delimitado de informações que precisa ser analisado agora. Ela funciona bem para comparar cláusulas fornecidas na mesma solicitação, resumir uma decisão com seus fundamentos relevantes ou aplicar um roteiro de extração a um documento já selecionado.
O contexto deve ser curto o bastante para permanecer relevante e completo o bastante para não esconder uma exceção decisiva. Em um contrato, isso pode significar enviar a cláusula, as definições relacionadas, os anexos citados e a finalidade da revisão — não necessariamente o acervo inteiro do escritório. Em um processo, pode significar organizar fatos, pedidos, decisão e documento de prova em blocos identificados.
Uma boa composição de contexto separa instrução, material de referência e formato da saída. Também informa a data de corte, a jurisdição, a versão do arquivo e o tratamento para ausência de informação. “Não localizado”, “conflito entre documentos” e “revisão necessária” são saídas melhores do que completar uma lacuna com uma frase plausível.
Quando o contexto fica grande demais?
Enviar um documento inteiro pode parecer mais seguro, mas o volume não substitui a organização. Em uma arquitetura de RAG, o conteúdo recuperado ainda precisa ser colocado no contexto enviado ao modelo. Documentações atuais de arquitetura alertam que excesso de contexto aumenta latência e custo e pode reduzir a qualidade do raciocínio.
Para documentos extensos, divida por unidades jurídicas: capítulos, cláusulas, pedidos, fundamentos, anexos ou eventos. Produza resultados intermediários com origem e depois consolide. Essa divisão não deve apagar relações importantes; por isso, preserve identificadores, referências cruzadas, versões e uma lista de pendências.
Quando a janela de contexto não resolve?
Ela não resolve quando a tarefa depende de uma fonte que não foi enviada, de uma versão que mudou ou de uma busca em milhares de documentos. Nesses casos, ampliar o contexto pode apenas ampliar o ruído. O fluxo precisa de recuperação, organização documental ou revisão humana adicional.
Quando a memória é útil e quando ela deve ser evitada?
A memória é útil quando uma rotina precisa preservar estado entre etapas sem exigir que a equipe repita todas as informações. Ela pode registrar que um documento já foi classificado, que uma cláusula foi encaminhada para revisão, que o advogado aprovou um critério ou que uma saída deve seguir determinado formato.
O ponto central é a seletividade. Uma arquitetura madura separa memória de curto prazo, usada para continuidade da tarefa, de conhecimento persistente, que precisa de governança própria. Uma lembrança de conversa pode ajudar a completar uma sequência operacional; ela não deve substituir a consulta ao documento vigente, à lei, ao precedente ou à política interna aplicável.
Em um fluxo de triagem, por exemplo, a memória pode guardar o identificador do caso, o status da etapa e as exceções abertas. Já o texto da cláusula e a fonte de uma conclusão devem permanecer vinculados ao documento de origem. Se a equipe altera o playbook, a memória de uma execução anterior não deve silenciosamente impor o critério antigo à próxima tarefa.
Que informações não devem virar memória automática?
Evite persistir automaticamente dados pessoais desnecessários, conteúdo sigiloso sem finalidade definida, inferências sobre clientes, conclusões não revisadas e preferências ambíguas. A persistência deve ter finalidade, escopo, prazo de retenção, controle de acesso e possibilidade de correção ou exclusão compatível com o fluxo.
A memória também precisa de uma marca de confiança. Diferencie “registrado pelo sistema”, “confirmado por profissional” e “hipótese para revisão”. Sem essa distinção, uma anotação provisória pode reaparecer em outro contexto com aparência de fato aprovado.
Como testar memória em uma rotina jurídica?
Crie casos em que a memória esteja correta, desatualizada, incompleta e conflitante com a fonte atual. O teste deve verificar se o sistema recupera a versão mais recente, sinaliza conflito e permite que uma pessoa corrija o estado. Memória que não pode ser auditada é apenas uma caixa-preta mais persistente.
Quando o RAG é melhor do que ampliar o contexto?
O RAG é melhor quando a tarefa precisa localizar informação em um acervo que é maior, mutável ou específico demais para ser enviado inteiro. Ele é adequado para pesquisar documentos processuais, políticas internas, contratos, decisões, pareceres ou legislação organizada, desde que a base tenha versões, metadados e critérios de acesso.
O fluxo típico separa ingestão, recuperação, composição do contexto e geração. Na ingestão, os documentos são extraídos, limpos, identificados e divididos em unidades pesquisáveis. Na recuperação, a pergunta encontra candidatos relevantes. Depois, o sistema seleciona os trechos que serão enviados ao modelo. Por fim, a resposta deve apontar as fontes e permitir conferência contra o original.
O RAG não é uma garantia de verdade. Ele pode recuperar o documento errado, um trecho incompleto, uma versão revogada ou material sem autoridade. Também pode não encontrar a passagem decisiva quando a pergunta está mal formulada ou quando a indexação perdeu tabelas, imagens, notas ou referências cruzadas.
Como desenhar um RAG jurídico verificável?
Comece por um acervo com proprietário, data de vigência e política de atualização. Preserve metadados como tipo de documento, processo, jurisdição, órgão, versão e nível de sigilo. Use filtros de acesso antes da geração, não apenas depois. Quando houver conflito, mostre o conflito; não escolha silenciosamente a fonte mais conveniente.
O artigo como escolher o modelo de IA para cada tarefa jurídica mostra por que a seleção do modelo é apenas uma parte da arquitetura. Para pesquisa em acervo, a qualidade da recuperação e a clareza da evidência podem pesar mais do que trocar por um modelo maior.
Qual saída deve ser exigida?
Peça resposta em afirmações separadas, cada uma acompanhada do identificador do documento, trecho ou página quando disponível, data da fonte e grau de confiança operacional. Se não houver suporte suficiente, o sistema deve declarar a lacuna e encaminhar para revisão. A fonte recuperada é uma pista auditável, não uma autorização para protocolar ou aconselhar sem conferência.
Como escolher a camada certa para cada tarefa jurídica?
Escolha a camada de informação pela natureza da pergunta, pela estabilidade da fonte e pelo impacto do erro. Uma tarefa de comparação imediata pode usar contexto delimitado. Uma rotina que atravessa etapas pode usar memória para status e decisões humanas. Uma pesquisa que consulta um acervo grande deve usar RAG, com filtros, versões e fontes visíveis.
| Necessidade da tarefa | Camada principal | Exemplo jurídico | Controle mínimo |
|---|---|---|---|
| Analisar material já selecionado | Janela de contexto | comparar duas cláusulas de uma mesma versão | identificar documentos e pedir saída com origem |
| Continuar uma tarefa em várias etapas | Memória seletiva | status, pendências e aprovação de critério | finalidade, retenção e distinção entre fato e hipótese |
| Encontrar informação em acervo amplo | RAG | localizar precedentes ou políticas internas | metadados, controle de acesso e fonte recuperada |
| Resolver caso complexo | Combinação | buscar documentos, analisar trechos e consolidar | orçamento de contexto, limites de iteração e revisão humana |
Na dúvida, prefira a arquitetura mais simples que torne a saída verificável. Não crie memória persistente quando um registro de tarefa versionado resolve. Não use RAG para um documento que já foi selecionado e está sob revisão direta. Não coloque o acervo inteiro na janela de contexto para evitar desenhar uma busca.
Qual é o antes e o depois de uma escolha correta?
Antes: o advogado envia uma pasta inteira do processo em uma conversa e pede “analise tudo”. A saída mistura versões, não identifica a origem das afirmações e trata uma anotação antiga como se fosse fonte vigente.
Depois: o fluxo identifica a pergunta, usa RAG para localizar a versão autorizada, coloca no contexto apenas os trechos e fatos necessários e usa memória para registrar status e pendências. A resposta aponta documentos, versões e lacunas para revisão.
O erro típico é tratar memória como acervo oficial. Quando uma fonte muda, o fluxo precisa buscar a versão atualizada; uma lembrança persistida não pode prevalecer silenciosamente.
Como evitar que as camadas se confundam?
Dê nomes diferentes aos artefatos: “contexto da execução”, “memória de estado” e “fonte recuperada”. Registre quando cada um foi criado e se houve revisão. Na interface ou no relatório, mostre ao profissional o que veio do documento atual, o que foi lembrado de uma etapa anterior e o que foi localizado no acervo.
Essa separação ajuda a responder perguntas essenciais: qual informação influenciou a saída? Qual versão estava vigente? O sistema buscou em quais documentos? Quem aprovou a decisão? Sem esse caminho, a equipe pode ter uma resposta convincente, mas não consegue reconstruir o raciocínio operacional.
Como testar contexto, memória e RAG antes de escalar?
Teste cada camada separadamente antes de medir o fluxo completo. Para contexto, use documentos com exceções no início, no meio e no fim e verifique se a saída identifica todas as partes relevantes. Para memória, altere uma decisão entre etapas e confirme se o sistema abandona a anotação antiga quando a pessoa corrige o registro. Para RAG, inclua fontes semelhantes, versões revogadas e documentos sem a resposta.
O teste precisa ter uma referência humana. Registre a resposta esperada, as fontes autorizadas, a gravidade de cada erro e o tempo de conferência. Uma rotina pode ter boa recuperação e má síntese; outra pode sintetizar bem, mas perder a fonte. Misturar tudo em uma nota média esconde onde o controle precisa ser reforçado.
O artigo como testar uma rotina de IA jurídica antes de escalar oferece um ponto de partida para amostra representativa, casos-limite, métricas e decisão de escala. Para este tema, acrescente métricas específicas: precisão dos documentos recuperados, cobertura das fontes decisivas, taxa de memória desatualizada, quantidade de contexto irrelevante, tempo de revisão e percentual de respostas que corretamente pediram intervenção humana.
Quando o resultado autoriza ampliar o uso?
O resultado autoriza ampliar o uso apenas quando a equipe sabe o que o sistema faz bem, onde ele falha e quem assume cada revisão. Escalar não significa remover controles; significa repetir uma rotina cujo comportamento foi observado, com limites de acesso, critérios de parada e plano para incidentes.
Se os testes mostrarem que o problema está no acervo, corrija ingestão, metadados e versões. Se estiver na instrução, ajuste o formato e os critérios de saída. Se estiver na capacidade do modelo, altere a etapa ou encaminhe casos difíceis. Se o risco continuar alto sem revisão adequada, não escale aquela parte do fluxo.
Quais cautelas jurídicas e operacionais permanecem?
Contexto, memória e RAG não substituem análise profissional, dever de confidencialidade, validação de fontes ou decisão sobre estratégia. Eles são componentes de um fluxo de trabalho. A responsabilidade continua exigindo que o escritório saiba qual informação foi usada, qual saída foi alterada e quem aprovou o resultado.
Dados pessoais e documentos sigilosos devem ser tratados conforme finalidade, necessidade, acesso e retenção definidos pelo responsável pelo fluxo. O fato de uma arquitetura conseguir guardar ou recuperar uma informação não significa que ela deva fazê-lo. Limite o acervo consultável, registre permissões e elimine persistência desnecessária.
Também não é seguro afirmar que uma resposta está correta apenas porque veio de uma base própria. Um acervo pode conter erro, documento superado, duplicidade, conflito ou interpretação não aprovada. A rastreabilidade melhora a conferência; não a dispensa.
O uso responsável atribui o risco ao desenho improvisado: colocar tudo em uma conversa, guardar tudo como memória, recuperar sem filtrar ou aceitar uma citação sem abrir a fonte. O uso profissional faz o contrário: delimita finalidade, seleciona a camada, controla acesso, mostra evidências, sinaliza incerteza e mantém revisão humana proporcional ao impacto.
O que uma rotina madura deve deixar registrado?
Registre, no mínimo, finalidade, entradas, fontes recuperadas, versão dos documentos, memória usada, saída produzida, alterações humanas, exceções e aprovação. Uma ficha de fluxo pode servir como estrutura operacional para esse registro, desde que seja adaptada à criticidade da tarefa.
Em implantação, esse registro pode começar simples: uma tabela com tarefa, fonte, versão, camada usada, saída, revisor e decisão. À medida que o fluxo amadurece, a equipe pode acrescentar métricas de recuperação, tempo de revisão, incidentes e mudanças de configuração. Governança útil é a que permite conferir e melhorar o trabalho.
Se a equipe não consegue responder de onde veio uma afirmação, por que uma fonte foi escolhida ou quando uma memória foi alterada, a etapa ainda não tem governança suficiente para uso em tarefa sensível.
Conclusão
Janela de contexto, memória e RAG resolvem necessidades diferentes. O contexto organiza a execução atual; a memória mantém continuidade controlada; o RAG encontra informação em um acervo separado. A escolha correta depende da finalidade, da estabilidade da fonte, do volume de informação e do impacto de um erro.
Para escritórios e departamentos jurídicos, a vantagem não está em usar a arquitetura mais sofisticada. Está em construir uma rotina em que a informação certa chega à etapa certa, com acesso limitado, versão identificada, evidência visível e revisão humana. Se o fluxo for organizado dessa maneira, a IA jurídica deixa de ser uma resposta solta e passa a funcionar como capacidade operacional rastreável.
Quem quiser estruturar esse caminho pode conhecer a JuristIA e conversar sobre organização de acervo, automação de tarefas e controle das etapas. O objetivo não é prometer uma resposta automática, mas criar condições para que a equipe trabalhe com mais contexto, clareza e rastreabilidade.
Perguntas frequentes
Janela de contexto, memória e RAG são a mesma coisa?
Não. A janela de contexto reúne informações para a tarefa atual, a memória preserva estado entre etapas e o RAG recupera trechos de uma base separada. Um fluxo pode usar as três camadas, desde que cada uma tenha finalidade e controle definidos.
RAG elimina as respostas inventadas pela IA?
Não. RAG pode melhorar o acesso a fontes, mas ainda pode recuperar o documento errado, omitir um trecho importante ou produzir uma síntese inadequada. A fonte recuperada precisa ser aberta e conferida por uma pessoa responsável.
Memória pode substituir o acervo jurídico do escritório?
Não. Memória é adequada para continuidade e estado da tarefa, não para substituir documentos oficiais, versões vigentes ou fontes autorizadas. Informações persistentes devem ter finalidade, retenção, acesso e possibilidade de correção.
Enviar um documento inteiro sempre melhora a análise?
Não. Mais texto pode aumentar ruído, custo e dificuldade de localizar exceções. Para documentos longos, divida por unidades relevantes, preserve referências cruzadas e consolide os resultados com revisão.
Qual camada devo testar primeiro em uma rotina jurídica?
Comece pela camada que corresponde ao gargalo observado. Se o material já está selecionado, teste o contexto; se a tarefa atravessa etapas, teste a memória seletiva; se a busca no acervo é o problema, teste o RAG. Em qualquer caso, use amostra representativa, fontes conferíveis e critérios de parada.
Fontes oficiais
- NIST CSRC — RAG Glossary, consultado em 10/08/2026. Define RAG como a combinação de um modelo com um sistema separado de recuperação ou base de conhecimento.
- NIST TREC Browser — Retrieval-Augmented Generation Track 2025, consultado em 10/08/2026. Descreve a combinação entre recuperação de informação e modelos de linguagem para respostas relevantes e contextualizadas.
- NIST AI 100-2e2025 — Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations, referência técnica para o uso de fontes externas no contexto de RAG e para riscos de ingestão e manipulação da base.
- Agentic AI Lens — Memory, context, and RAG optimization, consultado em 10/08/2026. Diferencia memória de curto e longo prazo, contexto, recuperação e práticas de controle de custo, latência e relevância.