Pular para o conteúdo
SciForesight

Saneamento e deduplicação

Deduplicação é o que separa uma contagem confiável de um número inflado. Esta página descreve as regras aplicadas, sua ordem e o que fazer quando o resultado não convence.

No tutorial passo a passo · Módulo 3

Registrar o escopo e rodar o pipeline

Você terá um banco DuckDB populado, com duplicatas removidas, autores desambiguados e citações vinculadas.

Ver o passo a passo

Por que isso importa mais do que parece

Duplicatas não apenas inflam contagens: elas distorcem a topologia das redes. Um mesmo artigo contado duas vezes cria arestas fantasma, divide comunidades que deveriam ser uma só e desloca a posição de centralidade de autores. Um mapa construído sobre um corpus sujo é convincente e errado ao mesmo tempo — a pior combinação possível em um relatório para a diretoria.

Ordem das etapas

  1. Normalização de campos. Padronização de datas, maiúsculas, pontuação, codificação e formato de metadados.
  2. Deduplicação por identificador forte. O DOI é uma chave confiável: registros que coincidem nela são unificados sem julgamento adicional.
  3. Deduplicação por equivalência de título. Aplicada a registros sem identificador, comparando títulos normalizados junto com ano e fonte.
  4. Consolidação de entidades. Autores e instituições são agrupados — etapa detalhada em Desambiguação de entidades.

O que a normalização corrige

Problema no arquivo brutoTratamento
10.1000/XYZ e https://doi.org/10.1000/xyzDOIs reduzidos à forma canônica em caixa baixa.
Títulos em caixa alta ou com pontuação divergenteComparação sobre a forma normalizada, preservando o título original para exibição.
Nomes de periódicos abreviados e por extensoUnificação de variantes conhecidas de título de fonte.
Datas em formatos distintos por baseConversão para uma representação única, com ano sempre disponível.

Como as duplicatas são fundidas

A unificação não descarta informação. Ao fundir dois registros, o SciForesight mantém o registro mais completo como base e preserva a procedência dos campos divergentes — inclusive as contagens de citação de cada base de origem, que continuam distinguíveis em vez de somadas.

Registros sem DOI e sem título comparável
Alguns documentos — anais de eventos antigos, relatórios técnicos, literatura cinzenta — chegam sem identificador e com títulos irregulares. Eles entram no corpus, mas dificilmente são deduplicados automaticamente. O relatório de ingestão sinaliza esse grupo para revisão manual.

Revisando o resultado

Três verificações rápidas cobrem a maioria dos problemas:

  • Compare os totais. A soma dos registros exportados menos os unificados deveria bater com o total do corpus. Diferenças inesperadas apontam para linhas rejeitadas.
  • Ordene por contagem de citações. Os trabalhos mais citados de um tema que você conhece devem estar entre os primeiros, e cada um deve aparecer uma única vez.
  • Procure títulos quase idênticos. Versões preprint e publicada do mesmo trabalho convivem no corpus quando têm DOIs diferentes; decida explicitamente se quer mantê-las separadas.

Ajustando o rigor

A tolerância da comparação de títulos pode ser ajustada nos parâmetros do projeto. Critérios mais frouxos unificam mais, com risco de fundir trabalhos distintos de título parecido; critérios mais rígidos preservam duplicatas. Para revisões sistemáticas, onde cada exclusão precisa ser justificável, prefira o lado rígido e resolva o resto manualmente.

Registre os parâmetros usados
Os parâmetros de saneamento fazem parte do método e deveriam constar da seção de metodologia do relatório final, junto com a data da busca e as bases consultadas.
Pronto para experimentar o SciForesight?

Execute análises bibliométricas, grafos bimodais e inteligência artificial no Windows com controle, governança e soberania de dados.

Solicitar Versão de Teste