Saneamento e deduplicação
Deduplicação é o que separa uma contagem confiável de um número inflado. Esta página descreve as regras aplicadas, sua ordem e o que fazer quando o resultado não convence.
Registrar o escopo e rodar o pipeline
Você terá um banco DuckDB populado, com duplicatas removidas, autores desambiguados e citações vinculadas.
Por que isso importa mais do que parece
Duplicatas não apenas inflam contagens: elas distorcem a topologia das redes. Um mesmo artigo contado duas vezes cria arestas fantasma, divide comunidades que deveriam ser uma só e desloca a posição de centralidade de autores. Um mapa construído sobre um corpus sujo é convincente e errado ao mesmo tempo — a pior combinação possível em um relatório para a diretoria.
Ordem das etapas
- Normalização de campos. Padronização de datas, maiúsculas, pontuação, codificação e formato de metadados.
- Deduplicação por identificador forte. O DOI é uma chave confiável: registros que coincidem nela são unificados sem julgamento adicional.
- Deduplicação por equivalência de título. Aplicada a registros sem identificador, comparando títulos normalizados junto com ano e fonte.
- Consolidação de entidades. Autores e instituições são agrupados — etapa detalhada em Desambiguação de entidades.
O que a normalização corrige
| Problema no arquivo bruto | Tratamento |
|---|---|
10.1000/XYZ e https://doi.org/10.1000/xyz | DOIs reduzidos à forma canônica em caixa baixa. |
| Títulos em caixa alta ou com pontuação divergente | Comparação sobre a forma normalizada, preservando o título original para exibição. |
| Nomes de periódicos abreviados e por extenso | Unificação de variantes conhecidas de título de fonte. |
| Datas em formatos distintos por base | Conversão para uma representação única, com ano sempre disponível. |
Como as duplicatas são fundidas
A unificação não descarta informação. Ao fundir dois registros, o SciForesight mantém o registro mais completo como base e preserva a procedência dos campos divergentes — inclusive as contagens de citação de cada base de origem, que continuam distinguíveis em vez de somadas.
Revisando o resultado
Três verificações rápidas cobrem a maioria dos problemas:
- Compare os totais. A soma dos registros exportados menos os unificados deveria bater com o total do corpus. Diferenças inesperadas apontam para linhas rejeitadas.
- Ordene por contagem de citações. Os trabalhos mais citados de um tema que você conhece devem estar entre os primeiros, e cada um deve aparecer uma única vez.
- Procure títulos quase idênticos. Versões preprint e publicada do mesmo trabalho convivem no corpus quando têm DOIs diferentes; decida explicitamente se quer mantê-las separadas.
Ajustando o rigor
A tolerância da comparação de títulos pode ser ajustada nos parâmetros do projeto. Critérios mais frouxos unificam mais, com risco de fundir trabalhos distintos de título parecido; critérios mais rígidos preservam duplicatas. Para revisões sistemáticas, onde cada exclusão precisa ser justificável, prefira o lado rígido e resolva o resto manualmente.
Execute análises bibliométricas, grafos bimodais e inteligência artificial no Windows com controle, governança e soberania de dados.