Pular para o conteúdo
SciForesight

Ingestão de dados

A ingestão transforma exportações brutas em um corpus consultável. Esta página descreve o fluxo, os formatos aceitos e como ler o relatório que o aplicativo devolve ao final.

No tutorial passo a passo · Módulo 3

Registrar o escopo e rodar o pipeline

Você terá um banco DuckDB populado, com duplicatas removidas, autores desambiguados e citações vinculadas.

Ver o passo a passo

O pipeline de ingestão em 4 etapas

O SciForesight organiza a transformação dos dados brutos em um banco relacional DuckDB através de quatro etapas reprodutíveis e auditáveis em tempo real:

  1. 1. Ingestão Bruta: Lê os arquivos brutos (Scopus CSV, Web of Science TXT, etc.), limpa as tabelas anteriores do projeto e persiste os dados em lotes no banco DuckDB local.
  2. 2. Refinamento Analítico: Remove duplicatas entre as bases cruzando DOIs e similaridade de títulos, e executa a desambiguação de grafias de autores via algoritmos avançados de consolidação de entidades.
  3. 3. Vínculo de Referências: Constrói as conexões citante-citado na tabela references . Pode ser executado via chave de API interna ou no Modo Manual gerando prompts em lote para estruturação em IA externa (ex: Google AI Studio) sem consumir créditos de API.
  4. 4. Gerar CSV CITEID (Opcional): Exporta consultas baseadas em identificadores únicos (CITEIDs) das publicações originais, facilitando a coleta de referências adicionais no Scopus e na WoS.

Formatos aceitos

ExtensãoOrigem típicaObservações
.csvScopus, exportações tabuladasSeparador vírgula ou ponto e vírgula; codificação UTF-8.
.txtWeb of Science (formato de campos marcados / Tab delimited)Exporte com o conjunto completo de campos, incluindo CR.
Exporte as referências citadas
Sem o campo de referências citadas (CR na Web of Science, References no Scopus), não há como calcular cocitação nem acoplamento bibliográfico. É o erro de exportação mais comum e só aparece bem depois, quando o mapa sai vazio.

Campos obrigatórios por fonte

FonteFormato recomendadoCampos necessários
ScopusCSVAuthors, Title, Year, Source title, Cited by, DOI, Author Keywords, Index Keywords, References
Web of ScienceTab delimited (TXT)AU, TI, SO, PY, Z9, CR, DE, ID, DI

O passo a passo de exportação de cada base está em Fontes suportadas.

O relatório de ingestão

Ao final, o aplicativo apresenta um resumo do que aconteceu com cada linha do arquivo. Vale lê-lo antes de qualquer análise:

  • Registros lidos — total encontrado nos arquivos.
  • Registros unificados — duplicatas fundidas em um único registro.
  • Registros rejeitados — linhas sem campos obrigatórios, listadas com o motivo.
  • Entidades consolidadas — variantes de autores e instituições agrupadas.
  • Alertas de cobertura — campos ausentes que vão limitar análises específicas, como referências citadas ausentes ou resumos vazios.
Uma taxa de duplicatas alta é normal ao cruzar bases
Ao ingerir Scopus e Web of Science sobre o mesmo tema, é esperado que uma fração grande dos registros seja unificada. Já uma taxa alta dentro de uma única exportação costuma indicar que a busca foi baixada em fatias sobrepostas.

Ampliar um corpus existente

Novos arquivos podem ser acrescentados à pasta de dados de um projeto existente para acompanhar um tema ao longo de meses. Vale entender o que acontece ao rodar a ingestão de novo: o banco do projeto é esvaziado e repopulado a partir de todos os arquivos presentes na pasta — não é uma carga incremental sobre o que já estava lá. O resultado final é o corpus completo, mas o caminho é a reconstrução, e por isso a etapa de refinamento precisa ser executada outra vez em seguida.

A vinculação de referências é a exceção: ela guarda em disco as referências já estruturadas e, ao rodar de novo, gera consultas ao modelo de IA apenas para os documentos ainda não processados. Se nada novo entrou, ela reaproveita o cache inteiro e não consome nenhuma chamada paga.

As confirmações antes de cada etapa

As três ações que reescrevem o banco pedem confirmação explícita, com o aviso do que exatamente será sobrescrito. Não é formalidade: cada uma descarta trabalho já feito.

AçãoO que é descartado
Executar ingestãoTodo o conteúdo do banco do projeto, que é repopulado do zero a partir da pasta de dados.
Rodar refinamentoAs entidades já unificadas: deduplicação de artigos e desambiguação de autores são recalculadas e sobrescritas.
Vincular referênciasOs vínculos citante-citado, reprocessados no modo escolhido — por IA ou manual.

Durante a execução, um monitor exibe o log do backend em tempo real, com o progresso por lote e por etapa. Falhas são gravadas no próprio terminal do monitor, destacadas em vermelho — não ficam restritas a uma notificação passageira, de modo que a causa da interrupção continua legível depois do fato.

Verificando um arquivo antes de ingerir

Quando a ingestão falha logo no começo, o problema costuma ser codificação ou separador. Uma conferência rápida no terminal resolve a dúvida:

PowerShell — inspecionar as primeiras linhas
Get-Content .\scopus.csv -TotalCount 3
Terminal — conferir a codificação
file -I scopus.csv
head -n 3 scopus.csv

Se o retorno indicar algo diferente de utf-8, reexporte a busca com codificação UTF-8 em vez de converter o arquivo manualmente — a conversão costuma quebrar nomes acentuados.

Pronto para experimentar o SciForesight?

Execute análises bibliométricas, grafos bimodais e inteligência artificial no Windows com controle, governança e soberania de dados.

Solicitar Versão de Teste