Ingestão de dados
A ingestão transforma exportações brutas em um corpus consultável. Esta página descreve o fluxo, os formatos aceitos e como ler o relatório que o aplicativo devolve ao final.
Registrar o escopo e rodar o pipeline
Você terá um banco DuckDB populado, com duplicatas removidas, autores desambiguados e citações vinculadas.
O pipeline de ingestão em 4 etapas
O SciForesight organiza a transformação dos dados brutos em um banco relacional DuckDB através de quatro etapas reprodutíveis e auditáveis em tempo real:
- 1. Ingestão Bruta: Lê os arquivos brutos (Scopus CSV, Web of Science TXT, etc.), limpa as tabelas anteriores do projeto e persiste os dados em lotes no banco DuckDB local.
- 2. Refinamento Analítico: Remove duplicatas entre as bases cruzando DOIs e similaridade de títulos, e executa a desambiguação de grafias de autores via algoritmos avançados de consolidação de entidades.
- 3. Vínculo de Referências: Constrói as conexões citante-citado na tabela
references. Pode ser executado via chave de API interna ou no Modo Manual gerando prompts em lote para estruturação em IA externa (ex: Google AI Studio) sem consumir créditos de API. - 4. Gerar CSV CITEID (Opcional): Exporta consultas baseadas em identificadores únicos (CITEIDs) das publicações originais, facilitando a coleta de referências adicionais no Scopus e na WoS.
Formatos aceitos
| Extensão | Origem típica | Observações |
|---|---|---|
.csv | Scopus, exportações tabuladas | Separador vírgula ou ponto e vírgula; codificação UTF-8. |
.txt | Web of Science (formato de campos marcados / Tab delimited) | Exporte com o conjunto completo de campos, incluindo CR. |
CR na Web of Science, References no Scopus), não há como calcular cocitação nem acoplamento bibliográfico. É o erro de exportação mais comum e só aparece bem depois, quando o mapa sai vazio.Campos obrigatórios por fonte
| Fonte | Formato recomendado | Campos necessários |
|---|---|---|
| Scopus | CSV | Authors, Title, Year, Source title, Cited by, DOI, Author Keywords, Index Keywords, References |
| Web of Science | Tab delimited (TXT) | AU, TI, SO, PY, Z9, CR, DE, ID, DI |
O passo a passo de exportação de cada base está em Fontes suportadas.
O relatório de ingestão
Ao final, o aplicativo apresenta um resumo do que aconteceu com cada linha do arquivo. Vale lê-lo antes de qualquer análise:
- Registros lidos — total encontrado nos arquivos.
- Registros unificados — duplicatas fundidas em um único registro.
- Registros rejeitados — linhas sem campos obrigatórios, listadas com o motivo.
- Entidades consolidadas — variantes de autores e instituições agrupadas.
- Alertas de cobertura — campos ausentes que vão limitar análises específicas, como referências citadas ausentes ou resumos vazios.
Ampliar um corpus existente
Novos arquivos podem ser acrescentados à pasta de dados de um projeto existente para acompanhar um tema ao longo de meses. Vale entender o que acontece ao rodar a ingestão de novo: o banco do projeto é esvaziado e repopulado a partir de todos os arquivos presentes na pasta — não é uma carga incremental sobre o que já estava lá. O resultado final é o corpus completo, mas o caminho é a reconstrução, e por isso a etapa de refinamento precisa ser executada outra vez em seguida.
A vinculação de referências é a exceção: ela guarda em disco as referências já estruturadas e, ao rodar de novo, gera consultas ao modelo de IA apenas para os documentos ainda não processados. Se nada novo entrou, ela reaproveita o cache inteiro e não consome nenhuma chamada paga.
As confirmações antes de cada etapa
As três ações que reescrevem o banco pedem confirmação explícita, com o aviso do que exatamente será sobrescrito. Não é formalidade: cada uma descarta trabalho já feito.
| Ação | O que é descartado |
|---|---|
| Executar ingestão | Todo o conteúdo do banco do projeto, que é repopulado do zero a partir da pasta de dados. |
| Rodar refinamento | As entidades já unificadas: deduplicação de artigos e desambiguação de autores são recalculadas e sobrescritas. |
| Vincular referências | Os vínculos citante-citado, reprocessados no modo escolhido — por IA ou manual. |
Durante a execução, um monitor exibe o log do backend em tempo real, com o progresso por lote e por etapa. Falhas são gravadas no próprio terminal do monitor, destacadas em vermelho — não ficam restritas a uma notificação passageira, de modo que a causa da interrupção continua legível depois do fato.
Verificando um arquivo antes de ingerir
Quando a ingestão falha logo no começo, o problema costuma ser codificação ou separador. Uma conferência rápida no terminal resolve a dúvida:
Get-Content .\scopus.csv -TotalCount 3file -I scopus.csv
head -n 3 scopus.csvSe o retorno indicar algo diferente de utf-8, reexporte a busca com codificação UTF-8 em vez de converter o arquivo manualmente — a conversão costuma quebrar nomes acentuados.
Execute análises bibliométricas, grafos bimodais e inteligência artificial no Windows com controle, governança e soberania de dados.