Como mesclar Scopus e Web of Science e remover as duplicatas
Envie as exportações de todas as bases e receba uma planilha padronizada, sem duplicatas, com os números para preencher o fluxograma PRISMA.
Créditos grátis · Sem cartão de crédito · Acesso imediato O que mudou recentemente
O que isso resolve
Duas bases, dois formatos de exportação e o mesmo artigo indexado nas duas. Esta ferramenta lê arquivos .bib, .nbib, .ris, .csv e .txt do Scopus, da Web of Science, do PubMed, do Dimensions e do Lens, alinha tudo em um conjunto de colunas, remove duplicatas por DOI e depois por título, e devolve a planilha com um fluxograma dos números de cada etapa.
Como funciona
-
Envie as exportações e nomeie cada fonte
Solte juntos os arquivos .bib, .nbib, .ris, .csv e .txt. Rotule cada um com a base de origem para que as contagens fiquem separadas.
-
Confira o relatório da mesclagem
Veja quantos registros cada fonte contribuiu, quantos saíram na etapa do DOI e na etapa do título, e quantos restaram.
-
Baixe no formato que a próxima ferramenta lê
Leve a planilha limpa, a original com duplicatas, um BibTeX para o Biblioshiny, um CSV para o VOSviewer e o fluxograma em imagem.
Método
O que acontece com o seu arquivo, passo a passo, e onde o resultado deixa de ser uma decisão tomada por um modelo.
Como funciona por dentro
Aceita .bib, .nbib, .ris, .csv e .txt. O formato é decidido pelo conteúdo, não só pela extensão: um .csv é testado contra as assinaturas de Dimensions e Lens antes de cair no leitor de Scopus; um .txt é testado pelo marcador RIS 'TY - ' no início de linha, depois pela assinatura de texto da Scopus, e por fim vai para o leitor de Web of Science. Cada arquivo vira as mesmas 13 colunas, linhas sem nenhum campo de identificação preenchido são descartadas, nomes de autores são reescritos como 'Sobrenome, A. B.' e variantes de grafia em toda a base colapsam para a forma mais frequente (a chave remove acentos, hífens e pontuação). A deduplicação roda em duas etapas. Primeiro por DOI canônico: prefixos como doi: e https://doi.org/ são removidos e o DOI é reconhecido pelo seu formato padrão (10. seguido do número do registrante e de uma barra). Dois registros sob o mesmo DOI só colapsam quando os títulos normalizados são idênticos ou, entre bases diferentes, atingem 0,90 ou mais de similaridade numa comparação de texto caractere a caractere, o que preserva capítulos de livro que compartilham o DOI do livro. Depois, apenas pela chave de título normalizada (minúsculas, sem acentos e sem pontuação). Em cada grupo sobrevive o registro com o maior 'Cited by'. As contagens antes, após DOI, após título e final são registradas para o fluxograma.
Onde a IA entra, e onde não entra
A deduplicação não tem modelo nenhum. Toda decisão que remove ou mantém um registro é comparação de texto determinística: DOI canônico, título normalizado, um escore de similaridade de 0,90 para títulos entre bases diferentes e 'Cited by' como desempate. A padronização de autores, a normalização de separadores e todas as contagens seguem regras fixas de texto, sem modelo envolvido. Um modelo de linguagem aparece em exatamente um ponto, e ele não toca a planilha mesclada: na geração do CSV do VOSviewer, blocos de afiliação em que nenhum nome de país reconhecido é encontrado vão para o gpt-4.1-nano em lotes de 80, que infere o país pela instituição, pela cidade ou pelo código postal. Blocos que nem o modelo consegue situar são descartados desse arquivo para não virarem nós de lixo no mapa de países do VOSviewer. O .xlsx, o .bib e o fluxograma não carregam nenhuma saída de modelo.
O que a ferramenta aceita
- Arquivos com extensão .bib, .nbib, .ris, .csv ou .txt, vários de uma vez. Qualquer outra extensão é recusada antes do parsing.
- Exportações reconhecidas por assinatura no conteúdo: Scopus (CSV e TXT), Web of Science (TXT), PubMed (.nbib), RIS, BibTeX, Dimensions (CSV) e Lens (CSV).
- O envio é limitado a 150 MB no total, somando todos os arquivos. Não há limite de tamanho por arquivo nem limite de quantidade de arquivos.
- Um rótulo por arquivo, opcional, sobrescreve a coluna Source; sem ele vale o padrão do parser (Scopus, Web of Science, PubMed, BibTeX, RIS, Dimensions, Lens).
- Um arquivo que resulta em zero registros aborta a mesclagem inteira com o motivo (ilegível, só cabeçalho, aspas quebradas, sem campos bibliográficos) e nenhum crédito é consumido.
O que você recebe de volta
- Um .xlsx sem duplicatas e um .xlsx com todos os registros ainda presentes, salvo logo antes da deduplicação (nomes e separadores já padronizados), ambos com as mesmas 13 colunas.
- Um CSV para o VOSviewer no formato Scopus: 12 colunas, UTF-8 com BOM, aspas mínimas, afiliações reescritas para que cada bloco termine em um nome de país canônico.
- Um arquivo BibTeX para uso no biblioshiny.
- Um fluxograma no estilo PRISMA em PNG a 300 dpi, com as contagens por base, os registros antes da deduplicação, os removidos por DOI, os removidos por título e o total final.
- Uma matriz de completude por base: células preenchidas, total e percentual de cada coluna, mostrando no máximo 8 colunas de base e o restante agrupado.
O que esta ferramenta não faz
- Não busca em base nenhuma. Mescla os arquivos que você mesmo exportou.
- Não combina o conteúdo dos duplicados. Sobrevive um registro por grupo, o de maior 'Cited by', e os campos do descartado se perdem, inclusive um DOI ou um resumo que só ele tinha. Essa contagem é o valor que já vinha na sua própria exportação: nenhum número de citação é consultado ou atualizado aqui, então ele vale exatamente o que valia no arquivo que você enviou.
- Registros sem DOI e sem título não são deduplicados. Uma chave vazia juntaria registros sem relação, então eles passam direto.
- A coluna Affiliations fica de fora da normalização de separadores de propósito, porque ali a vírgula separa partes de um mesmo endereço. A formatação das afiliações continua como a base de origem escreveu.
- No CSV do VOSviewer, um bloco de afiliação sem país reconhecido e sem país inferido é removido daquele arquivo. Nada é removido do .xlsx.
- Plano
- Starter
- Custo
- 20 créditos
O que você recebe
-
Formatos que ela realmente lê
CSV e TXT do Scopus, TXT da Web of Science, .nbib do PubMed, RIS, BibTeX, CSV do Dimensions e CSV do Lens. CSV e TXT são identificados pelo conteúdo.
-
Deduplicação em duas etapas declaradas
Primeiro pelo DOI normalizado, mantendo um registro por documento. Depois pelo título normalizado. Sobrevive o registro com a contagem de citações mais alta.
-
Capítulos de livro não são colapsados
Registros que compartilham o DOI de um livro mantêm linhas próprias quando os títulos diferem. Entre bases, títulos quase idênticos sob um DOI contam como o mesmo documento.
-
Números para o fluxograma PRISMA
A ferramenta registra quantos vieram de cada fonte, quantos saíram em cada etapa de deduplicação e quantos restaram, e desenha a figura em PNG.
Histórico de mudanças
Cada linha abaixo é uma mudança que realmente foi ao ar, com a data em que saiu.
-
Mais recente
- Uma mesclagem que não produz nenhum registro deixa de cobrar os 20 créditos e de salvar planilha vazia.
- Um arquivo recusado agora diz por que foi recusado, em vez de uma mensagem cobrindo quatro causas.
- Enviar o formulário sem nenhum arquivo não cobra mais créditos.
Ver 5 atualizações anteriores
-
- Linhas em branco deixam de contar como registros identificados nos totais que vão para a seção de método.
- O fluxograma ganha uma coluna de triagem, exibida só quando nenhum registro fica indeciso.
- Uma etapa que não removeu nada não ocupa mais coluna, e as remoções pendem da caixa de origem.
- O corpus triado segue para a análise bibliométrica, e o passo seguinte destrava quando a triagem termina.
-
- O mesmo artigo vindo de Scopus e Web of Science agora é colapsado em um único registro.
- DOIs lidos do Web of Science não trazem mais a data de early access grudada.
- Resumos que começam com uma palavra igual a uma tag do WoS não são mais colados em outros campos.
- Resultados salvos dentro de um projeto de pesquisa são capturados nesse projeto.
-
- O fluxograma fica legível na largura da página, com fonte maior, fundo branco e a logo Xplore.
- Os números do fluxograma seguem o separador do idioma, 2.109 em português e 2,109 em inglês.
-
- Exportações CSV do Dimensions e do Lens agora podem ser mescladas, junto dos formatos já suportados.
- Exportações do Scopus em texto puro agora podem ser mescladas.
- Arquivos RIS do Web of Science agora trazem palavras-chave de índice e contagem de citações, antes vazias e zeradas.
- O arquivo do VOSviewer resolve países nas afiliações do Dimensions e do Lens, e descarta blocos sem país.
-
- Capítulos de livro que dividem o DOI do livro são preservados, em vez de colapsar em um registro só.
- A coluna Document Type passa a vir de Scopus, Web of Science, RIS e BibTeX.
- Arquivos RIS podem ser mesclados, incluindo conteúdo RIS detectado dentro de um .txt.
- A base mesclada pode ser exportada em BibTeX, e variantes de nome de autor são unificadas nos exports.
Perguntas e respostas
Como ela decide que dois registros são o mesmo artigo?
Primeiro por DOI: registros com o mesmo DOI se juntam quando os títulos normalizados coincidem. Entre bases diferentes basta uma coincidência aproximada, porque Scopus e WoS escrevem símbolos de formas distintas. Depois por título normalizado, sobre tudo o que restou.
O que acontece com registros sem DOI?
Eles pulam a etapa do DOI e vão para a etapa do título. Um registro sem DOI utilizável e sem título é mantido como está: colapsá-lo correria o risco de juntar trabalhos diferentes, que é o erro pior.
Dá para conferir o que foi removido?
Sim. A planilha original, ainda com as duplicatas, fica disponível para download ao lado da limpa, então você pode comparar linha a linha e auditar qualquer decisão.
É cobrado alguma coisa se a mesclagem falhar?
Não. Os créditos são consumidos apenas depois que a mesclagem termina com sucesso. Arquivos ilegíveis, formatos errados e uma mesclagem que termina com zero registros param antes da cobrança e indicam qual correção se aplica.
Como citar esta ferramenta
Usou na sua pesquisa? A referência está pronta, já com a versão que você está vendo e a data de acesso de hoje.
ABNT (NBR 6023)
LESSA, P. W. B. Mesclar Bases. Versão 2026.08. [S. l.]: Xplore Dados, 2026. Disponível em: https://xploredados.com/tool/mesclar-bases. Acesso em: 16 ago. 2026.
APA 7
Lessa, P. W. B. (2026). Mesclar Bases (Versão 2026.08) [Software]. Xplore Dados. https://xploredados.com/tool/mesclar-bases
BibTeX
@software{xploredados_mesclar_bases_2026,
author = {Lessa, Patrick Wendell Barbosa},
title = {Mesclar Bases},
organization = {Xplore Dados},
version = {2026.08},
year = {2026},
url = {https://xploredados.com/tool/mesclar-bases},
urldate = {2026-08-16}
}
Comece pelos créditos gratuitos
Crie uma conta e teste as ferramentas antes de decidir por um plano.
Criar conta