Ferramentas Mesclar Bases
Mesclar Bases

Como mesclar Scopus e Web of Science e remover as duplicatas

Envie as exportações de todas as bases e receba uma planilha padronizada, sem duplicatas, com os números para preencher o fluxograma PRISMA.

Versão
2026.08
Última atualização
Disponível desde

Créditos grátis · Sem cartão de crédito · Acesso imediato O que mudou recentemente

O que isso resolve

Duas bases, dois formatos de exportação e o mesmo artigo indexado nas duas. Esta ferramenta lê arquivos .bib, .nbib, .ris, .csv e .txt do Scopus, da Web of Science, do PubMed, do Dimensions e do Lens, alinha tudo em um conjunto de colunas, remove duplicatas por DOI e depois por título, e devolve a planilha com um fluxograma dos números de cada etapa.

Como funciona

  1. Envie as exportações e nomeie cada fonte

    Solte juntos os arquivos .bib, .nbib, .ris, .csv e .txt. Rotule cada um com a base de origem para que as contagens fiquem separadas.

  2. Confira o relatório da mesclagem

    Veja quantos registros cada fonte contribuiu, quantos saíram na etapa do DOI e na etapa do título, e quantos restaram.

  3. Baixe no formato que a próxima ferramenta lê

    Leve a planilha limpa, a original com duplicatas, um BibTeX para o Biblioshiny, um CSV para o VOSviewer e o fluxograma em imagem.

Método

O que acontece com o seu arquivo, passo a passo, e onde o resultado deixa de ser uma decisão tomada por um modelo.

Como funciona por dentro

Aceita .bib, .nbib, .ris, .csv e .txt. O formato é decidido pelo conteúdo, não só pela extensão: um .csv é testado contra as assinaturas de Dimensions e Lens antes de cair no leitor de Scopus; um .txt é testado pelo marcador RIS 'TY - ' no início de linha, depois pela assinatura de texto da Scopus, e por fim vai para o leitor de Web of Science. Cada arquivo vira as mesmas 13 colunas, linhas sem nenhum campo de identificação preenchido são descartadas, nomes de autores são reescritos como 'Sobrenome, A. B.' e variantes de grafia em toda a base colapsam para a forma mais frequente (a chave remove acentos, hífens e pontuação). A deduplicação roda em duas etapas. Primeiro por DOI canônico: prefixos como doi: e https://doi.org/ são removidos e o DOI é reconhecido pelo seu formato padrão (10. seguido do número do registrante e de uma barra). Dois registros sob o mesmo DOI só colapsam quando os títulos normalizados são idênticos ou, entre bases diferentes, atingem 0,90 ou mais de similaridade numa comparação de texto caractere a caractere, o que preserva capítulos de livro que compartilham o DOI do livro. Depois, apenas pela chave de título normalizada (minúsculas, sem acentos e sem pontuação). Em cada grupo sobrevive o registro com o maior 'Cited by'. As contagens antes, após DOI, após título e final são registradas para o fluxograma.

Onde a IA entra, e onde não entra

A deduplicação não tem modelo nenhum. Toda decisão que remove ou mantém um registro é comparação de texto determinística: DOI canônico, título normalizado, um escore de similaridade de 0,90 para títulos entre bases diferentes e 'Cited by' como desempate. A padronização de autores, a normalização de separadores e todas as contagens seguem regras fixas de texto, sem modelo envolvido. Um modelo de linguagem aparece em exatamente um ponto, e ele não toca a planilha mesclada: na geração do CSV do VOSviewer, blocos de afiliação em que nenhum nome de país reconhecido é encontrado vão para o gpt-4.1-nano em lotes de 80, que infere o país pela instituição, pela cidade ou pelo código postal. Blocos que nem o modelo consegue situar são descartados desse arquivo para não virarem nós de lixo no mapa de países do VOSviewer. O .xlsx, o .bib e o fluxograma não carregam nenhuma saída de modelo.

O que a ferramenta aceita

  • Arquivos com extensão .bib, .nbib, .ris, .csv ou .txt, vários de uma vez. Qualquer outra extensão é recusada antes do parsing.
  • Exportações reconhecidas por assinatura no conteúdo: Scopus (CSV e TXT), Web of Science (TXT), PubMed (.nbib), RIS, BibTeX, Dimensions (CSV) e Lens (CSV).
  • O envio é limitado a 150 MB no total, somando todos os arquivos. Não há limite de tamanho por arquivo nem limite de quantidade de arquivos.
  • Um rótulo por arquivo, opcional, sobrescreve a coluna Source; sem ele vale o padrão do parser (Scopus, Web of Science, PubMed, BibTeX, RIS, Dimensions, Lens).
  • Um arquivo que resulta em zero registros aborta a mesclagem inteira com o motivo (ilegível, só cabeçalho, aspas quebradas, sem campos bibliográficos) e nenhum crédito é consumido.

O que você recebe de volta

  • Um .xlsx sem duplicatas e um .xlsx com todos os registros ainda presentes, salvo logo antes da deduplicação (nomes e separadores já padronizados), ambos com as mesmas 13 colunas.
  • Um CSV para o VOSviewer no formato Scopus: 12 colunas, UTF-8 com BOM, aspas mínimas, afiliações reescritas para que cada bloco termine em um nome de país canônico.
  • Um arquivo BibTeX para uso no biblioshiny.
  • Um fluxograma no estilo PRISMA em PNG a 300 dpi, com as contagens por base, os registros antes da deduplicação, os removidos por DOI, os removidos por título e o total final.
  • Uma matriz de completude por base: células preenchidas, total e percentual de cada coluna, mostrando no máximo 8 colunas de base e o restante agrupado.

O que esta ferramenta não faz

  • Não busca em base nenhuma. Mescla os arquivos que você mesmo exportou.
  • Não combina o conteúdo dos duplicados. Sobrevive um registro por grupo, o de maior 'Cited by', e os campos do descartado se perdem, inclusive um DOI ou um resumo que só ele tinha. Essa contagem é o valor que já vinha na sua própria exportação: nenhum número de citação é consultado ou atualizado aqui, então ele vale exatamente o que valia no arquivo que você enviou.
  • Registros sem DOI e sem título não são deduplicados. Uma chave vazia juntaria registros sem relação, então eles passam direto.
  • A coluna Affiliations fica de fora da normalização de separadores de propósito, porque ali a vírgula separa partes de um mesmo endereço. A formatação das afiliações continua como a base de origem escreveu.
  • No CSV do VOSviewer, um bloco de afiliação sem país reconhecido e sem país inferido é removido daquele arquivo. Nada é removido do .xlsx.
Plano
Starter
Custo
20 créditos

O que você recebe

  • Formatos que ela realmente lê

    CSV e TXT do Scopus, TXT da Web of Science, .nbib do PubMed, RIS, BibTeX, CSV do Dimensions e CSV do Lens. CSV e TXT são identificados pelo conteúdo.

  • Deduplicação em duas etapas declaradas

    Primeiro pelo DOI normalizado, mantendo um registro por documento. Depois pelo título normalizado. Sobrevive o registro com a contagem de citações mais alta.

  • Capítulos de livro não são colapsados

    Registros que compartilham o DOI de um livro mantêm linhas próprias quando os títulos diferem. Entre bases, títulos quase idênticos sob um DOI contam como o mesmo documento.

  • Números para o fluxograma PRISMA

    A ferramenta registra quantos vieram de cada fonte, quantos saíram em cada etapa de deduplicação e quantos restaram, e desenha a figura em PNG.

Histórico de mudanças

Cada linha abaixo é uma mudança que realmente foi ao ar, com a data em que saiu.

  1. Mais recente
    • Uma mesclagem que não produz nenhum registro deixa de cobrar os 20 créditos e de salvar planilha vazia.
    • Um arquivo recusado agora diz por que foi recusado, em vez de uma mensagem cobrindo quatro causas.
    • Enviar o formulário sem nenhum arquivo não cobra mais créditos.
Ver 5 atualizações anteriores
    • Linhas em branco deixam de contar como registros identificados nos totais que vão para a seção de método.
    • O fluxograma ganha uma coluna de triagem, exibida só quando nenhum registro fica indeciso.
    • Uma etapa que não removeu nada não ocupa mais coluna, e as remoções pendem da caixa de origem.
    • O corpus triado segue para a análise bibliométrica, e o passo seguinte destrava quando a triagem termina.
    • O mesmo artigo vindo de Scopus e Web of Science agora é colapsado em um único registro.
    • DOIs lidos do Web of Science não trazem mais a data de early access grudada.
    • Resumos que começam com uma palavra igual a uma tag do WoS não são mais colados em outros campos.
    • Resultados salvos dentro de um projeto de pesquisa são capturados nesse projeto.
    • O fluxograma fica legível na largura da página, com fonte maior, fundo branco e a logo Xplore.
    • Os números do fluxograma seguem o separador do idioma, 2.109 em português e 2,109 em inglês.
    • Exportações CSV do Dimensions e do Lens agora podem ser mescladas, junto dos formatos já suportados.
    • Exportações do Scopus em texto puro agora podem ser mescladas.
    • Arquivos RIS do Web of Science agora trazem palavras-chave de índice e contagem de citações, antes vazias e zeradas.
    • O arquivo do VOSviewer resolve países nas afiliações do Dimensions e do Lens, e descarta blocos sem país.
    • Capítulos de livro que dividem o DOI do livro são preservados, em vez de colapsar em um registro só.
    • A coluna Document Type passa a vir de Scopus, Web of Science, RIS e BibTeX.
    • Arquivos RIS podem ser mesclados, incluindo conteúdo RIS detectado dentro de um .txt.
    • A base mesclada pode ser exportada em BibTeX, e variantes de nome de autor são unificadas nos exports.

Perguntas e respostas

Como ela decide que dois registros são o mesmo artigo?

Primeiro por DOI: registros com o mesmo DOI se juntam quando os títulos normalizados coincidem. Entre bases diferentes basta uma coincidência aproximada, porque Scopus e WoS escrevem símbolos de formas distintas. Depois por título normalizado, sobre tudo o que restou.

O que acontece com registros sem DOI?

Eles pulam a etapa do DOI e vão para a etapa do título. Um registro sem DOI utilizável e sem título é mantido como está: colapsá-lo correria o risco de juntar trabalhos diferentes, que é o erro pior.

Dá para conferir o que foi removido?

Sim. A planilha original, ainda com as duplicatas, fica disponível para download ao lado da limpa, então você pode comparar linha a linha e auditar qualquer decisão.

É cobrado alguma coisa se a mesclagem falhar?

Não. Os créditos são consumidos apenas depois que a mesclagem termina com sucesso. Arquivos ilegíveis, formatos errados e uma mesclagem que termina com zero registros param antes da cobrança e indicam qual correção se aplica.

Como citar esta ferramenta

Usou na sua pesquisa? A referência está pronta, já com a versão que você está vendo e a data de acesso de hoje.

ABNT (NBR 6023)

LESSA, P. W. B. Mesclar Bases. Versão 2026.08. [S. l.]: Xplore Dados, 2026. Disponível em: https://xploredados.com/tool/mesclar-bases. Acesso em: 16 ago. 2026.

APA 7

Lessa, P. W. B. (2026). Mesclar Bases (Versão 2026.08) [Software]. Xplore Dados. https://xploredados.com/tool/mesclar-bases

BibTeX

@software{xploredados_mesclar_bases_2026,
  author  = {Lessa, Patrick Wendell Barbosa},
  title   = {Mesclar Bases},
  organization = {Xplore Dados},
  version = {2026.08},
  year    = {2026},
  url     = {https://xploredados.com/tool/mesclar-bases},
  urldate = {2026-08-16}
}

Comece pelos créditos gratuitos

Crie uma conta e teste as ferramentas antes de decidir por um plano.

Criar conta