Ferramentas Análise Bibliométrica
Análise Bibliométrica

Como fazer análise bibliométrica a partir da planilha exportada da sua base

Traga a planilha do Mesclar Bases, escolha quais análises gerar e leia os agrupamentos de palavras-chave que o método HySCo-KC constrói.

Versão
2026.08
Última atualização
Disponível desde

Créditos grátis · Sem cartão de crédito · Acesso imediato O que mudou recentemente

O que isso resolve

O arquivo que esta análise lê é a planilha que sai do Mesclar Bases, e esse é o caminho normal de entrada. Você manda as suas exportações para lá primeiro, do Scopus, Web of Science, PubMed, Dimensions, Lens, RIS ou BibTeX, e quando a mesclagem termina um botão envia o resultado direto para cá, sem precisar baixar e subir o arquivo de novo. Uma exportação do Scopus sozinha também serve: ela só precisa ser salva como .xlsx antes, porque o Scopus já nomeia as colunas do jeito que a análise espera. É essa a regra por trás de tudo, o nome das colunas no cabeçalho e não a base de onde o arquivo veio. O Excel da Web of Science escreve AU e TC onde a análise procura Authors e Cited by, e é por isso que ele também passa pelo Mesclar Bases. Daí você marca as análises que quer e recebe os gráficos, as leis bibliométricas e a rede de palavras-chave. O agrupamento usa o HySCo-KC, método híbrido que combina coocorrência, semântica TF-IDF e modelagem de tópicos, com todos os pesos à vista e ajustáveis.

Como funciona

  1. Traga a planilha do Mesclar Bases

    A página de resultado da mesclagem tem um botão que manda a planilha direto para a análise. Se preferir enviar à mão, o arquivo precisa ser .xlsx e o cabeçalho precisa ter os nomes de coluna do Scopus, que uma exportação do Scopus já tem depois de salva como .xlsx. Antes de começar, avisamos quais colunas obrigatórias estão faltando.

  2. Escolha as análises e os parâmetros

    Escolha entre gráficos básicos, leis de Lotka, Bradford e Zipf, a rede de palavras-chave e as leituras por IA. Defina clusters, palavras-chave e limiares de coocorrência.

  3. Leia os resultados e recalcule

    Abra cada gráfico, baixe em PNG ou CSV e recalcule a rede com novos pesos sem precisar enviar o arquivo de novo.

Método

O que acontece com o seu arquivo, passo a passo, e onde o resultado deixa de ser uma decisão tomada por um modelo.

Como funciona por dentro

Lê uma planilha .xlsx e canoniza o cabeçalho contra 12 nomes fixos de coluna, corrigindo apenas maiúsculas e espaços sobrando. Cada componente selecionado roda isolado dos demais, então uma falha custa o próprio gráfico e nada mais. A rede de palavras-chave segue o HySCo-KC: as palavras-chave são separadas por ';', postas em minúsculas e os hífens viram espaços; as mais frequentes, cinco vezes o valor do campo keywords, vão ao modelo para normalização; as sobreviventes, até o valor do campo keywords, constroem três matrizes. A coocorrência vira similaridade de Jaccard (aresta só quando duas palavras-chave aparecem juntas pelo menos tantas vezes quanto o valor de Coocorrências Mínimas, padrão 5), o TF-IDF sobre Title mais Abstract (vocabulário de até 500 termos de uma ou duas palavras, cada um presente em pelo menos 2 documentos) vira similaridade de cosseno com até 0,30 somado por documentos compartilhados, e uma distribuição de tópicos LDA também é comparada por cosseno. As três se fundem com alfa 0,25, beta 0,50 e gama 0,25 depois de normalizadas para somar 1; arestas abaixo de Força da Conexão (padrão 0,15) são cortadas e, se o grafo ainda passar de 80 por cento de densidade, o limiar sobe para o percentil 75 dos pesos das arestas ou para a média mais meio desvio padrão, o que for maior. O K-means, com semente fixa 42 e o melhor de 10 inicializações, particiona a matriz fundida; clusters com menos de 3 nós são absorvidos pelo vizinho de maior similaridade somada, a modularidade é calculada e um layout de molas roda 150 iterações. Lotka é uma contagem de frequência de frequências sobre nomes de autores sem acentos, Bradford divide os periódicos ranqueados em 3 zonas com cerca de um terço dos artigos cada, e Zipf é uma tabela de posto e frequência com o log10 de ambos, não um gráfico.

Onde a IA entra, e onde não entra

Os números são determinísticos; o modelo normaliza vocabulário e escreve prosa. Contagens, similaridades de Jaccard e de cosseno, a fusão alfa/beta/gama, o K-means, a modularidade, Lotka, Bradford, Zipf e a classificação de fronteiras de pesquisa são aritmética determinística com semente fixa 42, sem nenhum modelo no caminho. O gpt-4.1-nano entra em quatro pontos: reescreve variantes de palavras-chave antes da contagem (cada proposta passa por uma checagem que rejeita reescritas distantes demais da grafia original, e as rejeitadas são substituídas pelo normalizador de regras, e o resultado fica em cache por 7 dias), interpreta os textos de afiliação em instituição, país e coordenadas para o mapa (um analisador de regras fica de reserva e, esgotado um orçamento de 1200 segundos, as afiliações restantes vão para esse analisador), nomeia e descreve clusters que o K-means já formou, e escreve os parágrafos narrativos de fronteiras de pesquisa e evolução temática. O gpt-5-nano escreve os dois textos opcionais, ambos construídos só a partir de resultados já calculados e ambos cobrados à parte da análise: o relatório completo (45 créditos) e, sobre qualquer tabela ou gráfico individual, um parágrafo descrevendo o que ele mostra (10 créditos cada). O único lugar em que um modelo alcança os números é a normalização de palavras-chave: variantes unificadas mudam frequências e, com elas, tamanhos de nós e pertencimento a clusters. Se um tema conta como quente, emergente, em declínio ou estável é regra, não julgamento: crescimento acima de 0,5 com recência acima de 0,55 é emergente, crescimento abaixo de -0,3 com recência abaixo de 0,35 é em declínio, e frequência no percentil 75 ou acima é quente.

O que a ferramenta aceita

  • Uma planilha .xlsx cujo cabeçalho use os nomes de coluna do Scopus, o mesmo formato que o Mesclar Bases escreve para todas as outras bases. A exportação do Scopus vem em .csv e precisa ser salva como .xlsx antes. Qualquer outra extensão é recusada antes de o processamento começar.
  • O cabeçalho precisa trazer pelo menos 2 destas 9 colunas: Authors, Author Keywords, Index Keywords, Title, Source title, Year, Cited by, Affiliations, Abstract. A checagem lê só as 5 primeiras linhas.
  • Cada um dos 14 componentes declara as colunas de que precisa. Coluna obrigatória ausente tira o componente da execução e do preço; coluna opcional ausente roda o componente incompleto e cobra o valor cheio, com um aviso dizendo o que se perdeu.
  • Parâmetros aceitos no formulário: o campo keywords define quantas palavras-chave mais frequentes entram na rede, 100 por padrão e limitado entre 20 e 200; Clusters-Alvo tem padrão 8, Coocorrências Mínimas 5 e Força da Conexão 0,15; Fonte da Palavra-chave escolhe entre Author Keywords, Index Keywords ou as duas.
  • Um envio é limitado a 150 MB. Não há limite separado de número de linhas.

O que você recebe de volta

  • Uma página com os gráficos selecionados, cada um baixável em PNG. Lotka, Bradford e Zipf chegam como tabela para copiar, sem imagem. A rede de palavras-chave também exporta CSV de nós e arestas, e o painel geográfico exporta XLSX.
  • A rede devolve nós (rótulo, frequência, cluster, x, y, tamanho entre 8 e 40), arestas (peso fundido mais as parcelas de coocorrência, rede, semântica e tópico em separado) e estatísticas com modularidade e os alpha, beta e gamma normalizados.
  • Fronteiras retorna até 15 palavras-chave quentes, 15 emergentes, 15 em declínio e 10 estáveis, cada uma com taxa de crescimento, recência e primeiro e último ano; a evolução temática retorna de 3 a 5 períodos com ligações de Jaccard entre períodos consecutivos.
  • Um relatório escrito opcional, montado a partir dos resultados calculados e exportável em Markdown, PDF ou Word, e uma descrição opcional por IA para qualquer tabela ou gráfico.
  • Cada execução fica guardada no seu histórico com um link próprio permanente e pode ser reaberta, ou completada depois com componentes não comprados da primeira vez.

O que esta ferramenta não faz

  • Não lê .csv, .ris, .bib nem PDF, e não busca registros no Scopus, na Web of Science nem em nenhuma outra base bibliográfica. Analisa somente a planilha que você envia.
  • Os nomes de coluna são reconhecidos só por caixa e espaços. TC, Times Cited ou qualquer outro apelido de Cited by é reportado como coluna ausente, nunca adivinhado, porque rotular a coluna errada é pior do que apontar uma coluna faltando.
  • Duas execuções do mesmo arquivo podem divergir. A normalização de palavras-chave passa por um modelo de linguagem com cache de 7 dias; expirado esse cache, uma normalização diferente muda frequências e a composição dos clusters.
  • A detecção de fronteiras de pesquisa exige um intervalo de pelo menos 3 anos entre o primeiro e o último ano, e a tendência por cluster exige 4. Abaixo disso o resultado é vazio ou tudo volta como estável.
  • As coordenadas do mapa vêm do modelo ou de uma tabela fixa de centroides por país, não de um serviço de geocodificação, então a posição das instituições é aproximada.
Plano
Pro
Custo
5 a 30 por componente, 100 no pacote completo, 45 no relatório com IA

O que você recebe

  • HySCo-KC, método híbrido de agrupamento

    Os clusters de palavras-chave vêm de três visões combinadas: rede de coocorrência, semântica TF-IDF e tópicos LDA. Você controla o peso de cada uma.

  • Nada é caixa-preta

    Clusters alvo, número de palavras-chave, coocorrência mínima, força de conexão e origem das palavras-chave são editáveis, e os padrões aparecem como recomendação.

  • Colunas ausentes são avisadas antes

    Se o arquivo não tiver uma coluna que a análise exige, avisamos antes de começar. Você decide se continua e paga apenas pelo que for gerado.

  • Exportações prontas para o manuscrito

    Os gráficos saem em PNG, a rede exporta CSV e o painel geográfico exporta XLSX, e o relatório com IA vem em Markdown, PDF ou Word. Lotka, Bradford e Zipf são tabelas para copiar, sem imagem.

Histórico de mudanças

Cada linha abaixo é uma mudança que realmente foi ao ar, com a data em que saiu.

  1. Mais recente
    • O relatório de IA só é entregue depois que a cobrança dá certo, e nada é debitado se ela falhar.
    • Clicar duas vezes no mesmo relatório reaproveita a primeira cobrança em vez de pagar duas vezes.
    • A nomeação de clusters por IA passou a exigir login e plano ativo.
    • A linha 'AI Diarization' no extrato passou a dizer o que ela faz: descrição de tabelas e gráficos.
Ver 5 atualizações anteriores
    • Antes de rodar, a ferramenta mostra quais análises sua planilha não sustenta e pergunta se deve continuar.
    • Você paga só pelas análises realmente produzidas, e componentes bloqueados deixam de ser oferecidos ou cobrados.
    • Uma análise que falha não derruba mais o trabalho inteiro, e os rankings rodam sem a coluna Cited by.
    • A página de resultado informa quais análises foram puladas e quanto foi cobrado pela execução.
    • Planilhas com acento no nome do arquivo agora sobem, em vez de falhar depois de cobrada a análise.
    • O histórico agora avisa quando a planilha de origem não foi guardada, antes de você escolher a complementação.
    • Erros do provedor deixam de aparecer na tela, e você recebe uma mensagem curta sobre o que fazer.
    • A análise pode rodar sobre o corpus triado, em vez da base mesclada inteira.
    • Cada análise registra se rodou sobre a base inteira ou sobre o corpus triado, com as contagens.
    • Resultados salvos dentro de um projeto de pesquisa são capturados nesse projeto.
    • Uma análise que falhou deixa de aparecer como ainda em processamento na linha do tempo do projeto.
    • Uma análise longa não é mais marcada como falha aos trinta minutos enquanto ainda está rodando.
    • Uma análise travada na etapa geográfica agora termina com dado real, em vez de girar para sempre.
    • Os países deixaram de ser atribuídos ao artigo errado quando a resposta da IA vinha truncada.
    • Análises interrompidas por um deploy são recuperadas, e erros de upload aparecem como mensagem em vez de redirecionamento.
    • O relatório de IA segue a estrutura de um artigo científico e pode ser baixado em PDF ou Word.
    • O botão Regenerar agora mostra o custo real do relatório, 45 créditos, e não 30.
    • Autores escritos com hífen ou com espaço passam a ser contados como a mesma pessoa.

Perguntas e respostas

A IA decide os clusters?

Não. Os clusters vêm de K-means sobre uma matriz híbrida de similaridade, que é aritmética, não modelo de linguagem. A IA só escreve rótulos e resumos para clusters que já existem, e normaliza a grafia das palavras-chave de forma conservadora.

Qual arquivo a ferramenta aceita?

Uma planilha .xlsx, e a mais fácil de conseguir é o arquivo que sai do Mesclar Bases. As análises leem dez colunas: Authors, Title, Year, Source title, Cited by, DOI, Affiliations, Abstract, Author Keywords e Index Keywords, e os nomes precisam bater, tirando maiúsculas e espaços a mais. Document Type e Author full names são aceitas no cabeçalho, mas nenhuma análise usa essas duas hoje. Um .csv é recusado, e as siglas de duas letras do Excel da Web of Science também: os dois casos passam antes pelo Mesclar Bases.

Isso substitui a minha leitura do corpus?

Não. A ferramenta conta, agrupa e desenha o que está na planilha. Qual cluster importa, se uma fronteira faz sentido e o que o mapa diz sobre a sua pergunta continua com você. Os parâmetros existem para você discordar.

Meus dados são usados para treinar modelos?

Não. As etapas de IA rodam em planos pagos de API cujas políticas publicadas dizem que o conteúdo enviado pela API não é usado para treinar modelos e fica retido por pouco tempo, só para monitorar abuso. Seus arquivos e resultados ficam no seu histórico.

Como citar esta ferramenta

Usou na sua pesquisa? A referência está pronta, já com a versão que você está vendo e a data de acesso de hoje.

ABNT (NBR 6023)

LESSA, P. W. B. Análise Bibliométrica. Versão 2026.08. [S. l.]: Xplore Dados, 2026. Disponível em: https://xploredados.com/tool/analise-bibliometrica. Acesso em: 16 ago. 2026.

APA 7

Lessa, P. W. B. (2026). Análise Bibliométrica (Versão 2026.08) [Software]. Xplore Dados. https://xploredados.com/tool/analise-bibliometrica

BibTeX

@software{xploredados_analise_bibliometrica_2026,
  author  = {Lessa, Patrick Wendell Barbosa},
  title   = {Análise Bibliométrica},
  organization = {Xplore Dados},
  version = {2026.08},
  year    = {2026},
  url     = {https://xploredados.com/tool/analise-bibliometrica},
  urldate = {2026-08-16}
}

Comece pelos créditos gratuitos

Crie uma conta e teste as ferramentas antes de decidir por um plano.

Criar conta