Ferramentas Transcrição de Áudio
Transcrição de Áudio

Transcreva sua entrevista com os falantes separados e marcação de tempo

Envie a gravação, receba o texto dividido por fala, renomeie cada locutor e exporte em Word ou TXT.

Versão
2026.08
Última atualização
Disponível desde

Créditos grátis · Sem cartão de crédito · Acesso imediato O que mudou recentemente

O que isso resolve

A Transcrição de Áudio transforma uma gravação em texto dividido por fala, cada bloco com horário de início e de fim. Envie um arquivo MP3, WAV, M4A, AAC, OGG ou WebM de até 100 MB, informe quantas pessoas falam ou deixe a ferramenta detectar, e o resultado volta como Locutor 1 e Locutor 2, que você renomeia com os nomes reais.

Como funciona

  1. Envie a gravação

    Arraste um arquivo MP3, WAV, M4A, AAC, OGG ou WebM de até 100 MB. O idioma do áudio vem pré-selecionado como português; troque ou mude para detecção automática.

  2. Informe quantas pessoas falam

    Defina o número esperado de locutores, de um a seis, ou deixe automático. O processamento roda em segundo plano, então você pode fechar a página.

  3. Renomeie os locutores e exporte

    Leia a transcrição bloco a bloco com os tempos, troque Locutor 1 pelo nome real e baixe um DOCX ou TXT com tudo.

Método

O que acontece com o seu arquivo, passo a passo, e onde o resultado deixa de ser uma decisão tomada por um modelo.

Como funciona por dentro

O upload passa por quatro verificações: a extensão precisa ser uma das seis permitidas, o tipo declarado do arquivo precisa combinar com a extensão, os primeiros bytes do arquivo precisam parecer áudio de verdade e o tamanho pode chegar a 100 MB. O trabalho então roda em segundo plano com teto de 30 minutos. O provedor padrão é a AssemblyAI, orientada a usar o modelo universal-3-pro e recuar para o universal-2, com separação de locutores ligada; conferimos o resultado a cada 5 segundos, por até 600 segundos. Cada trecho de fala vira um segmento com início e fim em segundos; segmentos vizinhos do mesmo locutor são unidos e os rótulos são renumerados a partir de Locutor 1. Se a AssemblyAI falhar com um erro temporário, o áudio é enviado ao OpenAI gpt-4o-transcribe-diarize.

Onde a IA entra, e onde não entra

Um modelo de fala produz cada palavra e cada fronteira entre locutores. Nenhum modelo de linguagem lê, reescreve, resume ou corrige a transcrição depois. Tudo o que vem após a resposta do provedor é determinístico: resolução de idioma (sua escolha, depois o idioma do site, depois detecção automática com limiar de confiança 0,7), fusão de turnos adjacentes do mesmo locutor, reatribuição de locutor fantasma (uma única fala com menos de 5 segundos entre dois turnos do mesmo locutor), renumeração dos rótulos e a aritmética dos créditos.

O que a ferramenta aceita

  • Um arquivo de áudio por requisição: .mp3, .wav, .m4a, .aac, .ogg ou .webm. A extensão, o tipo MIME declarado e os primeiros bytes do arquivo precisam concordar entre si, senão o upload é recusado.
  • Limite rígido de 100 MB por arquivo. Arquivos vazios e arquivos com menos de 4 bytes legíveis são rejeitados.
  • Idioma opcional: português (pré-selecionado no formulário), inglês, espanhol, francês, alemão, italiano ou detecção automática.
  • Campo opcional Número de locutores, de 1 a 6, repassado ao provedor de transcrição. Título opcional de até 255 caracteres.

O que você recebe de volta

  • Página de resultado com o texto completo e, por segmento, o rótulo do locutor e os tempos de início e fim. Renomear um locutor reescreve o nome em todos os segmentos dele.
  • Exportação em TXT com cabeçalho [HH:MM:SS - HH:MM:SS] Locutor por segmento, e em DOCX com a mesma estrutura mais uma tabela de metadados (data, origem, arquivo, idioma, duração).
  • Metadados gravados: provedor, modelo efetivamente usado, idioma solicitado e detectado, confiança do provedor, contagem de locutores antes e depois da consolidação, duração do áudio e tempos por fase.
  • Custo calculado pela duração real: 2 créditos por minuto de áudio, com o total arredondado para cima até um crédito inteiro e mínimo de 5 créditos, cobrado antes de o registro ser marcado como concluído. Se a cobrança falhar, a transcrição não é entregue.

O que esta ferramenta não faz

  • Não identifica quem são os locutores. Os rótulos são Speaker 1, Speaker 2 e assim por diante, atribuídos por ordem de primeira aparição; qualquer nome real é digitado por você depois.
  • Não resume, não traduz, não limpa e não checa o conteúdo do áudio. Não existe etapa de ata, extração de tópicos ou destaques de nenhum tipo.
  • Não aceita URL e não grava dentro do navegador. O único caminho é enviar um arquivo em um dos seis formatos permitidos; um vídeo só passa se for WebM, e mesmo assim apenas a trilha de áudio é transcrita.
  • Não garante o idioma que você escolheu. A divergência entre idioma solicitado e detectado é registrada em log e nos metadados, e a transcrição é entregue mesmo assim.
  • Não exporta legendas SRT ou VTT e não devolve timestamps por palavra: a menor unidade é o segmento de fala.
Plano
Pro
Custo
2 por minuto (mínimo 5)

O que você recebe

  • Separação de locutores

    Cada fala vem marcada como Locutor 1, Locutor 2 e assim por diante. Renomeie uma vez e o nome novo aparece em todos os blocos e na exportação.

  • Tempo em cada bloco

    Cada bloco mostra início e fim em horas, minutos e segundos, então você volta na gravação e confere a passagem de que ficou em dúvida.

  • Roda em segundo plano

    Gravações longas continuam processando depois que você sai da página. A transcrição aparece no histórico quando fica pronta, com status enquanto roda.

  • Exportação em Word e TXT

    Baixe um DOCX ou TXT com os nomes dos locutores, os tempos e o texto completo, pronto para colar na sua análise.

Histórico de mudanças

Cada linha abaixo é uma mudança que realmente foi ao ar, com a data em que saiu.

  1. Mais recente
    • A checagem de créditos passou a medir a duração real do áudio, em vez de estimar pelo tamanho do arquivo.
    • A transcrição só é entregue depois da cobrança dos créditos, então nada é entregue sem pagamento.
    • As mensagens de falha passaram a aparecer no idioma em que você lê o site.
Ver 4 atualizações anteriores
    • As transcrições salvas com um projeto aberto passaram a ser reunidas dentro dele.
    • O envio deixou de ser recusado por saldo quando os créditos de pacote avulso cobrem o custo.
    • Uma configuração inválida enviada ao provedor de fala foi corrigida, e a transcrição não falha mais nesse ponto.
    • A página da ferramenta passou a exigir login e um plano que inclua a transcrição.
    • Os textos e mensagens da ferramenta passaram pela tradução, então quem lê em inglês vê inglês.
    • Separação de falantes e detecção automática de idioma chegaram com o novo provedor de transcrição.
    • O limite de envio de áudio passou de 50 MB para 100 MB.
    • O custo estimado da transcrição aparece assim que você escolhe o arquivo.
    • Uma transcrição travada em processamento passa a ser reportada como falha, em vez de girar sem fim.
    • Primeira versão da ferramenta: envie um arquivo de áudio, leia a transcrição e guarde o histórico.
    • Gravações longas são comprimidas e divididas automaticamente antes de serem enviadas para transcrição.
    • Você pode informar quantos falantes existem na gravação.
    • Links do YouTube existiram na primeira versão e saíram no mesmo dia: só funciona envio de arquivo.

Perguntas e respostas

Ele acerta todas as palavras?

Nenhuma transcrição automática acerta tudo. Ruído de fundo, pessoas falando ao mesmo tempo e sotaques fortes reduzem a precisão, e a separação de locutores é uma estimativa. Trate o resultado como rascunho e revise com o áudio.

Quais arquivos e idiomas ele aceita?

Arquivos de áudio em MP3, WAV, M4A, AAC, OGG ou WebM, de até 100 MB, enviados do seu computador. Não há importação por link nem vídeo. Idiomas: português, inglês, espanhol, francês, alemão, italiano ou detecção automática.

Meu áudio é usado para treinar modelos de IA?

O arquivo vai para o provedor de transcrição em um plano pago de API, cuja política publicada diz que o conteúdo enviado pela API não é usado para treinar modelos. Guardamos a transcrição, não o áudio. Nossa política de privacidade lista todos os provedores envolvidos.

Quanto custa uma transcrição?

Os créditos seguem a duração do áudio: dois por minuto, com mínimo de cinco, cobrados depois que a transcrição fica pronta. Se a cobrança falhar, nada é entregue e nada é debitado. A ferramenta está no plano Pro.

Como citar esta ferramenta

Usou na sua pesquisa? A referência está pronta, já com a versão que você está vendo e a data de acesso de hoje.

ABNT (NBR 6023)

LESSA, P. W. B. Transcrição de Áudio. Versão 2026.08. [S. l.]: Xplore Dados, 2026. Disponível em: https://xploredados.com/tool/transcricao-de-audio. Acesso em: 16 ago. 2026.

APA 7

Lessa, P. W. B. (2026). Transcrição de Áudio (Versão 2026.08) [Software]. Xplore Dados. https://xploredados.com/tool/transcricao-de-audio

BibTeX

@software{xploredados_transcricao_de_audio_2026,
  author  = {Lessa, Patrick Wendell Barbosa},
  title   = {Transcrição de Áudio},
  organization = {Xplore Dados},
  version = {2026.08},
  year    = {2026},
  url     = {https://xploredados.com/tool/transcricao-de-audio},
  urldate = {2026-08-16}
}

Comece pelos créditos gratuitos

Crie uma conta e teste as ferramentas antes de decidir por um plano.

Criar conta