Transcreva sua entrevista com os falantes separados e marcação de tempo
Envie a gravação, receba o texto dividido por fala, renomeie cada locutor e exporte em Word ou TXT.
Créditos grátis · Sem cartão de crédito · Acesso imediato O que mudou recentemente
O que isso resolve
A Transcrição de Áudio transforma uma gravação em texto dividido por fala, cada bloco com horário de início e de fim. Envie um arquivo MP3, WAV, M4A, AAC, OGG ou WebM de até 100 MB, informe quantas pessoas falam ou deixe a ferramenta detectar, e o resultado volta como Locutor 1 e Locutor 2, que você renomeia com os nomes reais.
Como funciona
-
Envie a gravação
Arraste um arquivo MP3, WAV, M4A, AAC, OGG ou WebM de até 100 MB. O idioma do áudio vem pré-selecionado como português; troque ou mude para detecção automática.
-
Informe quantas pessoas falam
Defina o número esperado de locutores, de um a seis, ou deixe automático. O processamento roda em segundo plano, então você pode fechar a página.
-
Renomeie os locutores e exporte
Leia a transcrição bloco a bloco com os tempos, troque Locutor 1 pelo nome real e baixe um DOCX ou TXT com tudo.
Método
O que acontece com o seu arquivo, passo a passo, e onde o resultado deixa de ser uma decisão tomada por um modelo.
Como funciona por dentro
O upload passa por quatro verificações: a extensão precisa ser uma das seis permitidas, o tipo declarado do arquivo precisa combinar com a extensão, os primeiros bytes do arquivo precisam parecer áudio de verdade e o tamanho pode chegar a 100 MB. O trabalho então roda em segundo plano com teto de 30 minutos. O provedor padrão é a AssemblyAI, orientada a usar o modelo universal-3-pro e recuar para o universal-2, com separação de locutores ligada; conferimos o resultado a cada 5 segundos, por até 600 segundos. Cada trecho de fala vira um segmento com início e fim em segundos; segmentos vizinhos do mesmo locutor são unidos e os rótulos são renumerados a partir de Locutor 1. Se a AssemblyAI falhar com um erro temporário, o áudio é enviado ao OpenAI gpt-4o-transcribe-diarize.
Onde a IA entra, e onde não entra
Um modelo de fala produz cada palavra e cada fronteira entre locutores. Nenhum modelo de linguagem lê, reescreve, resume ou corrige a transcrição depois. Tudo o que vem após a resposta do provedor é determinístico: resolução de idioma (sua escolha, depois o idioma do site, depois detecção automática com limiar de confiança 0,7), fusão de turnos adjacentes do mesmo locutor, reatribuição de locutor fantasma (uma única fala com menos de 5 segundos entre dois turnos do mesmo locutor), renumeração dos rótulos e a aritmética dos créditos.
O que a ferramenta aceita
- Um arquivo de áudio por requisição: .mp3, .wav, .m4a, .aac, .ogg ou .webm. A extensão, o tipo MIME declarado e os primeiros bytes do arquivo precisam concordar entre si, senão o upload é recusado.
- Limite rígido de 100 MB por arquivo. Arquivos vazios e arquivos com menos de 4 bytes legíveis são rejeitados.
- Idioma opcional: português (pré-selecionado no formulário), inglês, espanhol, francês, alemão, italiano ou detecção automática.
- Campo opcional Número de locutores, de 1 a 6, repassado ao provedor de transcrição. Título opcional de até 255 caracteres.
O que você recebe de volta
- Página de resultado com o texto completo e, por segmento, o rótulo do locutor e os tempos de início e fim. Renomear um locutor reescreve o nome em todos os segmentos dele.
- Exportação em TXT com cabeçalho [HH:MM:SS - HH:MM:SS] Locutor por segmento, e em DOCX com a mesma estrutura mais uma tabela de metadados (data, origem, arquivo, idioma, duração).
- Metadados gravados: provedor, modelo efetivamente usado, idioma solicitado e detectado, confiança do provedor, contagem de locutores antes e depois da consolidação, duração do áudio e tempos por fase.
- Custo calculado pela duração real: 2 créditos por minuto de áudio, com o total arredondado para cima até um crédito inteiro e mínimo de 5 créditos, cobrado antes de o registro ser marcado como concluído. Se a cobrança falhar, a transcrição não é entregue.
O que esta ferramenta não faz
- Não identifica quem são os locutores. Os rótulos são Speaker 1, Speaker 2 e assim por diante, atribuídos por ordem de primeira aparição; qualquer nome real é digitado por você depois.
- Não resume, não traduz, não limpa e não checa o conteúdo do áudio. Não existe etapa de ata, extração de tópicos ou destaques de nenhum tipo.
- Não aceita URL e não grava dentro do navegador. O único caminho é enviar um arquivo em um dos seis formatos permitidos; um vídeo só passa se for WebM, e mesmo assim apenas a trilha de áudio é transcrita.
- Não garante o idioma que você escolheu. A divergência entre idioma solicitado e detectado é registrada em log e nos metadados, e a transcrição é entregue mesmo assim.
- Não exporta legendas SRT ou VTT e não devolve timestamps por palavra: a menor unidade é o segmento de fala.
- Plano
- Pro
- Custo
- 2 por minuto (mínimo 5)
O que você recebe
-
Separação de locutores
Cada fala vem marcada como Locutor 1, Locutor 2 e assim por diante. Renomeie uma vez e o nome novo aparece em todos os blocos e na exportação.
-
Tempo em cada bloco
Cada bloco mostra início e fim em horas, minutos e segundos, então você volta na gravação e confere a passagem de que ficou em dúvida.
-
Roda em segundo plano
Gravações longas continuam processando depois que você sai da página. A transcrição aparece no histórico quando fica pronta, com status enquanto roda.
-
Exportação em Word e TXT
Baixe um DOCX ou TXT com os nomes dos locutores, os tempos e o texto completo, pronto para colar na sua análise.
Histórico de mudanças
Cada linha abaixo é uma mudança que realmente foi ao ar, com a data em que saiu.
-
Mais recente
- A checagem de créditos passou a medir a duração real do áudio, em vez de estimar pelo tamanho do arquivo.
- A transcrição só é entregue depois da cobrança dos créditos, então nada é entregue sem pagamento.
- As mensagens de falha passaram a aparecer no idioma em que você lê o site.
Ver 4 atualizações anteriores
-
- As transcrições salvas com um projeto aberto passaram a ser reunidas dentro dele.
-
- O envio deixou de ser recusado por saldo quando os créditos de pacote avulso cobrem o custo.
- Uma configuração inválida enviada ao provedor de fala foi corrigida, e a transcrição não falha mais nesse ponto.
- A página da ferramenta passou a exigir login e um plano que inclua a transcrição.
- Os textos e mensagens da ferramenta passaram pela tradução, então quem lê em inglês vê inglês.
-
- Separação de falantes e detecção automática de idioma chegaram com o novo provedor de transcrição.
- O limite de envio de áudio passou de 50 MB para 100 MB.
- O custo estimado da transcrição aparece assim que você escolhe o arquivo.
- Uma transcrição travada em processamento passa a ser reportada como falha, em vez de girar sem fim.
-
- Primeira versão da ferramenta: envie um arquivo de áudio, leia a transcrição e guarde o histórico.
- Gravações longas são comprimidas e divididas automaticamente antes de serem enviadas para transcrição.
- Você pode informar quantos falantes existem na gravação.
- Links do YouTube existiram na primeira versão e saíram no mesmo dia: só funciona envio de arquivo.
Perguntas e respostas
Ele acerta todas as palavras?
Nenhuma transcrição automática acerta tudo. Ruído de fundo, pessoas falando ao mesmo tempo e sotaques fortes reduzem a precisão, e a separação de locutores é uma estimativa. Trate o resultado como rascunho e revise com o áudio.
Quais arquivos e idiomas ele aceita?
Arquivos de áudio em MP3, WAV, M4A, AAC, OGG ou WebM, de até 100 MB, enviados do seu computador. Não há importação por link nem vídeo. Idiomas: português, inglês, espanhol, francês, alemão, italiano ou detecção automática.
Meu áudio é usado para treinar modelos de IA?
O arquivo vai para o provedor de transcrição em um plano pago de API, cuja política publicada diz que o conteúdo enviado pela API não é usado para treinar modelos. Guardamos a transcrição, não o áudio. Nossa política de privacidade lista todos os provedores envolvidos.
Quanto custa uma transcrição?
Os créditos seguem a duração do áudio: dois por minuto, com mínimo de cinco, cobrados depois que a transcrição fica pronta. Se a cobrança falhar, nada é entregue e nada é debitado. A ferramenta está no plano Pro.
Como citar esta ferramenta
Usou na sua pesquisa? A referência está pronta, já com a versão que você está vendo e a data de acesso de hoje.
ABNT (NBR 6023)
LESSA, P. W. B. Transcrição de Áudio. Versão 2026.08. [S. l.]: Xplore Dados, 2026. Disponível em: https://xploredados.com/tool/transcricao-de-audio. Acesso em: 16 ago. 2026.
APA 7
Lessa, P. W. B. (2026). Transcrição de Áudio (Versão 2026.08) [Software]. Xplore Dados. https://xploredados.com/tool/transcricao-de-audio
BibTeX
@software{xploredados_transcricao_de_audio_2026,
author = {Lessa, Patrick Wendell Barbosa},
title = {Transcrição de Áudio},
organization = {Xplore Dados},
version = {2026.08},
year = {2026},
url = {https://xploredados.com/tool/transcricao-de-audio},
urldate = {2026-08-16}
}
Comece pelos créditos gratuitos
Crie uma conta e teste as ferramentas antes de decidir por um plano.
Criar conta