![]()

Uma reunião de quarenta minutos contém uma decisão, duas pendências e uma discordância. O arquivo existe, mas ninguém sabe em que minuto cada ponto apareceu. Uma transcrição pesquisável reduz esse custo de recuperação. Ela não prova, sozinha, quem falou nem qual interpretação deve entrar no registro.
Este módulo separa três tarefas que costumam ser confundidas.
Transcrição, diarização e identificação
ASR, sigla em inglês para reconhecimento automático de fala, transforma áudio em texto. A saída pode incluir segmentos e marcações de tempo.
Diarização separa turnos de fala e atribui rótulos como SPEAKER_00 e SPEAKER_01. Ela responde quem falou quando no sentido acústico. Não conhece automaticamente o nome, o cargo ou a responsabilidade de cada pessoa.
Identificação liga um rótulo a uma pessoa. Essa etapa precisa de evidência adicional, como apresentação registrada no áudio, lista autorizada de participantes ou revisão de quem conhece a conversa.
Um modelo de linguagem pode sugerir papéis a partir do texto. Essa sugestão é análise semântica, não identificação biométrica nem prova de autoria.
O fluxo verificável
O áudio original permanece fora do Vault textual, em local autorizado e com referência recuperável. A nota no Segundo Cérebro registra caminho, origem, data e permissão de uso.
O processamento segue sete etapas:
- preservar o arquivo original
- registrar os falantes prováveis sem tratá-los como confirmados
- transcrever com marcações de tempo
- diarizar somente quando a autoria da fala mudar a utilidade da saída
- revisar nomes, números, termos técnicos e trechos de baixa confiança contra a gravação
- separar fato dito, interpretação e próxima ação
- salvar a nota com link para a fonte e estado de revisão
O mlx-whisper executa modelos Whisper em Apple Silicon e oferece marcações por palavra. A documentação oficial mostra instalação, escolha de modelo e suporte a word_timestamps. Consultar o projeto oficial do MLX Whisper
Para separar falantes, o pyannote.audio oferece pipelines específicos de diarização. A saída usa rótulos de falante e pode sofrer com sobreposição, ruído, distância e vozes parecidas. Consultar o projeto oficial do pyannote.audio
Quando a diarização melhora a decisão
Uma voz principal pode dispensar a separação de falantes. Entrevistas, reuniões e consultas com várias pessoas podem exigir essa camada quando autoria, concordância ou responsabilidade alteram o registro.
Use diarização quando ela melhora pelo menos um destes pontos:
- atribuição de uma decisão
- identificação de uma objeção
- seleção de fala para edição
- rastreabilidade de uma orientação
- revisão de uma ata por quem participou
Não use por hábito. Cada camada acrescenta tempo, dependências e possibilidade de erro.
Contexto ajuda, mas não garante
Um Prompt inicial com nomes, vocabulário técnico e tema provável pode ajudar o reconhecimento de termos. Ele também pode induzir uma grafia incorreta quando a hipótese estiver errada.
Registre o contexto fornecido e mantenha o áudio como fonte de verdade. Se o nome não estiver claro, marque a dúvida. Não complete por plausibilidade.
Áudio gravado e conversa por voz
Transcrever uma gravação produz um artefato para revisão. Conversar por voz com um agente coordena trabalho dentro das ferramentas e permissões disponíveis naquela superfície.
O primeiro fluxo transforma som em material consultável. O segundo usa a fala como interface de comando. A comparação completa está em Codex como Camada Operacional do Sistema.
O exercício deste módulo
Use um áudio sintético ou uma gravação curta para a qual exista autorização clara. Inclua duas vozes, dois nomes próprios, uma data, um valor e uma decisão.
Depois:
- gere a transcrição com marcações por palavra
- rode a diarização sem fornecer os nomes como resposta pronta
- associe os rótulos aos nomes somente quando houver evidência
- transforme a saída em resumo, decisões e próximas ações
- confira cada afirmação importante no áudio
- registre erros de palavra, tempo, falante e interpretação
Pare se o sistema misturar falantes numa decisão, inventar um nome ou perder um trecho que altera o sentido. A saída continua como material de trabalho até a revisão humana.
Considerações Finais
Uma gravação passa a servir ao sistema quando o trecho importante pode ser encontrado, ouvido e conferido. ASR acelera a recuperação. Diarização organiza turnos. A pessoa responsável confirma nomes, sentido e consequência.
No Módulo 10, a tarefa será deslocada para outra máquina sem perder origem, estado, registro de falha e responsabilidade pela saída.
Quando a Mentoria faz sentido
Você pode executar o exercício sozinho. Na Mentoria em IA para Negócios, eu ensino a lógica e converso com você sobre possibilidades e casos de uso do seu negócio. No formato atual, são quatro sessões online de três horas.
A Mentoria não inclui diagnóstico formal, consultoria, projeto, configuração, integração, implantação ou execução do seu sistema.
Conhecer a Mentoria em IA para Negócios
Conhecer a Mentoria pelo WhatsApp
Glossário deste módulo
Os termos que este módulo coloca em uso. Definições completas no glossário da trilha.
Termos centrais deste módulo
- ASR Local : o reconhecimento de fala executado no próprio computador.
- Diarização Semântica : uma análise que sugere papel ou nome depois da separação acústica de falantes.
Termos de apoio (definidos em outros módulos, usados aqui)
- Apple Silicon : a arquitetura usada pelo MLX para processar áudio no Mac, Módulo 8.
- Inferência Local : o que faz o ASR rodar no Mac, detalhado no Módulo 8.
- Quantização : o que permite o modelo de transcrição caber no hardware, Módulo 8.
- Token : uma unidade de contexto e, em alguns serviços, de cobrança, Módulo 3.
- Soberania de Dados : a decisão sobre o ambiente autorizado para o áudio, Módulo 8.