2.0 KiB
02 — Triagem: roteiro vs. conversa de bastidor
Primeira coisa a fazer, antes de qualquer decisão de efeito.
Material bruto de gravação quase nunca é uma tomada só. A pessoa lê o roteiro, erra, conversa com a equipe e recomeça.
Por que isso é tarefa sua, e não do sistema
No áudio essa separação é invisível — e pior: o índice de ênfase favorece a conversa, que é mais solta e mais alta que o texto decorado.
Caso real: a fala mais enfática de um vídeo inteiro (energia 1,00, o topo absoluto da gravação) era "Amor, eu tô intacto!", dita para o marido fora de quadro. Três das sete palavras de maior ênfase do vídeo vinham dessa única frase de bastidor.
Nenhum limiar acústico separa isso. O texto separa sem erro.
Atenção: isso também não é diarização. Num caso real, a pessoa da equipe estava fora do microfone — a diarização a ouvia, mas o Whisper não a transcrevia. As falas a descartar eram da própria protagonista: mesma voz, contexto diferente. "Quem fala" e "isso é tomada válida" são perguntas diferentes.
Descartar — conversa com a equipe
Reconhece-se pelo conteúdo:
- vocativo para alguém da sala — "Amor, eu tô intacto!"
- pergunta operacional — "Posso começar da mastopexia?", "E aí, continua?", "Mas eu vou ter que falar tudo de novo?"
- instrução técnica — "Só clica aí agora na tela.", "Aumenta."
- comentário sobre a própria gravação — "Vou falar só a última frase, só um pouquinho, não pegou?"
Descartar — frases interrompidas
Texto que morre no meio, tipicamente em reticências ou emendando numa pergunta:
- "E tudo isso associado à medida..."
- "Aquela mama com um formato mais estruturado, com o colo que..."
- "de pele..."
Sinais estruturais que ajudam
Use take_boundary para achar onde cada tomada recomeça. Num material
real, as fronteiras (gaps de 3,6s a 19,8s) caíam exatamente nos pontos onde
a médica reiniciava o roteiro — inclusive nas duas retomadas da frase de
abertura.