Files
gart/.claude/skills/editar-por-voz/criterios/02-triagem-roteiro-vs-conversa.md

2.0 KiB

02 — Triagem: roteiro vs. conversa de bastidor

Primeira coisa a fazer, antes de qualquer decisão de efeito.

Material bruto de gravação quase nunca é uma tomada só. A pessoa lê o roteiro, erra, conversa com a equipe e recomeça.

Por que isso é tarefa sua, e não do sistema

No áudio essa separação é invisível — e pior: o índice de ênfase favorece a conversa, que é mais solta e mais alta que o texto decorado.

Caso real: a fala mais enfática de um vídeo inteiro (energia 1,00, o topo absoluto da gravação) era "Amor, eu tô intacto!", dita para o marido fora de quadro. Três das sete palavras de maior ênfase do vídeo vinham dessa única frase de bastidor.

Nenhum limiar acústico separa isso. O texto separa sem erro.

Atenção: isso também não é diarização. Num caso real, a pessoa da equipe estava fora do microfone — a diarização a ouvia, mas o Whisper não a transcrevia. As falas a descartar eram da própria protagonista: mesma voz, contexto diferente. "Quem fala" e "isso é tomada válida" são perguntas diferentes.

Descartar — conversa com a equipe

Reconhece-se pelo conteúdo:

  • vocativo para alguém da sala — "Amor, eu tô intacto!"
  • pergunta operacional — "Posso começar da mastopexia?", "E aí, continua?", "Mas eu vou ter que falar tudo de novo?"
  • instrução técnica — "Só clica aí agora na tela.", "Aumenta."
  • comentário sobre a própria gravação — "Vou falar só a última frase, só um pouquinho, não pegou?"

Descartar — frases interrompidas

Texto que morre no meio, tipicamente em reticências ou emendando numa pergunta:

  • "E tudo isso associado à medida..."
  • "Aquela mama com um formato mais estruturado, com o colo que..."
  • "de pele..."

Sinais estruturais que ajudam

Use take_boundary para achar onde cada tomada recomeça. Num material real, as fronteiras (gaps de 3,6s a 19,8s) caíam exatamente nos pontos onde a médica reiniciava o roteiro — inclusive nas duas retomadas da frase de abertura.