Files
jhonny-editor/code/plugins/premiere-pro/skills/editar-por-voz/criterios/05-zoom.md
T
João Henrique dd341e7d4c feat: Instalado essentia-tensorflow no venv whisperx-transcricao (
- Instalado essentia-tensorflow no venv whisperx-transcricao (usado pelo painel CEP), corrigindo erro "A classificação musical precisa do suporte TensorFlow do Essentia" no catálogo de trilhas.
- Ligada a classificação de emoção da fala (ProviderDeEmocaoHuggingFace) ao scanner via nova flag `classificar_emocao`, e adicionado emoção/confiança como critério de desempate secundário no zoom da skill editar-por-voz.
- Zoom do caminho Python (aplicar_plano_de_edicao.py) passou a usar adjustment layer numa faixa de vídeo própria, em vez de escalar o clipe inteiro via set_clip_properties — mesma técnica já usada pelo executor .mjs do painel CEP.
- Adicionado campo "Carregar por ID" na aba Editar Vídeo do painel CEP (step 2), para carregar um plano do SQLite direto pelo plano_id quando ele não está associado a nenhum video_id conhecido (ex.: plano de um vídeo que este banco nunca escaneou).
- Trocado o campo de ID numérico por uma lista suspensa (novo listar_planos_de_edicao.py + RepositorioDePlanos.listar_todos_os_planos) que mostra data/hora e a intenção registrada pela skill em cada plano salvo, para escolher sem decorar o id.

Resumo:
- 15 arquivos alterados
- 2 novos
- 13 modificados
- 0 removidos

 13 files changed, 451 insertions(+), 65 deletions(-)

Arquivos:
  - .jhonny/analises.db
  - code/cep-plugin/index.html
  - code/cep-plugin/main.js
  - code/engine/editor/aplicador_de_plano_de_edicao.py
  - code/engine/editor/escrita/escrita_no_editor.py
  - code/engine/executar_scanner.py
  - code/engine/persistencia/repositorio_de_planos.py
  - code/engine/scanner/configuracao_visual.py
  - code/engine/testes/duplos_de_premiere.py
  - code/engine/testes/test_aplicador_de_plano_de_edicao.py
  - code/engine/testes/test_escrita_no_editor.py
  - code/plugins/premiere-pro/skills/editar-por-voz/criterios/01-leitura-do-json.md
  - code/plugins/premiere-pro/skills/editar-por-voz/criterios/05-zoom.md
  - code/engine/listar_planos_de_edicao.py
  - code/engine/testes/test_configuracao_visual_do_scanner.py
2026-09-10 16:04:15 -04:00

3.9 KiB
Raw Blame History

05 — Zoom (punch-in)

Escopo: Onde dar punch-in, qual janela e qual escala — e o que a escala significa além do zoom. Quando: Fase 5 — ver a ordem de trabalho em ../SKILL.md.

Quando usar

No momento em que o argumento vira. Um pico acústico só merece zoom se for também um pico de sentido.

Palavra gritada sem peso narrativo não ganha nada — e isso inclui os picos que caem em artigos e conectivos, que são picos de entrega, não de conteúdo.

Emoção só desempata, nunca decide sozinha

Quando emocao/confianca_emocao estiverem disponíveis (ver 01-leitura-do-json.md) e dois candidatos estiverem próximos em emphasis/relevância narrativa, use a emoção com confianca_emocao acima de ~0,6 como critério de desempate a favor do trecho com emoção mais forte e coerente com o conteúdo. Isso nunca eleva um trecho sem peso narrativo a candidato de zoom — só decide entre candidatos que já seriam elegíveis de qualquer forma. Quando esses campos vierem vazios (caso mais comum hoje), decida como sempre: emphasis + relevância narrativa.

A janela

start — na palavra de ênfase.

end — no fim da frase. A frase inteira, não o fim do segmento da transcrição.

O Whisper corta frases no meio, por respiração e não por gramática:

"Aquela mama com um formato mais estruturado, que valoriza o seu colo, que dá aquele ar" | "de elegância, isso é desejo de muitas mulheres, né?"

Soltar o zoom no fim do primeiro segmento libera no meio do pensamento — é o que faz um punch-in parecer arbitrário. suggest_zoom_windows já estende até a pontuação final (. ! ? …), e nunca atravessa uma fronteira de tomada.

A forma — o programa decide sozinho

Você escolhe start e end; a forma sai da posição da janela dentro do trecho:

Situação Comportamento Por quê
Começa a >0,5s do início do trecho entrada rápida (~0,25s) o movimento chega junto com a palavra
Começa a ≤0,5s do início entra já ampliado, sem transição o corte já foi a transição; uma rampa ali lê como a imagem se acomodando
Frase termina no meio do trecho saída seca, 1 frame volta ao enquadramento sem chamar atenção
Frase termina a ≤1s do corte não volta — segura até o corte o próximo trecho já abre no enquadramento dele; voltar antes é movimento desperdiçado

Os limiares são diferentes de propósito: no fim o corte esconde um retorno inacabado, mas no início a rampa é visível desde o primeiro frame.

Para forçar manualmente, existem start_at_peak e hold_at_end — mas o automático acerta na quase totalidade dos casos.

Escala

Valor Uso
1,15 sutil
1,18 – 1,3 padrão
1,5 forte

Em vídeo institucional, fique na faixa baixa. Acima de 3,0 é rejeitado.

Não espalhe zoom "por segurança". Cada ação é aplicada diretamente ao clipe e excesso de escala vira trabalho de correção manual. Zoom não ativa legenda nem muda o texto por efeito colateral no fluxo atual.

O zoom é relativo ao enquadramento existente: se o clipe já tem escala 1,77 (material gravado de lado e reenquadrado), um zoom 1,18 anima de 1,77 para 2,09 e preserva rotação e posição.

Dois zooms no mesmo clipe

Depois do corte, dois picos que você escolheu podem cair no mesmo trecho sobrevivente (nenhum corte os separou em clipes distintos) — é comum quando a corrida limpa de uma tomada é longa. O sistema resolve isso sozinho, e a regra é a mesma que rege o resto: janelas distantes empilham (os dois zooms convivem, cada um voltando ao enquadramento real entre um e outro); janelas que se sobrepõem substituem (é o mesmo evento sendo reajustado, não dois). Você não precisa calcular isso na hora de decidir — só respeitar o min_gap de 07-ritmo.md, que já garante que dois zooms escolhidos por você nunca se sobrepõem.