- Instalado essentia-tensorflow no venv whisperx-transcricao (usado pelo painel CEP), corrigindo erro "A classificação musical precisa do suporte TensorFlow do Essentia" no catálogo de trilhas. - Ligada a classificação de emoção da fala (ProviderDeEmocaoHuggingFace) ao scanner via nova flag `classificar_emocao`, e adicionado emoção/confiança como critério de desempate secundário no zoom da skill editar-por-voz. - Zoom do caminho Python (aplicar_plano_de_edicao.py) passou a usar adjustment layer numa faixa de vídeo própria, em vez de escalar o clipe inteiro via set_clip_properties — mesma técnica já usada pelo executor .mjs do painel CEP. - Adicionado campo "Carregar por ID" na aba Editar Vídeo do painel CEP (step 2), para carregar um plano do SQLite direto pelo plano_id quando ele não está associado a nenhum video_id conhecido (ex.: plano de um vídeo que este banco nunca escaneou). - Trocado o campo de ID numérico por uma lista suspensa (novo listar_planos_de_edicao.py + RepositorioDePlanos.listar_todos_os_planos) que mostra data/hora e a intenção registrada pela skill em cada plano salvo, para escolher sem decorar o id. Resumo: - 15 arquivos alterados - 2 novos - 13 modificados - 0 removidos 13 files changed, 451 insertions(+), 65 deletions(-) Arquivos: - .jhonny/analises.db - code/cep-plugin/index.html - code/cep-plugin/main.js - code/engine/editor/aplicador_de_plano_de_edicao.py - code/engine/editor/escrita/escrita_no_editor.py - code/engine/executar_scanner.py - code/engine/persistencia/repositorio_de_planos.py - code/engine/scanner/configuracao_visual.py - code/engine/testes/duplos_de_premiere.py - code/engine/testes/test_aplicador_de_plano_de_edicao.py - code/engine/testes/test_escrita_no_editor.py - code/plugins/premiere-pro/skills/editar-por-voz/criterios/01-leitura-do-json.md - code/plugins/premiere-pro/skills/editar-por-voz/criterios/05-zoom.md - code/engine/listar_planos_de_edicao.py - code/engine/testes/test_configuracao_visual_do_scanner.py
3.9 KiB
05 — Zoom (punch-in)
Escopo: Onde dar punch-in, qual janela e qual escala — e o que a escala significa além do zoom. Quando: Fase 5 — ver a ordem de trabalho em
../SKILL.md.
Quando usar
No momento em que o argumento vira. Um pico acústico só merece zoom se for também um pico de sentido.
Palavra gritada sem peso narrativo não ganha nada — e isso inclui os picos que caem em artigos e conectivos, que são picos de entrega, não de conteúdo.
Emoção só desempata, nunca decide sozinha
Quando emocao/confianca_emocao estiverem disponíveis (ver
01-leitura-do-json.md) e dois candidatos estiverem próximos em
emphasis/relevância narrativa, use a emoção com confianca_emocao acima
de ~0,6 como critério de desempate a favor do trecho com emoção mais forte
e coerente com o conteúdo. Isso nunca eleva um trecho sem peso narrativo a
candidato de zoom — só decide entre candidatos que já seriam elegíveis de
qualquer forma. Quando esses campos vierem vazios (caso mais comum hoje),
decida como sempre: emphasis + relevância narrativa.
A janela
start — na palavra de ênfase.
end — no fim da frase. A frase inteira, não o fim do segmento da
transcrição.
O Whisper corta frases no meio, por respiração e não por gramática:
"Aquela mama com um formato mais estruturado, que valoriza o seu colo, que dá aquele ar" | "de elegância, isso é desejo de muitas mulheres, né?"
Soltar o zoom no fim do primeiro segmento libera no meio do pensamento —
é o que faz um punch-in parecer arbitrário. suggest_zoom_windows já
estende até a pontuação final (. ! ? …), e nunca atravessa uma
fronteira de tomada.
A forma — o programa decide sozinho
Você escolhe start e end; a forma sai da posição da janela dentro do
trecho:
| Situação | Comportamento | Por quê |
|---|---|---|
| Começa a >0,5s do início do trecho | entrada rápida (~0,25s) | o movimento chega junto com a palavra |
| Começa a ≤0,5s do início | entra já ampliado, sem transição | o corte já foi a transição; uma rampa ali lê como a imagem se acomodando |
| Frase termina no meio do trecho | saída seca, 1 frame | volta ao enquadramento sem chamar atenção |
| Frase termina a ≤1s do corte | não volta — segura até o corte | o próximo trecho já abre no enquadramento dele; voltar antes é movimento desperdiçado |
Os limiares são diferentes de propósito: no fim o corte esconde um retorno inacabado, mas no início a rampa é visível desde o primeiro frame.
Para forçar manualmente, existem start_at_peak e hold_at_end — mas o
automático acerta na quase totalidade dos casos.
Escala
| Valor | Uso |
|---|---|
| 1,15 | sutil |
| 1,18 – 1,3 | padrão |
| 1,5 | forte |
Em vídeo institucional, fique na faixa baixa. Acima de 3,0 é rejeitado.
Não espalhe zoom "por segurança". Cada ação é aplicada diretamente ao clipe e excesso de escala vira trabalho de correção manual. Zoom não ativa legenda nem muda o texto por efeito colateral no fluxo atual.
O zoom é relativo ao enquadramento existente: se o clipe já tem escala 1,77 (material gravado de lado e reenquadrado), um zoom 1,18 anima de 1,77 para 2,09 e preserva rotação e posição.
Dois zooms no mesmo clipe
Depois do corte, dois picos que você escolheu podem cair no mesmo
trecho sobrevivente (nenhum corte os separou em clipes distintos) — é
comum quando a corrida limpa de uma tomada é longa. O sistema resolve isso
sozinho, e a regra é a mesma que rege o resto: janelas distantes
empilham (os dois zooms convivem, cada um voltando ao enquadramento real
entre um e outro); janelas que se sobrepõem substituem (é o mesmo
evento sendo reajustado, não dois). Você não precisa calcular isso na
hora de decidir — só respeitar o min_gap de 07-ritmo.md, que já
garante que dois zooms escolhidos por você nunca se sobrepõem.