feat: copiada a skill editar-por-voz e seus critérios para as skil

- copiada a skill editar-por-voz e seus critérios para as skills do projeto
- adaptada a skill editar-por-voz para usar o banco SQLite como fonte oficial
- corrigida a cópia do JSON do tipo de vídeo para priorizar clipboard Unicode
- criado carregador único do contexto de edição por voz a partir do SQLite
- criada entrada para registrar planos no SQLite e reaproveitar o mesmo plano na aplicação
- habilitado carregamento do plano editorial diretamente do SQLite na interface
- corrigido o bloqueio visual da etapa de carregamento do plano salvo
- configurado carregamento automático do plano salvo após selecionar a sequência
- documentada a sequência como raiz de retomada do fluxo de edição
- criada a estrutura local para análise de músicas instrumentais com Essentia

Resumo:
- 22 arquivos alterados
- 11 novos
- 11 modificados
- 0 removidos

 11 files changed, 270 insertions(+), 34 deletions(-)

Arquivos:
  - .jhonny/analises.db
  - CONTEXT.md
  - code/cep-plugin/index.html
  - code/cep-plugin/main.js
  - code/engine/README.md
  - code/engine/aplicar_plano_de_edicao.py
  - code/engine/integracoes/audio/__init__.py
  - code/engine/persistencia/consultas.py
  - code/engine/requirements-audio.txt
  - code/engine/testes/test_consultas_de_persistencia.py
  - code/tests/cep-tipos-video-encoding.test.ts
  - code/.jhonny/
  - code/engine/carregar_plano_de_edicao.py
  - code/engine/integracoes/audio/contratos.py
  - code/engine/integracoes/audio/modelos_de_analise_musical.py
  - code/engine/integracoes/audio/provider_de_analise_musical_essentia.py
  - code/engine/preparar_edicao_por_voz.py
  - code/engine/registrar_plano_de_edicao.py
  - code/engine/testes/test_analisador_de_musica_essentia.py
  - code/engine/testes/test_carregar_plano_de_edicao.py
  - code/engine/testes/test_registrar_plano_de_edicao.py
  - code/plugins/premiere-pro/skills/editar-por-voz/
This commit is contained in:
João Henrique
2026-09-10 13:09:01 -04:00
parent eda1b1aadc
commit a9e5b5ff58
33 changed files with 1811 additions and 34 deletions
@@ -0,0 +1,84 @@
# 05 — Zoom (punch-in)
> **Escopo:** Onde dar punch-in, qual janela e qual escala — e o que a escala significa além do zoom.
> **Quando:** Fase 5 — ver a ordem de trabalho em `../SKILL.md`.
## Quando usar
No momento em que o argumento vira. Um pico acústico só merece zoom se for
também um pico **de sentido**.
Palavra gritada sem peso narrativo não ganha nada — e isso inclui os picos
que caem em artigos e conectivos, que são picos de entrega, não de conteúdo.
## A janela
**`start`** — na palavra de ênfase.
**`end`** — no **fim da frase**. A frase inteira, não o fim do segmento da
transcrição.
O Whisper corta frases no meio, por respiração e não por gramática:
> *"Aquela mama com um formato mais estruturado, que valoriza o seu colo,
> que dá aquele ar"* **|** *"de elegância, isso é desejo de muitas mulheres,
> né?"*
Soltar o zoom no fim do primeiro segmento libera **no meio do pensamento** —
é o que faz um punch-in parecer arbitrário. `suggest_zoom_windows` já
estende até a pontuação final (`.` `!` `?` `…`), e nunca atravessa uma
fronteira de tomada.
## A forma — o programa decide sozinho
Você escolhe `start` e `end`; a forma sai da posição da janela dentro do
trecho:
| Situação | Comportamento | Por quê |
|---|---|---|
| Começa a **>0,5s** do início do trecho | entrada rápida (~0,25s) | o movimento chega junto com a palavra |
| Começa a **≤0,5s** do início | **entra já ampliado, sem transição** | o corte já foi a transição; uma rampa ali lê como a imagem se acomodando |
| Frase termina no meio do trecho | **saída seca**, 1 frame | volta ao enquadramento sem chamar atenção |
| Frase termina a **≤1s** do corte | **não volta** — segura até o corte | o próximo trecho já abre no enquadramento dele; voltar antes é movimento desperdiçado |
Os limiares são diferentes de propósito: no fim o corte esconde um retorno
inacabado, mas no início a rampa é visível desde o primeiro frame.
Para forçar manualmente, existem `start_at_peak` e `hold_at_end` — mas o
automático acerta na quase totalidade dos casos.
## Escala
| Valor | Uso | Vira, na tela de revisão |
|---|---|---|
| 1,15 | sutil | ênfase **1 — Leve** |
| 1,18 – 1,3 | padrão | ênfase **2 — Média** |
| 1,5 | forte | ênfase **3 — Forte** |
Em vídeo institucional, fique na faixa baixa. Acima de 3,0 é rejeitado.
**A escala tem um segundo efeito, e ele é maior que o zoom.** A frase que
recebe um zoom é marcada como **ênfase** na etapa 5, e frase de ênfase recebe
**legenda dinâmica**; as demais ficam com legenda comum. Ou seja: escolher onde
dar zoom é também escolher onde o texto ganha tratamento tipográfico.
Consequência prática: **não espalhe zoom "por segurança"**. Cada um promove uma
frase a destaque em duas dimensões ao mesmo tempo. Na dúvida, deixe sem — o
editor promove numa tecla, e despromover custa mais que promover.
Detalhe: `10-revisao-humana.md`.
O zoom é **relativo ao enquadramento existente**: se o clipe já tem escala
1,77 (material gravado de lado e reenquadrado), um zoom 1,18 anima de 1,77
para 2,09 e preserva rotação e posição.
## Dois zooms no mesmo clipe
Depois do corte, dois picos que você escolheu podem cair no **mesmo**
trecho sobrevivente (nenhum corte os separou em clipes distintos) — é
comum quando a corrida limpa de uma tomada é longa. O sistema resolve isso
sozinho, e a regra é a mesma que rege o resto: janelas **distantes**
empilham (os dois zooms convivem, cada um voltando ao enquadramento real
entre um e outro); janelas que **se sobrepõem** substituem (é o mesmo
evento sendo reajustado, não dois). Você não precisa calcular isso na
hora de decidir — só respeitar o `min_gap` de `07-ritmo.md`, que já
garante que dois zooms escolhidos por você nunca se sobrepõem.