# Glossário da análise emocional ## Modelo utilizado O classificador local é `superb/wav2vec2-base-superb-er`, executado com `transformers` e PyTorch. O modelo foi treinado para classificação de emoção em fala e retorna quatro classes: `neu`, `hap`, `ang` e `sad`. ## Campos do JSON ### `emocao` Classe emocional mais provável para o segmento de áudio. ### `confianca_emocao` Probabilidade atribuída pelo classificador à classe escolhida, entre `0` e `1`. Não é uma certeza nem uma medida de qualidade da transcrição. Um valor de `0.58`, por exemplo, indica uma classificação fraca/moderada; valores próximos de `1` indicam maior segurança relativa do modelo. ### `palavras` Lista de palavras reconhecidas pelo Whisper, cada uma com seu intervalo de tempo no arquivo original ou na timeline projetada. ### `caracteristicas_acusticas` Campo reservado para medidas como pitch, energia, velocidade da fala e pausas. Ainda não é preenchido pelo classificador atual. ## Glossário das classes | Código | Significado | Interpretação editorial | |---|---|---| | `neu` | Neutral | Fala sem sinal emocional forte ou com expressão equilibrada. | | `hap` | Happy | Sinal acústico associado a alegria, animação ou entusiasmo. | | `ang` | Angry | Sinal acústico associado a irritação, tensão ou intensidade agressiva. | | `sad` | Sad | Sinal acústico associado a tristeza, abatimento ou baixa energia. | Os códigos são abreviações do modelo: `hap` significa *happy* e `ang` significa *angry*. Eles não devem ser interpretados como diagnóstico do estado emocional real da pessoa. Ruído, sotaque, idioma, contexto, atuação, ironia e qualidade da gravação podem alterar a classificação. ## Decisão de uso no editor A emoção é calculada por segmento/frase, enquanto as palavras mantêm seus timestamps individuais. Isso permite usar a emoção como sinal editorial para ordenar ou sugerir cortes sem atribuir uma emoção artificial a cada palavra.