Tecnología
Desde la captura de audio en bruto hasta la lectura visual de las 12 Zonas — qué es procesamiento de señal estándar, qué es marco propietario, y dónde termina cada uno.
Etapa 1
Cada sesión comienza con 60 segundos de calibración. Durante este intervalo, el sistema establece el promedio y la variabilidad de la frecuencia fundamental (F0) del paciente en reposo, mapea el perfil de ruido del ambiente y del micrófono, y fija (baseline_locked) los valores de referencia que se usarán en todas las comparaciones de la sesión.
Esto existe porque el análisis acústico absoluto no tiene sentido clínico: una voz naturalmente grave no puede confundirse con un retardo psicomotor, y una voz aguda no puede leerse como hiperactivación. Cada paciente se compara únicamente consigo mismo.
F0 basal (promedio y desviación estándar), densidad espectral de potencia por banda (vía FFT en el navegador — Web Audio API, sin biblioteca DSP en el backend), ruido de fondo, y el estado inicial de los 468 puntos faciales rastreados.
Estado de sesión implementado como una máquina de estados CALIBRATING → LIVE → ENDED, con una acción BASELINE_LOCK que dispara la fijación de los valores de referencia (froid-dashboard/src/pages/LiveSession.tsx).
Etapa 2
En cada ventana de análisis, FROID extrae un conjunto de características vocales y compara cada una con la línea de base fijada.
Coeficientes cepstrales en escala Mel y sus derivadas (Δ, ΔΔ). En el estudio ancla, el MFCC7 bajo contenido negativo es predictivo de la escala de depresión (β=0,90) y el MFCC9 se correlaciona inversamente con la ansiedad somática de Hamilton (β=−0,45) — por eso FROID lee el ΔΔMFCC9 como marcador de la aceleración de la tensión laríngea.
Frecuencia fundamental y tasa de cruce por cero, extraídas de forma continua y comparadas con la variabilidad basal.
Índices internos normalizados (no el jitter% / shimmer dB clínicos clásicos) derivados de un ZCR escalado y del coeficiente de variación de la envolvente RMS — señalan inestabilidad vocal relativa.
En el código de producción (LiveSession.tsx), estas métricas están explícitamente etiquetadas como proxies, con una unidad documentada:
Es decir: no equivalen directamente al jitter en % ni al shimmer en dB tal como los definen Boersma & Weenink (Praat). Son un proxy derivado, usado como señal relativa de inestabilidad — no como valor clínico normativo. La extracción física validada (equivalente a Praat) está en la hoja de ruta.
Picos sostenidos en la aceleración de la derivada Delta-Delta (ΔΔMFCC9 > 1,8) señalan microcontracciones reflejas de las cuerdas vocales y sirven como disparador biofísico de fricción somatoafectiva. El umbral de 1,8 es un parámetro de ingeniería calibrable, no una constante publicada.
Etapa 3
468 puntos faciales son rastreados por visión por computadora local, clasificados en Unidades de Acción (AU) según el Facial Action Coding System, con modelado temporal de onset, apex y offset.
Cuando una configuración facial (ej.: AU12 sin AU6, o AU23/AU24 sostenidas) coincide con una desviación acústica relevante en una zona, el sistema aplica un multiplicador de disonancia a la lectura de esa zona.
Forma binaria aplicada en producción cuando se activa el indicador de disonancia facial. El valor 2,5 es un parámetro de producto de FROID, no derivado de un estudio publicado — trátese como heurística de ingeniería calibrable, no como constante científica. El ensamblaje completo del IDM (promedio de las 12 zonas × M_fac) y la forma continua del multiplicador están en la Etapa 5.
La hipótesis clásica de que la ausencia de AU6 indica una sonrisa forzada tiene apoyo parcial en la literatura, pero también hay investigaciones recientes que la contradicen directamente, encontrando que la AU6 se relaciona más con la intensidad de la sonrisa que con la autenticidad emocional. FROID utiliza esta configuración como uno de varios factores de disonancia, no como un detector de mentiras aislado.
Etapa 4 · Marco propietario
La capa visual e interpretativa que organiza todas las señales anteriores en un mapa circular de 12 zonas, cada una asociada a una dicotomía temática clínica.
Una interfaz de visualización propietaria que distribuye la energía espectral vocal en 12 bandas, cada una afinada a una nota de la escala cromática y asociada por FROID a un tema clínico interpretativo (ej.: Zona 3 — «Tristeza vs. Paz interior»). La física subyacente (densidad espectral de potencia vía FFT) es real y medible.
No existe literatura revisada por pares que valide la asociación específica entre un rango estrecho de Hz y un tema psicológico. La estructura es una transposición adaptada de tecnología comercial de biofeedback vocal. Lo tratamos explícitamente como una heurística de producto de FROID.
Etapa 5 · Marco propietario
El cerebro humano no ejecuta Transformadas de Fourier ni rastrea 468 puntos faciales a 30 FPS mientras sostiene la alianza terapéutica. FROID resuelve este cuello de botella mediante reducción de dimensionalidad: fusiona voz, rostro y semántica en dos vectores que giran de forma continua en el panel de atención.
El «velocímetro» de la energía biológica de la sesión — cuantifica, en una escala de 0 a 100, la intensidad expresiva y la vitalidad psicomotora del paciente a cada segundo.
Combina la amplitud y la variabilidad de tres canales: energía acústica y variabilidad de F0 (voz), amplitud y velocidad de contracción de las Unidades de Acción (rostro), y densidad de términos de alto impacto emocional detectados por NLP (semántica). Un factor de confiabilidad dinámico por canal descarta variaciones espurias, como una tos o un cambio brusco de luz en la sala.
Lectura clínica: una caída sostenida apunta a letargo o retardo motor depresivo; picos frecuentes indican hiperactivación, agitación ansiosa o aceleración de pensamientos.
La «brújula» que indica la dirección y la coherencia de esa energía — evalúa si las reacciones del paciente son congruentes con el contenido abordado o si hay una ruptura de simetría que revele resistencia, represión o somatización.
Compara las lecturas instantáneas con la línea de base individual fijada en los primeros 60 segundos. Cuando el canal facial y el vocal se contradicen — contenido triste con infratemblor vocal (5–12 Hz) pero sonrisa solo voluntaria (AU12 sin AU6) — aplica el Multiplicador Facial de Disonancia, desplazando el índice hacia los colores de alerta.
Lectura clínica: localiza «puntos calientes» emocionales — revela la Disonancia Somatoafectiva (Falsa Calma), cuando el estrés fue reprimido del rostro pero sigue tensionando la laringe.
σ es la sigmoide que comprime el resultado entre 0 y 100. |zᵢ(t)| es la magnitud de la desviación estandarizada (z-score) del canal respecto a la base de 60 s; rᵢ(t) ∈ [0,1] es la confiabilidad dinámica del canal; wᵢ son pesos calibrados por ingeniería de la fonación para equilibrar cada sensor.
En reposo o en congruencia, M_fac = 1,0. En el umbral máximo de disonancia (sonrisa social pura, sin contracción orbital, Conf_apex ≥ 0,75) el multiplicador alcanza el techo de 2,5. La producción actual aplica la forma binaria de este multiplicador (2,5 cuando se activa el indicador de disonancia, 1,0 en caso contrario — ver Etapa 3); la expresión continua anterior es el modelo de referencia. Implementado en froid-engine.ts → calculateIDM().
Honestidad de ingeniería: los pesos, los coeficientes de fusión y el propio 2,5 son parámetros de producto refinados en laboratorio — hipótesis clínicas cualificadas, no constantes científicas publicadas. La validación poblacional definitiva depende del Data-Froid anónimo (k-anonimato + hashes de un solo sentido). Ver el encuadre en Ciencia.
Etapa 6 · Marco propietario
En las pruebas con profesionales, una pantalla que cambia cada pocos segundos resultó demasiado rápida para evaluar todas las métricas con calma clínica. La respuesta de FROID: el procesamiento en bruto continúa en alta resolución (cadencia de 1 segundo), pero la presentación visual se estabiliza en una ventana clínica configurable — sin congelamiento y sin pérdida de precisión.
Cada 1 minuto, FROID cierra una microventana técnica. La pantalla muestra una ventana clínica móvil de 5 minutos, compuesta por las últimas 5 microventanas — consolidadas mediante promedio ponderado temporal, nunca un promedio simple: el minuto actual pesa más que los anteriores.
El profesional ve estabilidad, pero FROID sigue reaccionando de forma gradual a lo que está sucediendo ahora.
Tiempo real — sin congelamiento visual
1 minuto — ventana clínica ligera
3 minutos — supervisión dinámica
5 minutos — ajuste recomendado
7 minutos — sesión más lenta/reflexiva
«Tiempo real» significa que los gráficos e indicadores siguen la cadencia técnica disponible (≈1s/10s según el origen de la métrica) — no es tiempo real absoluto de laboratorio, sino la ausencia de congelamiento clínico de la pantalla.
El panel muestra Ventana clínica: 5min y el contador Próxima actualización en 03:42, con el botón Actualizar ahora siempre disponible.
Excepción de seguridad: una alerta crítica rompe la estabilización y actualiza la pantalla de inmediato, antes del plazo.
m_k es el valor consolidado de la microventana técnica k (1 minuto). El procesamiento en bruto sigue la cadencia de 1 segundo; solo la capa de presentación se estabiliza.
Referencia propietaria: FROID_Estabilizacao_Clinica_Da_Tela.md — documenta la métrica, las matemáticas y el razonamiento clínico, e integra la base de conocimiento consultada por FROID Explica. Los cortes semánticos de la sesión no se ven afectados por este módulo.