Voz y habla
Espectrogramas, CTC y síntesis por formantes
El habla es una señal continua que escondemos en tiempo-frecuencia. Reconocerla y sintetizarla son dos caras del mismo espectro.
Intuición
Un espectrograma corta el sonido en ventanas y muestra energía por frecuencia.
CTC alinea una secuencia de emisiones con el texto sin segmentar a mano.
El laboratorio visualiza formantes y un juguete CTC/HMM.
Mecanismo
STFT → Mel → (opcional) MFCC.
CTC: suma sobre alineaciones con blank; loss .
ASR moderno: Conformer, Whisper; TTS: WaveNet, VITS, formantes clásicos.
Laboratorio
Espectrograma y formantes
Dibuja o elige una vocal; mira el espectrograma, los formantes F1–F2 y una alineación CTC de juguete.
Historia
- 1960
Fant y los formantes del habla.
Fant (1960)
- 1989
HMM-GMM dominan ASR.
Rabiner
- 2006
CTC (Graves et al.).
Graves et al. (2006)
- 2022
Whisper: ASR robusto a escala.
Radford et al.
Límites
Ruido y acentos degradan.
CTC no modela el lenguaje; hace falta LM externo o seq2seq.
Síntesis expresiva sigue dura.
¿La voz es el alma o sólo espectro?
Reconocer la voz no es entender al hablante.
¿Qué se pierde al comprimir el habla a tokens?