Saltar al contenido
Nóesis
Todas las familias
F31Redes que aprendendesde 2006

Voz y habla

Espectrogramas, CTC y síntesis por formantes

El habla es una señal continua que escondemos en tiempo-frecuencia. Reconocerla y sintetizarla son dos caras del mismo espectro.

2006
año fundacional
1
laboratorio
2
ecuaciones
4
hitos citados
Ir al laboratorio en vivo
Lámina F31semitono de dos tintas · en vivo
§1

Intuición

Pensar es ajustar millones de conexiones.

Un espectrograma corta el sonido en ventanas y muestra energía por frecuencia.

CTC alinea una secuencia de emisiones con el texto sin segmentar a mano.

El laboratorio visualiza formantes y un juguete CTC/HMM.

§2

Mecanismo

STFT → Mel → (opcional) MFCC.

CTC: suma sobre alineaciones con blank; loss =−logp(y∣x)= -log p(y|x).

ASR moderno: Conformer, Whisper; TTS: WaveNet, VITS, formantes clásicos.

Ec. 31.1STFT
X(m,k)=∑nx[n]w[n−m]e−j2πkn/NX(m,k)=\sum_n x[n]w[n-m]e^{-j2\pi kn/N}
Ec. 31.2CTC: suma de alineaciones
p(y∣x)=∑a∈B−1(y)p(a∣x)p(y|x)=\sum_{a\in\mathcal{B}^{-1}(y)}p(a|x)
§3

Laboratorio

Lab 31.1 calculado en tu navegadorDetectando…

Espectrograma y formantes

Dibuja o elige una vocal; mira el espectrograma, los formantes F1–F2 y una alineación CTC de juguete.

§4

Historia

  1. 1960

    Fant y los formantes del habla.

    Fant (1960)

  2. 1989

    HMM-GMM dominan ASR.

    Rabiner

  3. 2006

    CTC (Graves et al.).

    Graves et al. (2006)

  4. 2022

    Whisper: ASR robusto a escala.

    Radford et al.

§5

Límites

1

Ruido y acentos degradan.

2

CTC no modela el lenguaje; hace falta LM externo o seq2seq.

3

Síntesis expresiva sigue dura.

§6 · Pregunta filosófica

¿La voz es el alma o sólo espectro?

Reconocer la voz no es entender al hablante.

¿Qué se pierde al comprimir el habla a tokens?

Familias conectadas