Voz: reconocimiento, síntesis, prosodia y vocoders
Volver a la ruta AI-901
AI-901Capítulo 4

Preparación para la Certificación Microsoft AI-901

Voz: reconocimiento, síntesis, prosodia y vocoders

Escenarios de voz, MFCC, transformers acústicos, beam search, text-to-speech, G2P, prosodia y generación neuronal de audio

Tiempo de estudio sugerido: 35 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA generativa, visión, voz, nube y agentes

1. Introducción a las soluciones habilitadas para voz

La voz es una forma natural de comunicación. Incorporarla a aplicaciones de IA puede hacer que asistentes, funciones de accesibilidad y agentes conversacionales sean más intuitivos, inclusivos y atractivos.

Dos capacidades forman la base: el reconocimiento convierte palabras habladas en texto y la síntesis transforma texto en audio de sonido natural. Juntas crean interacciones de voz continuas.

Flujo del audio al reconocimiento, la aplicación, la síntesis y la voz natural.
El reconocimiento aporta la entrada textual y la síntesis produce la salida audible.

Beneficios generales

  • Accesibilidad para personas con discapacidad visual o dificultades de movilidad.
  • Productividad mediante trabajo manos libres y multitarea sin teclado ni pantalla.
  • Experiencias más naturales, humanas y atractivas.
  • Alcance global en varios idiomas, acentos y dialectos regionales.

El módulo original permite estudiar con vídeo o con texto e imágenes. La versión escrita suele incluir más detalles y puede complementar los vídeos.

2. Escenarios de reconocimiento de voz

Usos de speech-to-text y valor empresarial.
EscenarioQué haceValor
Atención al clienteTranscribe llamadas en directo, dirige según lo dicho, analiza sentimiento y problemas recurrentes y crea registros consultables para cumplimiento y formación.Reduce notas manuales, mejora respuestas y descubre información para elevar la calidad.
Asistentes y agentes por vozAcepta órdenes, responde preguntas, crea recordatorios, envía mensajes, busca y controla hogares, vehículos y dispositivos vestibles.Aumenta la participación, simplifica flujos y funciona donde una pantalla no es práctica.
Reuniones y entrevistasCrea notas y tareas consultables, subtítulos en tiempo real, resúmenes de entrevistas y grupos focales y puntos clave para seguimiento.Ahorra transcripción, conserva registros precisos y hace accesible el contenido hablado.
Documentación sanitariaDicta al historial clínico electrónico, actualiza tratamientos durante la atención y captura detalles al momento.Devuelve tiempo al paciente, reduce administración y agotamiento y mejora la integridad del registro.

3. Escenarios de síntesis de voz

Usos de text-to-speech y valor empresarial.
EscenarioQué haceValor
IA conversacional y chatbotsResponde con voces naturales, adapta tono, ritmo y estilo, atiende por teléfono y mantiene la marca entre voz y texto.Acerca los agentes, reduce esfuerzo y amplía el servicio a canales de solo voz.
Accesibilidad y consumoLee páginas y documentos, apoya discapacidades visuales o lectoras y ofrece audio al conducir, ejercitarse o trabajar.Amplía el público, demuestra inclusión y mejora la satisfacción.
Notificaciones y alertasAnuncia alertas, recordatorios, navegación y estado operativo sin exigir atención visual.Mejora seguridad y capacidad de respuesta.
Aprendizaje y formaciónNarra clases sin estudio, enseña pronunciación, crea alternativas de audio y escala a varios idiomas.Reduce costos, atiende preferencias y acelera la producción.
Entretenimiento y mediosCrea personajes, prototipos de pódcast y audiolibro, locuciones y audio personalizado.Abarata prototipos y personaliza a escala.

4. Conversaciones completas y decisiones de implementación

Las soluciones combinadas escuchan, procesan y contestan. La atención por voz reconoce una solicitud y sintetiza ayuda; un IVR guía mediante diálogo natural; una aplicación de idiomas evalúa una frase y pronuncia correcciones; un vehículo recibe órdenes sin manos y confirma acciones.

Conviene validar primero una sola capacidad en el escenario de mayor valor y después ampliar a flujos conversacionales más complejos.

Factores que deben evaluarse.
FactorImpacto
Calidad del audioRuido, micrófono, distancia y ancho de banda afectan al reconocimiento.
Idioma y dialectoLos idiomas y variantes regionales del público deben ser compatibles.
Privacidad y cumplimientoProcesamiento, almacenamiento y protección del audio deben cumplir obligaciones.
LatenciaEl diálogo en vivo necesita poca demora; la transcripción por lotes puede esperar.
AccesibilidadLa experiencia debe respetar WCAG y evitar nuevas barreras.

Siempre deben existir métodos alternativos de entrada y salida, porque algunas personas prefieren o necesitan una interfaz textual.

5. Reconocimiento: captura y visión del

-to-text coordina seis etapas: captura de audio, preparación de características, modelado acústico, modelado del lenguaje, decodificación y refinamiento.

Pipeline de reconocimiento de voz en seis etapas.
Cada etapa transforma y enriquece la salida anterior.

El micrófono convierte ondas analógicas en muestras numéricas. Los sistemas de voz suelen usar 16.000 muestras por segundo, o 16 kHz. Tasas musicales como 44,1 kHz capturan más detalle con mayor costo; entre 8 y 16 kHz suele equilibrar claridad y eficiencia.

El ruido, la calidad del micrófono y la distancia afectan la precisión posterior. Los filtros iniciales pueden quitar zumbidos, chasquidos e interferencias.

6. Preprocesamiento y características MFCC

Las muestras sin procesar contienen demasiada información. El preprocesamiento conserva rasgos de la voz y descarta datos menos útiles, como el volumen absoluto.

Los coeficientes cepstrales en las frecuencias de Mel, o MFCC, aproximan la percepción humana y resaltan las bandas donde se concentra la energía del habla.

  1. Dividir la señal en tramas superpuestas de 20 a 30 milisegundos.
  2. Aplicar la transformada de Fourier para revelar tonos en el dominio de frecuencia.
  3. Mapear las bandas a la escala Mel, acorde con la mayor sensibilidad humana a tonos bajos.
  4. Calcular un resumen compacto, normalmente 13 coeficientes, del espectro de cada trama.
Audio digital convertido en vectores MFCC por trama.
Cada columna de la representación final contiene 13 coeficientes de una trama temporal.
Trama 1: [-113,2; 45,3; 12,1; -3,4; 7,8; ...]  // 13 coeficientes
Trama 2: [-112,8; 44,7; 11,8; -3,1; 7,5; ...]
Trama 3: [-110,5; 43,9; 11,5; -2,9; 7,3; ...]

7. Modelo acústico y fonemas

El modelo acústico aprende la relación entre características y fonemas, las unidades sonoras mínimas que distinguen palabras. El inglés tiene cerca de 44; “cat” contiene /k/, /æ/ y /t/.

Los transformers modernos procesan secuencias MFCC y estiman fonemas a lo largo del tiempo. La atención consulta tramas vecinas, el procesamiento paralelo analiza muchas a la vez y el contexto aprendido favorece secuencias habituales.

La salida es una distribución: una trama puede asignar 80% a /æ/, 15% a /ɛ/ y 5% a otros sonidos. Los fonemas dependen del idioma; un modelo inglés no reconoce tonos del mandarín sin volver a entrenarse.

Vectores MFCC alimentan un transformer acústico, un modelo de lenguaje y beam search.
El sistema combina evidencia acústica con contexto, vocabulario y gramática.

8. Modelo de lenguaje y decodificación

Los fonemas no resuelven homófonos como “their” y “there”. El modelo de lenguaje aporta vocabulario, gramática y patrones: prefiere “The weather is nice”, espera un verbo tras “I need to” y puede adaptarse a terminología médica o jurídica.

La decodificación busca entre millones de secuencias la hipótesis que mejor equilibra audio y texto legible. Beam search mantiene una lista corta de transcripciones parciales fuertes, amplía cada una, elimina caminos débiles y conserva las mejores.

Una frase de tres segundos puede generar miles de candidatas antes de elegir “Please send the report by Friday” frente a variantes fonéticamente cercanas. En tiempo real se limita el ancho del beam y la profundidad para equilibrar precisión y latencia.

9. Posprocesamiento y salida del reconocimiento

Operaciones de refinamiento.
TareaEjemplo o finalidad
MayúsculasConvierte “hello my name is sam” en “Hello my name is Sam.”
PuntuaciónRestaura puntos, comas e interrogaciones con prosodia y gramática.
NúmerosConvierte “one thousand twenty three” en “1,023”.
Filtro de contenidoOculta o elimina palabras según la directiva.
Normalización inversaConvierte “three p m” en “3 PM”.
ConfianzaMarca palabras inciertas para revisión humana en contextos críticos.

La capacidad puede devolver transcripción, marcas de tiempo por palabra y puntuaciones de confianza. La aplicación puede destacar dudas o activar una alternativa. Separar las fases facilita localizar entrada deficiente, poco entrenamiento del dominio o reglas de formato demasiado agresivas.

10. Síntesis: normalización y análisis lingüístico

Text-to-speech construye audio natural mediante cuatro transformaciones.

Pipeline de síntesis de voz en cuatro etapas.
El texto se normaliza, se convierte en fonemas, recibe prosodia y se representa como audio.

La normalización expande abreviaturas, números, fechas, horas y símbolos y resuelve homógrafos por contexto. “Dr. Smith ordered 3 items for $25.50 on 12/15/2023” pasa a una forma pronunciable equivalente a “Doctor Smith ordered three items for twenty-five dollars and fifty cents on December fifteenth, two thousand twenty-three”. Las dosis médicas requieren reglas distintas de monedas y porcentajes.

El análisis lingüístico segmenta palabras y sílabas, consulta léxicos, aplica reglas o modelos G2P a términos desconocidos, marca límites y acentos y considera sonidos vecinos. La conversión grafema-fonema es necesaria porque “though”, “through” y “cough” comparten “ough”, pero producen /ðoʊ/, /θruː/ y /kɔːf/.

Los modelos neuronales G2P entrenados con diccionarios gestionan nombres propios, términos raros y variantes regionales. Los transformers usan contexto para distinguir presente /riːd/ y pasado /rɛd/ en “read”.

11. Generación de prosodia

La prosodia reúne ritmo, acento y entonación. Incluye contorno tonal, duración, intensidad, pausas y sílabas tónicas. Cambiar la palabra enfatizada en “I never said he ate the cake” cambia el significado implícito.

  1. Codificar fonemas con puntuación, categoría gramatical y estructura.
  2. Usar autoatención para relacionar palabras, referencias y límites.
  3. Predecir tono, duración y energía de cada fonema.
  4. Aplicar estilo neutro, expresivo o conversacional y rasgos del hablante.

Miles de horas alineadas con transcripciones enseñan que las preguntas suelen subir, las comas pausan, el énfasis alarga y los finales bajan. Sintaxis, semántica, contraste discursivo, identidad y emoción influyen en el resultado.

Un objetivo puede pedir /æ/ a 180 Hz durante 80 ms con intensidad moderada y luego 200 ms de pausa. La prosodia plana, y no una pronunciación fonética incorrecta, suele producir la sensación robótica.

12. Vocoders y generación del audio

Un modelo acústico, a menudo transformer, convierte fonemas y prosodia en un espectrograma Mel. Un vocoder neuronal lo transforma en una onda de 16.000 a 48.000 muestras de amplitud por segundo; después se aplican filtros, normalización o efectos.

WaveNet, WaveGlow y HiFi-GAN son arquitecturas conocidas. Los vocoders neuronales ofrecen fidelidad cercana al estudio, detalles vocales sutiles, generación en tiempo real y adaptación a hablantes, idiomas y estilos. Ejecutan el sentido inverso del reconocimiento: una representación lingüística se convierte en audio.

Transformer de prosodia que alimenta un espectrograma Mel y un vocoder neuronal.
Tono, duración, intensidad y pausas guían la forma de onda final.

Para “Dr. Chen’s appointment is at 3:00 PM”, la normalización expande título y hora, el análisis crea fonemas, la prosodia eleva “appointment”, pausa tras “is” y enfatiza “three”, y la síntesis produce la onda. En hardware moderno suele completarse en menos de un segundo.

13. Ejercicio, evaluación y resumen

El ejercicio usa el modo de voz de Chat Playground para hablar con un modelo, preguntar y escuchar respuestas, mostrando reconocimiento y síntesis en una experiencia.

Captura original de Chat Playground con modo de voz.
Se conserva la captura real; los diagramas conceptuales se recrearon en SVG.

Comprobación reformulada

  1. ¿En el preprocesamiento se convierte a WMV, se añade ruido o se extraen vectores de la onda?
  2. ¿Los fonemas son artefactos eliminados, unidades mínimas de sonido o modelos generadores?
  3. ¿La prosodia maximiza volumen, traduce idiomas o crea pronunciación y cadencia naturales?

Respuestas

  • El preprocesamiento extrae vectores de características para el modelado.
  • Los fonemas son las unidades mínimas de sonido que distinguen el habla.
  • La prosodia aporta ritmo, tono, acento y cadencia naturales.

En resumen, el reconocimiento convierte sonido en texto mediante captura, MFCC, modelos acústico y de lenguaje, decodificación y refinamiento. La síntesis usa normalización, fonemas, prosodia y vocoder. Juntas sostienen conversaciones bidireccionales en servicio, accesibilidad, salud, educación y agentes.