Preparación para la Certificación Microsoft AI-901
Voz: reconocimiento, síntesis, prosodia y vocoders
Escenarios de voz, MFCC, transformers acústicos, beam search, text-to-speech, G2P, prosodia y generación neuronal de audio
Tiempo de estudio sugerido: 35 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. Introducción a las soluciones habilitadas para voz
La voz es una forma natural de comunicación. Incorporarla a aplicaciones de IA puede hacer que asistentes, funciones de accesibilidad y agentes conversacionales sean más intuitivos, inclusivos y atractivos.
Dos capacidades forman la base: el reconocimiento convierte palabras habladas en texto y la síntesis transforma texto en audio de sonido natural. Juntas crean interacciones de voz continuas.
El reconocimiento aporta la entrada textual y la síntesis produce la salida audible.
Beneficios generales
Accesibilidad para personas con discapacidad visual o dificultades de movilidad.
Productividad mediante trabajo manos libres y multitarea sin teclado ni pantalla.
Experiencias más naturales, humanas y atractivas.
Alcance global en varios idiomas, acentos y dialectos regionales.
El módulo original permite estudiar con vídeo o con texto e imágenes. La versión escrita suele incluir más detalles y puede complementar los vídeos.
2. Escenarios de reconocimiento de voz
Usos de speech-to-text y valor empresarial.
Escenario
Qué hace
Valor
Atención al cliente
Transcribe llamadas en directo, dirige según lo dicho, analiza sentimiento y problemas recurrentes y crea registros consultables para cumplimiento y formación.
Reduce notas manuales, mejora respuestas y descubre información para elevar la calidad.
Asistentes y agentes por voz
Acepta órdenes, responde preguntas, crea recordatorios, envía mensajes, busca y controla hogares, vehículos y dispositivos vestibles.
Aumenta la participación, simplifica flujos y funciona donde una pantalla no es práctica.
Reuniones y entrevistas
Crea notas y tareas consultables, subtítulos en tiempo real, resúmenes de entrevistas y grupos focales y puntos clave para seguimiento.
Ahorra transcripción, conserva registros precisos y hace accesible el contenido hablado.
Documentación sanitaria
Dicta al historial clínico electrónico, actualiza tratamientos durante la atención y captura detalles al momento.
Devuelve tiempo al paciente, reduce administración y agotamiento y mejora la integridad del registro.
3. Escenarios de síntesis de voz
Usos de text-to-speech y valor empresarial.
Escenario
Qué hace
Valor
IA conversacional y chatbots
Responde con voces naturales, adapta tono, ritmo y estilo, atiende por teléfono y mantiene la marca entre voz y texto.
Acerca los agentes, reduce esfuerzo y amplía el servicio a canales de solo voz.
Accesibilidad y consumo
Lee páginas y documentos, apoya discapacidades visuales o lectoras y ofrece audio al conducir, ejercitarse o trabajar.
Amplía el público, demuestra inclusión y mejora la satisfacción.
Notificaciones y alertas
Anuncia alertas, recordatorios, navegación y estado operativo sin exigir atención visual.
Mejora seguridad y capacidad de respuesta.
Aprendizaje y formación
Narra clases sin estudio, enseña pronunciación, crea alternativas de audio y escala a varios idiomas.
Reduce costos, atiende preferencias y acelera la producción.
Entretenimiento y medios
Crea personajes, prototipos de pódcast y audiolibro, locuciones y audio personalizado.
Abarata prototipos y personaliza a escala.
4. Conversaciones completas y decisiones de implementación
Las soluciones combinadas escuchan, procesan y contestan. La atención por voz reconoce una solicitud y sintetiza ayuda; un IVR guía mediante diálogo natural; una aplicación de idiomas evalúa una frase y pronuncia correcciones; un vehículo recibe órdenes sin manos y confirma acciones.
Conviene validar primero una sola capacidad en el escenario de mayor valor y después ampliar a flujos conversacionales más complejos.
Factores que deben evaluarse.
Factor
Impacto
Calidad del audio
Ruido, micrófono, distancia y ancho de banda afectan al reconocimiento.
Idioma y dialecto
Los idiomas y variantes regionales del público deben ser compatibles.
Privacidad y cumplimiento
Procesamiento, almacenamiento y protección del audio deben cumplir obligaciones.
Latencia
El diálogo en vivo necesita poca demora; la transcripción por lotes puede esperar.
Accesibilidad
La experiencia debe respetar WCAG y evitar nuevas barreras.
Siempre deben existir métodos alternativos de entrada y salida, porque algunas personas prefieren o necesitan una interfaz textual.
5. Reconocimiento: captura y visión del
-to-text coordina seis etapas: captura de audio, preparación de características, modelado acústico, modelado del lenguaje, decodificación y refinamiento.
Cada etapa transforma y enriquece la salida anterior.
El micrófono convierte ondas analógicas en muestras numéricas. Los sistemas de voz suelen usar 16.000 muestras por segundo, o 16 kHz. Tasas musicales como 44,1 kHz capturan más detalle con mayor costo; entre 8 y 16 kHz suele equilibrar claridad y eficiencia.
El ruido, la calidad del micrófono y la distancia afectan la precisión posterior. Los filtros iniciales pueden quitar zumbidos, chasquidos e interferencias.
6. Preprocesamiento y características MFCC
Las muestras sin procesar contienen demasiada información. El preprocesamiento conserva rasgos de la voz y descarta datos menos útiles, como el volumen absoluto.
Los coeficientes cepstrales en las frecuencias de Mel, o MFCC, aproximan la percepción humana y resaltan las bandas donde se concentra la energía del habla.
Dividir la señal en tramas superpuestas de 20 a 30 milisegundos.
Aplicar la transformada de Fourier para revelar tonos en el dominio de frecuencia.
Mapear las bandas a la escala Mel, acorde con la mayor sensibilidad humana a tonos bajos.
Calcular un resumen compacto, normalmente 13 coeficientes, del espectro de cada trama.
Cada columna de la representación final contiene 13 coeficientes de una trama temporal.
Trama 1: [-113,2; 45,3; 12,1; -3,4; 7,8; ...] // 13 coeficientes
Trama 2: [-112,8; 44,7; 11,8; -3,1; 7,5; ...]
Trama 3: [-110,5; 43,9; 11,5; -2,9; 7,3; ...]
7. Modelo acústico y fonemas
El modelo acústico aprende la relación entre características y fonemas, las unidades sonoras mínimas que distinguen palabras. El inglés tiene cerca de 44; “cat” contiene /k/, /æ/ y /t/.
Los transformers modernos procesan secuencias MFCC y estiman fonemas a lo largo del tiempo. La atención consulta tramas vecinas, el procesamiento paralelo analiza muchas a la vez y el contexto aprendido favorece secuencias habituales.
La salida es una distribución: una trama puede asignar 80% a /æ/, 15% a /ɛ/ y 5% a otros sonidos. Los fonemas dependen del idioma; un modelo inglés no reconoce tonos del mandarín sin volver a entrenarse.
El sistema combina evidencia acústica con contexto, vocabulario y gramática.
8. Modelo de lenguaje y decodificación
Los fonemas no resuelven homófonos como “their” y “there”. El modelo de lenguaje aporta vocabulario, gramática y patrones: prefiere “The weather is nice”, espera un verbo tras “I need to” y puede adaptarse a terminología médica o jurídica.
La decodificación busca entre millones de secuencias la hipótesis que mejor equilibra audio y texto legible. Beam search mantiene una lista corta de transcripciones parciales fuertes, amplía cada una, elimina caminos débiles y conserva las mejores.
Una frase de tres segundos puede generar miles de candidatas antes de elegir “Please send the report by Friday” frente a variantes fonéticamente cercanas. En tiempo real se limita el ancho del beam y la profundidad para equilibrar precisión y latencia.
9. Posprocesamiento y salida del reconocimiento
Operaciones de refinamiento.
Tarea
Ejemplo o finalidad
Mayúsculas
Convierte “hello my name is sam” en “Hello my name is Sam.”
Puntuación
Restaura puntos, comas e interrogaciones con prosodia y gramática.
Números
Convierte “one thousand twenty three” en “1,023”.
Filtro de contenido
Oculta o elimina palabras según la directiva.
Normalización inversa
Convierte “three p m” en “3 PM”.
Confianza
Marca palabras inciertas para revisión humana en contextos críticos.
La capacidad puede devolver transcripción, marcas de tiempo por palabra y puntuaciones de confianza. La aplicación puede destacar dudas o activar una alternativa. Separar las fases facilita localizar entrada deficiente, poco entrenamiento del dominio o reglas de formato demasiado agresivas.
10. Síntesis: normalización y análisis lingüístico
Text-to-speech construye audio natural mediante cuatro transformaciones.
El texto se normaliza, se convierte en fonemas, recibe prosodia y se representa como audio.
La normalización expande abreviaturas, números, fechas, horas y símbolos y resuelve homógrafos por contexto. “Dr. Smith ordered 3 items for $25.50 on 12/15/2023” pasa a una forma pronunciable equivalente a “Doctor Smith ordered three items for twenty-five dollars and fifty cents on December fifteenth, two thousand twenty-three”. Las dosis médicas requieren reglas distintas de monedas y porcentajes.
El análisis lingüístico segmenta palabras y sílabas, consulta léxicos, aplica reglas o modelos G2P a términos desconocidos, marca límites y acentos y considera sonidos vecinos. La conversión grafema-fonema es necesaria porque “though”, “through” y “cough” comparten “ough”, pero producen /ðoʊ/, /θruː/ y /kɔːf/.
Los modelos neuronales G2P entrenados con diccionarios gestionan nombres propios, términos raros y variantes regionales. Los transformers usan contexto para distinguir presente /riːd/ y pasado /rɛd/ en “read”.
11. Generación de prosodia
La prosodia reúne ritmo, acento y entonación. Incluye contorno tonal, duración, intensidad, pausas y sílabas tónicas. Cambiar la palabra enfatizada en “I never said he ate the cake” cambia el significado implícito.
Codificar fonemas con puntuación, categoría gramatical y estructura.
Usar autoatención para relacionar palabras, referencias y límites.
Predecir tono, duración y energía de cada fonema.
Aplicar estilo neutro, expresivo o conversacional y rasgos del hablante.
Miles de horas alineadas con transcripciones enseñan que las preguntas suelen subir, las comas pausan, el énfasis alarga y los finales bajan. Sintaxis, semántica, contraste discursivo, identidad y emoción influyen en el resultado.
Un objetivo puede pedir /æ/ a 180 Hz durante 80 ms con intensidad moderada y luego 200 ms de pausa. La prosodia plana, y no una pronunciación fonética incorrecta, suele producir la sensación robótica.
12. Vocoders y generación del audio
Un modelo acústico, a menudo transformer, convierte fonemas y prosodia en un espectrograma Mel. Un vocoder neuronal lo transforma en una onda de 16.000 a 48.000 muestras de amplitud por segundo; después se aplican filtros, normalización o efectos.
WaveNet, WaveGlow y HiFi-GAN son arquitecturas conocidas. Los vocoders neuronales ofrecen fidelidad cercana al estudio, detalles vocales sutiles, generación en tiempo real y adaptación a hablantes, idiomas y estilos. Ejecutan el sentido inverso del reconocimiento: una representación lingüística se convierte en audio.
Tono, duración, intensidad y pausas guían la forma de onda final.
Para “Dr. Chen’s appointment is at 3:00 PM”, la normalización expande título y hora, el análisis crea fonemas, la prosodia eleva “appointment”, pausa tras “is” y enfatiza “three”, y la síntesis produce la onda. En hardware moderno suele completarse en menos de un segundo.
13. Ejercicio, evaluación y resumen
El ejercicio usa el modo de voz de Chat Playground para hablar con un modelo, preguntar y escuchar respuestas, mostrando reconocimiento y síntesis en una experiencia.
Se conserva la captura real; los diagramas conceptuales se recrearon en SVG.
¿En el preprocesamiento se convierte a WMV, se añade ruido o se extraen vectores de la onda?
¿Los fonemas son artefactos eliminados, unidades mínimas de sonido o modelos generadores?
¿La prosodia maximiza volumen, traduce idiomas o crea pronunciación y cadencia naturales?
Respuestas
El preprocesamiento extrae vectores de características para el modelado.
Los fonemas son las unidades mínimas de sonido que distinguen el habla.
La prosodia aporta ritmo, tono, acento y cadencia naturales.
En resumen, el reconocimiento convierte sonido en texto mediante captura, MFCC, modelos acústico y de lenguaje, decodificación y refinamiento. La síntesis usa normalización, fonemas, prosodia y vocoder. Juntas sostienen conversaciones bidireccionales en servicio, accesibilidad, salud, educación y agentes.