Preparación para la Certificación Microsoft AI-901
Voz de Azure: Speech to Text, Text to Speech y Voice Live
Reconocimiento, síntesis, SDK de voz, transcripción por lotes, voces neuronales y agentes de conversación en tiempo real
Tiempo de estudio sugerido: 50 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. Interfaces de voz para aplicaciones y agentes
Las funciones de voz permiten controlar sistemas, obtener respuestas a preguntas habladas, generar subtítulos y conversar con agentes sin teclado ni lectura de pantalla. Esta interacción natural también mejora accesibilidad e inclusión. Una experiencia completa debe reconocer lo que dice la persona y sintetizar una respuesta audible.
Ejemplos de cargas de trabajo de voz con IA.
Área
Aplicación
Salud
El dictado clínico convierte notas habladas en texto y reduce la escritura manual.
Atención
La transcripción de llamadas permite revisar, detectar problemas y analizar sentimiento.
Medios
Los subtítulos en directo o grabados mejoran accesibilidad y apoyan audiencias multilingües.
Educación
Las aplicaciones escuchan al alumno y ofrecen comentarios sobre pronunciación.
Comercio
Los asistentes entienden solicitudes habladas y responden sobre productos o pedidos.
El reconocimiento convierte voz en datos; la síntesis transforma la respuesta en audio.
2. de en Foundry Tools
de en Foundry Tools proporciona conversión de voz en texto, texto a voz y traducción de voz. Los modelos precompilados y personalizados admiten transcripción, identificación de hablantes, voces personalizadas y otros escenarios. Un recurso de aporta y credenciales; el proyecto organiza experiencias, agentes e integraciones.
En el nuevo portal de , abre Build, Models y AI services. El área de juegos permite grabar o cargar audio, probar voces, ajustar parámetros y revisar resultados antes de programar. El vídeo puede servir de introducción, mientras el texto aporta más detalle.
to Text convierte audio de micrófono, archivo o flujo en texto.
Text to genera audio natural a partir de texto y una voz.
translation reconoce una intervención y entrega contenido en otro idioma.
Voice Live combina audio, razonamiento y respuesta hablada en tiempo real.
3. Cómo funciona el reconocimiento de voz
El reconocimiento de voz, o speech to text (STT), convierte palabras habladas en datos, normalmente texto. Un modelo acústico examina la señal y la representa como fonemas; un modelo de lenguaje relaciona esos fonemas con palabras y secuencias plausibles.
El texto reconocido alimenta subtítulos, transcripciones, dictado, correo de voz y agentes. La to Text de de acepta audio del micrófono o de un archivo. Una define reglas y para que un programa use funciones o datos de otro.
El modelo acústico interpreta sonidos; el modelo de lenguaje los convierte en palabras contextualizadas.
4. Área de juegos y de voz a texto
En el área de juegos to Text, carga un archivo o graba tu voz. La transcripción demuestra cómo respondería una aplicación. Para integrar la función usa el de voz, una biblioteca cliente que abstrae red, autenticación, y análisis de la respuesta.
La interfaz preservada permite grabar, cargar audio y revisar la transcripción.
Capturar o enviar audio de micrófono, archivo o flujo.
Enviar el audio de forma segura a de .
Recibir texto casi en tiempo real o al terminar el procesamiento.
Usar el en cliente o servicio como puente al .
Para Python instala -cognitiveservices-speech desde el terminal de . El recurso de Foundry proporciona y clave; también puede autenticar. No guardes secretos en el código de producción.
La aplicación inicializa y autentica el , captura o carga audio, lo transmite, ejecuta reconocimiento en la nube y recibe texto y opcionales. SpeechConfig contiene la conexión, AudioConfig selecciona la fuente y SpeechRecognizer reconoce.
import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv
load_dotenv()
speech_config = speechsdk.SpeechConfig(
subscription=os.environ['FOUNDRY_KEY'],
endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
microphone = speechsdk.audio.AudioConfig(use_default_microphone=True)
recognizer = speechsdk.SpeechRecognizer(
speech_config=speech_config,
audio_config=microphone
)
recognizer.recognizing.connect(
lambda event: print('Parcial:', event.result.text)
)
recognizer.recognized.connect(
lambda event: print('Reconocido:', event.result.text)
)
recognizer.start_continuous_recognition()
input('Habla; pulsa Enter para terminar...')
recognizer.stop_continuous_recognition()
recognizing informa hipótesis parciales; recognized entrega el resultado confirmado. Para un buzón de voz, AudioConfig puede seleccionar un archivo. SpeechRecognizer transcribe y la aplicación muestra o guarda el texto.
El ejemplo usa una grabación como fuente.El código conecta el , selecciona el archivo y crea SpeechRecognizer.El resultado reconocido vuelve al cliente como texto.
6. Transcripción en tiempo real y por lotes
to Text admite procesamiento en tiempo real y por lotes. En tiempo real, una aplicación escucha micrófono u otra fuente, transmite el audio y recibe texto mientras se habla. Sirve para presentaciones, demostraciones, subtítulos y conversaciones.
La transcripción por lotes procesa grabaciones de un recurso compartido, servidor remoto o de forma asíncrona. Puede usarse una con firma de acceso compartido (SAS). Los trabajos se programan según el mejor esfuerzo: suelen empezar en minutos, pero no hay garantía exacta para el cambio al estado de ejecución.
Elección del modo de transcripción.
Modo
Entrada
Comportamiento
Escenario
Tiempo real
Micrófono, archivo o flujo activo
Texto a medida que llega el audio
Subtítulos, reuniones, comandos.
Lotes
Archivos accesibles por
Trabajo asíncrono programado
Llamadas archivadas, entrevistas y colecciones.
La fuente y la urgencia determinan inmediato o trabajo asíncrono.
7. Cómo funciona la síntesis de voz
La síntesis, o text to speech (TTS), vocaliza datos convirtiendo texto en audio. Necesita el texto y una voz. El sistema tokeniza, asigna sonidos fonéticos, organiza unidades prosódicas como frases y oraciones, produce fonemas y sintetiza la señal.
La salida responde, lee mensajes o emite anuncios. , idioma y pronunciación regional definen la experiencia; velocidad, tono y volumen controlan la entrega. Las voces neuronales usan redes para mejorar entonación y naturalidad. La plataforma ofrece voces predefinidas y personalizadas.
Tokenización, fonética, prosodia y fonemas preparan el texto antes de generar audio.
8. Área de juegos y de texto a voz
En Text to escribe texto, selecciona una voz sintética y ajusta velocidad y tono. El audio se reproduce o guarda en archivo. El envía el texto a de , usa voces neuronales y devuelve audio mientras gestiona autenticación, red, formato y reproducción.
La interfaz elige voz, idioma, velocidad, tono y volumen antes de generar audio.
Las aplicaciones cliente vocalizan inmediatamente en escritorio o móvil; los generan archivos para uso posterior. Python utiliza el mismo paquete -cognitiveservices-speech.
9. Cliente Python para síntesis
SpeechSynthesizer recibe SpeechConfig y AudioOutputConfig. El ejemplo usa el altavoz, lee texto y espera el resultado asíncrono. La aplicación comprueba éxito o cancelación y muestra detalles de error.
import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv
load_dotenv()
config = speechsdk.SpeechConfig(
subscription=os.environ['FOUNDRY_KEY'],
endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
config.speech_synthesis_voice_name = 'en-US-Ava:DragonHDLatestNeural'
speaker = speechsdk.audio.AudioOutputConfig(use_default_speaker=True)
synthesizer = speechsdk.SpeechSynthesizer(
speech_config=config,
audio_config=speaker
)
message = input('Texto que se vocalizará: ')
result = synthesizer.speak_text_async(message).get()
if result.reason == speechsdk.ResultReason.SynthesizingAudioCompleted:
print('Voz sintetizada.')
elif result.reason == speechsdk.ResultReason.Canceled:
details = result.cancellation_details
print('Síntesis cancelada:', details.reason)
if details.error_details:
print(details.error_details)
Una aplicación puede leer un archivo, crear SpeechSynthesizer y generar voz. Una voz neural multilingüe puede adaptarse al idioma de entrada. Configura salida a archivo cuando no quieras reproducir inmediatamente.
El texto almacenado es la entrada de la vocalización.El código crea SpeechSynthesizer y trata finalización o cancelación.La ejecución convierte el texto en audio.
10. Conversaciones de voz con Voice Live
to speech recibe audio hablado y produce audio hablado, sin lectura ni escritura. La canalización reconoce la voz, pasa el texto por traducción, resumen, lógica o razonamiento de agente y sintetiza la respuesta. Asistentes, traducción oral, quioscos, navegación, herramientas industriales, accesibilidad y bots son ejemplos.
Voice Live combina reconocimiento, y texto a voz en un servicio administrado de baja latencia. La aplicación envía audio y recibe voz sin unir manualmente componentes. El servicio también puede devolver avatares y activar acciones.
de proporciona reconocimiento y síntesis.
El agente o la lógica decide el contenido de la respuesta.
Foundry Tools o servidores MCP exponen voz como herramientas invocables.
Un modelo generativo trabaja con modelos acústicos durante la conversación.
Voice Live coordina audio, reconocimiento, razonamiento, herramientas y respuesta hablada.
11. Crear e integrar un agente con voz
El área de juegos Voice Live incluye voces de muestra y permite crear una solución. Selecciona el modelo generativo y configura voz, instrucciones y comportamiento. La interacción proactiva permite que el agente inicie la conversación. El modo Voice de un agente de encapsula la configuración y reduce código cliente.
La experiencia permite hablar y escuchar respuestas en tiempo real.
Para Python instala -ai-voicelive, pyaudio, python-dotenv y -identity. El código del portal inicia sesión, conecta micrófono y altavoces, procesa flujos y maneja interrupciones. Al ejecutarlo, el asistente transmite el micrófono a Voice Live y reproduce la respuesta.
El cliente inicia la captura y procesa la conversación.El portal ofrece una base para sesión, audio, instrucciones y eventos.
12. Ejercicio y comprobación de conocimientos
El ejercicio de unos 25 minutos usa de en Foundry Tools y Voice Live para crear un agente que conversa en tiempo real. Requiere suscripción ; una cuenta nueva puede incluir créditos durante 30 días.
¿Por qué integrar to Text en vez de depender solo del área de juegos?
¿Qué responsabilidades asume Text to ?
¿Qué papel cumple -ai-voicelive en un agente con voz?
Respuestas explicadas
El inserta reconocimiento en el código y el flujo; el área de juegos sirve para experimentar.
Gestiona autenticación, red, formato y generación de audio, además de reproducción o archivo configurado.
Voice Live abre la conexión, transmite audio y procesa respuestas e interrupciones; no sustituye dispositivos ni almacena grabaciones permanentemente por defecto.
13. Resumen y referencias oficiales
to Text convierte micrófono, archivo o flujo en texto para subtítulos, transcripción, dictado y agentes.
El reconocimiento puede ser en tiempo real o mediante trabajos por lotes.
Text to usa texto, voz, fonética, prosodia y modelos neuronales para producir audio natural.
El de voz conecta aplicaciones con de y abstrae autenticación, red, audio y respuestas.
Voice Live une reconocimiento, razonamiento y síntesis para agentes de voz responsivos.