Voz de Azure: Speech to Text, Text to Speech y Voice Live
Volver a la ruta AI-901
AI-901Capítulo 10

Preparación para la Certificación Microsoft AI-901

Voz de Azure: Speech to Text, Text to Speech y Voice Live

Reconocimiento, síntesis, SDK de voz, transcripción por lotes, voces neuronales y agentes de conversación en tiempo real

Tiempo de estudio sugerido: 50 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA, lenguaje, visión, voz y agentes

1. Interfaces de voz para aplicaciones y agentes

Las funciones de voz permiten controlar sistemas, obtener respuestas a preguntas habladas, generar subtítulos y conversar con agentes sin teclado ni lectura de pantalla. Esta interacción natural también mejora accesibilidad e inclusión. Una experiencia completa debe reconocer lo que dice la persona y sintetizar una respuesta audible.

Ejemplos de cargas de trabajo de voz con IA.
ÁreaAplicación
SaludEl dictado clínico convierte notas habladas en texto y reduce la escritura manual.
AtenciónLa transcripción de llamadas permite revisar, detectar problemas y analizar sentimiento.
MediosLos subtítulos en directo o grabados mejoran accesibilidad y apoyan audiencias multilingües.
EducaciónLas aplicaciones escuchan al alumno y ofrecen comentarios sobre pronunciación.
ComercioLos asistentes entienden solicitudes habladas y responden sobre productos o pedidos.
Ciclo de interacción por voz entre persona, aplicación y agente.
El reconocimiento convierte voz en datos; la síntesis transforma la respuesta en audio.

2. de en Foundry Tools

de en Foundry Tools proporciona conversión de voz en texto, texto a voz y traducción de voz. Los modelos precompilados y personalizados admiten transcripción, identificación de hablantes, voces personalizadas y otros escenarios. Un recurso de aporta y credenciales; el proyecto organiza experiencias, agentes e integraciones.

En el nuevo portal de , abre Build, Models y AI services. El área de juegos permite grabar o cargar audio, probar voces, ajustar parámetros y revisar resultados antes de programar. El vídeo puede servir de introducción, mientras el texto aporta más detalle.

  • to Text convierte audio de micrófono, archivo o flujo en texto.
  • Text to genera audio natural a partir de texto y una voz.
  • translation reconoce una intervención y entrega contenido en otro idioma.
  • Voice Live combina audio, razonamiento y respuesta hablada en tiempo real.

3. Cómo funciona el reconocimiento de voz

El reconocimiento de voz, o speech to text (STT), convierte palabras habladas en datos, normalmente texto. Un modelo acústico examina la señal y la representa como fonemas; un modelo de lenguaje relaciona esos fonemas con palabras y secuencias plausibles.

El texto reconocido alimenta subtítulos, transcripciones, dictado, correo de voz y agentes. La to Text de de acepta audio del micrófono o de un archivo. Una define reglas y para que un programa use funciones o datos de otro.

Canalización de reconocimiento con audio, modelos acústico y de lenguaje y texto.
El modelo acústico interpreta sonidos; el modelo de lenguaje los convierte en palabras contextualizadas.

4. Área de juegos y de voz a texto

En el área de juegos to Text, carga un archivo o graba tu voz. La transcripción demuestra cómo respondería una aplicación. Para integrar la función usa el de voz, una biblioteca cliente que abstrae red, autenticación, y análisis de la respuesta.

Captura original del área de juegos Speech to Text de Microsoft Foundry.
La interfaz preservada permite grabar, cargar audio y revisar la transcripción.
  • Capturar o enviar audio de micrófono, archivo o flujo.
  • Enviar el audio de forma segura a de .
  • Recibir texto casi en tiempo real o al terminar el procesamiento.
  • Usar el en cliente o servicio como puente al .

Para Python instala -cognitiveservices-speech desde el terminal de . El recurso de Foundry proporciona y clave; también puede autenticar. No guardes secretos en el código de producción.

pip install azure-cognitiveservices-speech python-dotenv

5. Cliente Python para reconocimiento continuo

La aplicación inicializa y autentica el , captura o carga audio, lo transmite, ejecuta reconocimiento en la nube y recibe texto y opcionales. SpeechConfig contiene la conexión, AudioConfig selecciona la fuente y SpeechRecognizer reconoce.

import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv

load_dotenv()
speech_config = speechsdk.SpeechConfig(
    subscription=os.environ['FOUNDRY_KEY'],
    endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
microphone = speechsdk.audio.AudioConfig(use_default_microphone=True)
recognizer = speechsdk.SpeechRecognizer(
    speech_config=speech_config,
    audio_config=microphone
)

recognizer.recognizing.connect(
    lambda event: print('Parcial:', event.result.text)
)
recognizer.recognized.connect(
    lambda event: print('Reconocido:', event.result.text)
)

recognizer.start_continuous_recognition()
input('Habla; pulsa Enter para terminar...')
recognizer.stop_continuous_recognition()

recognizing informa hipótesis parciales; recognized entrega el resultado confirmado. Para un buzón de voz, AudioConfig puede seleccionar un archivo. SpeechRecognizer transcribe y la aplicación muestra o guarda el texto.

Captura original de un archivo de voz en Visual Studio Code.
El ejemplo usa una grabación como fuente.
Captura original del código Python de reconocimiento.
El código conecta el , selecciona el archivo y crea SpeechRecognizer.
Captura original del terminal con la transcripción.
El resultado reconocido vuelve al cliente como texto.

6. Transcripción en tiempo real y por lotes

to Text admite procesamiento en tiempo real y por lotes. En tiempo real, una aplicación escucha micrófono u otra fuente, transmite el audio y recibe texto mientras se habla. Sirve para presentaciones, demostraciones, subtítulos y conversaciones.

La transcripción por lotes procesa grabaciones de un recurso compartido, servidor remoto o de forma asíncrona. Puede usarse una con firma de acceso compartido (SAS). Los trabajos se programan según el mejor esfuerzo: suelen empezar en minutos, pero no hay garantía exacta para el cambio al estado de ejecución.

Elección del modo de transcripción.
ModoEntradaComportamientoEscenario
Tiempo realMicrófono, archivo o flujo activoTexto a medida que llega el audioSubtítulos, reuniones, comandos.
LotesArchivos accesibles por Trabajo asíncrono programadoLlamadas archivadas, entrevistas y colecciones.
Comparación de transcripción en tiempo real y por lotes.
La fuente y la urgencia determinan inmediato o trabajo asíncrono.

7. Cómo funciona la síntesis de voz

La síntesis, o text to speech (TTS), vocaliza datos convirtiendo texto en audio. Necesita el texto y una voz. El sistema tokeniza, asigna sonidos fonéticos, organiza unidades prosódicas como frases y oraciones, produce fonemas y sintetiza la señal.

La salida responde, lee mensajes o emite anuncios. , idioma y pronunciación regional definen la experiencia; velocidad, tono y volumen controlan la entrega. Las voces neuronales usan redes para mejorar entonación y naturalidad. La plataforma ofrece voces predefinidas y personalizadas.

Canalización de síntesis del texto al audio con voz, velocidad, tono y volumen.
Tokenización, fonética, prosodia y fonemas preparan el texto antes de generar audio.

8. Área de juegos y de texto a voz

En Text to escribe texto, selecciona una voz sintética y ajusta velocidad y tono. El audio se reproduce o guarda en archivo. El envía el texto a de , usa voces neuronales y devuelve audio mientras gestiona autenticación, red, formato y reproducción.

Captura original del área de juegos Text to Speech.
La interfaz elige voz, idioma, velocidad, tono y volumen antes de generar audio.

Las aplicaciones cliente vocalizan inmediatamente en escritorio o móvil; los generan archivos para uso posterior. Python utiliza el mismo paquete -cognitiveservices-speech.

9. Cliente Python para síntesis

SpeechSynthesizer recibe SpeechConfig y AudioOutputConfig. El ejemplo usa el altavoz, lee texto y espera el resultado asíncrono. La aplicación comprueba éxito o cancelación y muestra detalles de error.

import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv

load_dotenv()
config = speechsdk.SpeechConfig(
    subscription=os.environ['FOUNDRY_KEY'],
    endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
config.speech_synthesis_voice_name = 'en-US-Ava:DragonHDLatestNeural'
speaker = speechsdk.audio.AudioOutputConfig(use_default_speaker=True)
synthesizer = speechsdk.SpeechSynthesizer(
    speech_config=config,
    audio_config=speaker
)

message = input('Texto que se vocalizará: ')
result = synthesizer.speak_text_async(message).get()
if result.reason == speechsdk.ResultReason.SynthesizingAudioCompleted:
    print('Voz sintetizada.')
elif result.reason == speechsdk.ResultReason.Canceled:
    details = result.cancellation_details
    print('Síntesis cancelada:', details.reason)
    if details.error_details:
        print(details.error_details)

Una aplicación puede leer un archivo, crear SpeechSynthesizer y generar voz. Una voz neural multilingüe puede adaptarse al idioma de entrada. Configura salida a archivo cuando no quieras reproducir inmediatamente.

Captura original de un archivo de mensaje para síntesis.
El texto almacenado es la entrada de la vocalización.
Captura original del cliente Python de síntesis.
El código crea SpeechSynthesizer y trata finalización o cancelación.
Captura original del terminal tras sintetizar el mensaje.
La ejecución convierte el texto en audio.

10. Conversaciones de voz con Voice Live

to speech recibe audio hablado y produce audio hablado, sin lectura ni escritura. La canalización reconoce la voz, pasa el texto por traducción, resumen, lógica o razonamiento de agente y sintetiza la respuesta. Asistentes, traducción oral, quioscos, navegación, herramientas industriales, accesibilidad y bots son ejemplos.

Voice Live combina reconocimiento, y texto a voz en un servicio administrado de baja latencia. La aplicación envía audio y recibe voz sin unir manualmente componentes. El servicio también puede devolver avatares y activar acciones.

  • de proporciona reconocimiento y síntesis.
  • El agente o la lógica decide el contenido de la respuesta.
  • Foundry Tools o servidores MCP exponen voz como herramientas invocables.
  • Un modelo generativo trabaja con modelos acústicos durante la conversación.
Arquitectura de conversación en tiempo real con Voice Live.
Voice Live coordina audio, reconocimiento, razonamiento, herramientas y respuesta hablada.

11. Crear e integrar un agente con voz

El área de juegos Voice Live incluye voces de muestra y permite crear una solución. Selecciona el modelo generativo y configura voz, instrucciones y comportamiento. La interacción proactiva permite que el agente inicie la conversación. El modo Voice de un agente de encapsula la configuración y reduce código cliente.

Captura original de un agente en Voice Live.
La experiencia permite hablar y escuchar respuestas en tiempo real.

Para Python instala -ai-voicelive, pyaudio, python-dotenv y -identity. El código del portal inicia sesión, conecta micrófono y altavoces, procesa flujos y maneja interrupciones. Al ejecutarlo, el asistente transmite el micrófono a Voice Live y reproduce la respuesta.

pip install azure-ai-voicelive pyaudio python-dotenv azure-identity
Captura original de un cliente Voice Live en el terminal.
El cliente inicia la captura y procesa la conversación.
Captura original del código mostrado por Voice Live.
El portal ofrece una base para sesión, audio, instrucciones y eventos.

12. Ejercicio y comprobación de conocimientos

El ejercicio de unos 25 minutos usa de en Foundry Tools y Voice Live para crear un agente que conversa en tiempo real. Requiere suscripción ; una cuenta nueva puede incluir créditos durante 30 días.

Preguntas reformuladas

  1. ¿Por qué integrar to Text en vez de depender solo del área de juegos?
  2. ¿Qué responsabilidades asume Text to ?
  3. ¿Qué papel cumple -ai-voicelive en un agente con voz?

Respuestas explicadas

  • El inserta reconocimiento en el código y el flujo; el área de juegos sirve para experimentar.
  • Gestiona autenticación, red, formato y generación de audio, además de reproducción o archivo configurado.
  • Voice Live abre la conexión, transmite audio y procesa respuestas e interrupciones; no sustituye dispositivos ni almacena grabaciones permanentemente por defecto.

13. Resumen y referencias oficiales

  • to Text convierte micrófono, archivo o flujo en texto para subtítulos, transcripción, dictado y agentes.
  • El reconocimiento puede ser en tiempo real o mediante trabajos por lotes.
  • Text to usa texto, voz, fonética, prosodia y modelos neuronales para producir audio natural.
  • El de voz conecta aplicaciones con de y abstrae autenticación, red, audio y respuestas.
  • Voice Live une reconocimiento, razonamiento y síntesis para agentes de voz responsivos.