Fala no Azure: Speech to Text, Text to Speech e Voice Live
Reconhecimento, síntese, SDK de Fala, transcrição em lote, vozes neurais e agentes de conversação em tempo real
Tempo de estudo sugerido: 50 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn
Por João Ricardo Dutra••Conteúdo autoral completo
1. Interfaces de fala para aplicações e agentes
Recursos de fala permitem controlar sistemas por voz, obter respostas para perguntas faladas, gerar legendas de áudio e conversar com agentes sem depender de teclado ou leitura de tela. Essa interação mais natural também amplia acessibilidade e inclusão. Para completar o ciclo, a solução precisa reconhecer o que a pessoa disse e sintetizar uma resposta audível.
Exemplos de uso de fala com IA.
Área
Aplicação
Saúde
Ditado clínico converte observações do médico em texto e reduz digitação manual.
Atendimento
Transcrição de chamadas em tempo real facilita revisão, identificação de problemas e análise de sentimento.
Mídia
Legendas ao vivo ou gravadas aumentam acessibilidade e apoiam públicos multilíngues.
Educação
Aplicativos escutam o aluno e oferecem retorno sobre pronúncia.
Varejo
Assistentes entendem pedidos falados e respondem com informações de produto ou situação do pedido.
Reconhecimento converte voz em dados; síntese transforma a resposta em áudio.
2. do nas Ferramentas Foundry
A do nas Ferramentas Foundry fornece conversão de fala em texto, texto em fala e tradução de fala. Modelos predefinidos e personalizados atendem transcrição, identificação de locutores, vozes personalizadas e outros cenários. Um recurso do fornece e credenciais, enquanto o projeto organiza experiências, agentes e integrações.
No novo portal do , as experiências ficam em Build, Models e AI services. O Playground permite gravar ou enviar áudio, testar vozes, alterar parâmetros e observar resultados antes de escrever código. Quem prefere vídeo pode usá-lo como introdução, mas o texto detalha mais configurações e decisões de implementação.
to Text: transforma áudio de microfone, arquivo ou fluxo em texto.
Text to : produz áudio natural a partir de texto e de uma voz escolhida.
translation: reconhece uma fala e entrega conteúdo em outro idioma.
Voice Live: reúne entrada de áudio, raciocínio e resposta falada em tempo real.
3. Como funciona o reconhecimento de fala
Reconhecimento de fala, ou speech-to-text (STT), converte palavras faladas em dados, normalmente texto. Um modelo acústico examina o sinal e o representa como fonemas, que correspondem a unidades sonoras. Em seguida, um modelo de linguagem relaciona esses fonemas a palavras e sequências plausíveis.
O texto reconhecido pode alimentar legendas, transcrições de chamadas, ditado de notas, mensagens de voz e agentes. A to Text da do aceita áudio capturado pelo microfone ou fornecido como arquivo. Uma define regras e que permitem a um software usar funções ou dados de outro.
O modelo acústico interpreta sons; o modelo de linguagem transforma a sequência em palavras contextualizadas.
4. Playground e de conversão de fala em texto
No Playground to Text, você pode enviar um arquivo ou gravar a própria voz. A transcrição mostra rapidamente como uma futura aplicação responderia à entrada. Para integrar a capacidade ao produto, use o de , uma biblioteca cliente que abstrai rede, autenticação, de áudio e interpretação da resposta.
A interface real foi preservada em PNG e permite gravar, enviar áudio e conferir a transcrição.
Capturar ou encaminhar áudio de microfone, arquivo ou fluxo.
Enviar o conteúdo com segurança à do .
Receber texto quase em tempo real ou depois do processamento.
Usar o na camada cliente ou de serviço como ponte entre aplicação e .
Para Python, instale o pacote -cognitiveservices-speech pelo terminal do . O recurso do Foundry fornece e chave; também pode autenticar. Em produção, mantenha segredos fora do código.
O fluxo de uma aplicação é: inicializar o e autenticar, capturar ou carregar áudio, transmitir o conteúdo, executar o reconhecimento na nuvem e receber texto com opcionais. SpeechConfig concentra a conexão, AudioConfig indica a origem e SpeechRecognizer executa o reconhecimento.
import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv
load_dotenv()
speech_config = speechsdk.SpeechConfig(
subscription=os.environ['FOUNDRY_KEY'],
endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
microphone = speechsdk.audio.AudioConfig(use_default_microphone=True)
recognizer = speechsdk.SpeechRecognizer(
speech_config=speech_config,
audio_config=microphone
)
recognizer.recognizing.connect(
lambda event: print('Parcial:', event.result.text)
)
recognizer.recognized.connect(
lambda event: print('Reconhecido:', event.result.text)
)
recognizer.start_continuous_recognition()
input('Fale; pressione Enter para encerrar...')
recognizer.stop_continuous_recognition()
O evento recognizing apresenta hipóteses parciais enquanto a pessoa fala; recognized entrega o resultado confirmado. Para uma caixa postal, AudioConfig pode apontar para um arquivo em vez do microfone. O objeto SpeechRecognizer transcreve e a aplicação exibe ou armazena o texto.
O exemplo usa um áudio gravado como fonte da transcrição.O código conecta o , seleciona o arquivo e cria SpeechRecognizer.O resultado reconhecido é devolvido ao cliente como texto.
6. Transcrição em tempo real e em lote
A to Text oferece processamento em tempo real e em lote. Em tempo real, a aplicação escuta um microfone ou outra fonte, transmite o fluxo e recebe texto durante a fala. É indicada para apresentações, demonstrações, legendas e conversas.
Em lote, gravações já armazenadas em compartilhamento, servidor remoto ou do são processadas de forma assíncrona. O aplicativo pode fornecer uma com assinatura de acesso compartilhado (SAS). Os trabalhos são agendados em melhor esforço: normalmente começam em minutos, mas não há garantia exata para a mudança ao estado de execução.
Escolha da modalidade de transcrição.
Modalidade
Entrada
Comportamento
Cenário
Tempo real
Microfone, arquivo ou fluxo ativo
Texto retorna enquanto o áudio chega
Legenda, reunião, comando de voz.
Arquivos armazenados e acessíveis por
Trabalho assíncrono agendado
Arquivo de chamadas, entrevistas e grandes acervos.
A origem e a urgência do resultado determinam imediato ou trabalho assíncrono.
7. Como funciona a síntese de fala
Síntese de fala, ou text-to-speech (TTS), vocaliza dados e geralmente transforma texto em áudio. A solução precisa receber o texto e selecionar uma voz. O processamento tokeniza o conteúdo em palavras, associa sons fonéticos, organiza a transcrição em unidades prosódicas como frases e sentenças, produz fonemas e finalmente sintetiza o sinal.
A saída pode responder ao usuário, ler mensagens ou transmitir anúncios. , idioma e pronúncia regional moldam a identidade da experiência; velocidade, tom e volume controlam a entrega. Vozes neurais usam redes neurais para reduzir limitações de entonação e soar mais naturais. A plataforma oferece várias vozes predefinidas e também permite criar vozes personalizadas.
Tokenização, fonética, prosódia e fonemas preparam o texto antes da geração do áudio.
8. Playground e de conversão de texto em fala
No Playground Text to , escreva o texto, escolha uma voz sintética e ajuste parâmetros como velocidade e tom. O áudio pode ser reproduzido pelo alto-falante ou salvo em arquivo. O envia texto à do , usa vozes neurais e devolve o áudio, cuidando de autenticação, rede, formatação e reprodução.
A interface permite escolher voz, idioma, velocidade, tom e volume antes de gerar o áudio.
Aplicações cliente podem vocalizar imediatamente em computadores e celulares; serviços podem gerar arquivos para reprodução posterior. O pacote Python é o mesmo usado pelo reconhecimento, -cognitiveservices-speech.
9. Cliente Python para síntese
SpeechSynthesizer recebe SpeechConfig e AudioOutputConfig. O exemplo abaixo usa o alto-falante padrão, lê o texto no console e aguarda a conclusão assíncrona. A aplicação verifica sucesso ou cancelamento para expor detalhes de erro quando necessário.
import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv
load_dotenv()
config = speechsdk.SpeechConfig(
subscription=os.environ['FOUNDRY_KEY'],
endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
config.speech_synthesis_voice_name = 'en-US-Ava:DragonHDLatestNeural'
speaker = speechsdk.audio.AudioOutputConfig(use_default_speaker=True)
synthesizer = speechsdk.SpeechSynthesizer(
speech_config=config,
audio_config=speaker
)
message = input('Texto a vocalizar: ')
result = synthesizer.speak_text_async(message).get()
if result.reason == speechsdk.ResultReason.SynthesizingAudioCompleted:
print('Áudio sintetizado.')
elif result.reason == speechsdk.ResultReason.Canceled:
details = result.cancellation_details
print('Síntese cancelada:', details.reason)
if details.error_details:
print(details.error_details)
Uma aplicação que vocaliza mensagens pode ler um arquivo de texto, criar SpeechSynthesizer e gerar o áudio. Uma voz neural multilíngue pode adaptar o idioma ao conteúdo de entrada. Para salvar em vez de reproduzir, configure a saída para arquivo.
O texto armazenado é a entrada do processo de vocalização.O código cria SpeechSynthesizer, lê o texto e trata conclusão ou cancelamento.A execução converte o texto em saída de áudio.
10. Conversas de voz com to e Voice Live
to speech recebe áudio falado e entrega áudio falado, criando uma conversa sem leitura ou digitação. A tradicional reconhece a fala, passa o texto por tradução, resumo, lógica da aplicação ou raciocínio de um agente e sintetiza a resposta. Assistentes, tradução oral, quiosques, navegação, ferramentas industriais, acessibilidade e bots de atendimento são exemplos.
Voice Live reúne reconhecimento, e texto em fala em um serviço gerenciado de baixa latência. Em vez de conectar manualmente vários componentes, a aplicação envia áudio e recebe resposta falada. O serviço também pode retornar elementos visuais, como avatares, e acionar ações.
A do executa reconhecimento e síntese.
Um agente ou a lógica da aplicação decide o conteúdo da resposta.
Ferramentas do Foundry ou servidores MCP podem expor fala como capacidades invocáveis.
Um modelo generativo selecionado trabalha com modelos acústicos para sustentar a conversa.
Voice Live coordena entrada de áudio, reconhecimento, raciocínio, ferramentas e resposta falada.
11. Criar e integrar um agente com fala
O Playground Voice Live contém amostras de voz prontas e permite criar uma solução. É necessário escolher o modelo generativo do agente e configurar voz, instruções e comportamento. A interação proativa permite que o agente inicie a conversa. Também é possível habilitar o modo Voice em um agente do , encapsulando a configuração na definição e reduzindo o código cliente.
A experiência permite falar com o agente e ouvir a resposta em tempo real.
Para uma aplicação Python, instale -ai-voicelive, pyaudio, python-dotenv e -identity. O exemplo gerado pelo portal inicia a sessão, conecta microfone e alto-falantes, processa fluxos de entrada e saída e trata interrupções. Ao executar, o assistente envia áudio do microfone ao Voice Live e reproduz a resposta recebida.
O cliente inicia a captura do microfone e processa a conversa falada.O portal oferece uma base para configurar sessão, áudio, instruções e eventos.
12. Exercício e verificação de conhecimento
O exercício de aproximadamente 25 minutos usa a do nas Ferramentas Foundry e Voice Live para criar um agente capaz de conversar em tempo real. É necessária uma assinatura ; contas novas podem incluir créditos gratuitos por 30 dias.
Por que integrar o to Text em vez de depender somente do Playground?
Quais responsabilidades o Text to assume para o desenvolvedor?
Qual é o papel do pacote -ai-voicelive em um agente habilitado para voz?
Respostas comentadas
O insere reconhecimento diretamente no código e no fluxo da aplicação; o Playground serve para experimentação.
O trata autenticação, comunicação de rede, formatação e geração do áudio, além de reprodução ou gravação conforme a configuração.
Voice Live abre a conexão em tempo real, transmite áudio e processa respostas faladas e interrupções; ele não substitui os dispositivos nem armazena gravações permanentemente por padrão.
13. Resumo e referências oficiais
to Text converte microfone, arquivo ou fluxo em texto para legendas, transcrições, ditado e entrada de agentes.
Reconhecimento pode ocorrer em tempo real ou por trabalhos em lote assíncronos.
Text to usa texto, voz, fonética, prosódia e modelos neurais para produzir áudio natural.
O de conecta aplicações à do e abstrai autenticação, rede, áudio e respostas.
Voice Live combina reconhecimento, raciocínio e síntese em um serviço gerenciado para agentes de voz responsivos.