Fala no Azure: Speech to Text, Text to Speech e Voice Live
Voltar para a trilha AI-901
AI-901Capítulo 10

Estudo para a Certificação Microsoft AI-901

Fala no Azure: Speech to Text, Text to Speech e Voice Live

Reconhecimento, síntese, SDK de Fala, transcrição em lote, vozes neurais e agentes de conversação em tempo real

Tempo de estudo sugerido: 50 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn

Escudo neon Microsoft Certified AI-901 Azure AI Fundamentals cercado por símbolos de IA, linguagem, visão, fala e agentes

1. Interfaces de fala para aplicações e agentes

Recursos de fala permitem controlar sistemas por voz, obter respostas para perguntas faladas, gerar legendas de áudio e conversar com agentes sem depender de teclado ou leitura de tela. Essa interação mais natural também amplia acessibilidade e inclusão. Para completar o ciclo, a solução precisa reconhecer o que a pessoa disse e sintetizar uma resposta audível.

Exemplos de uso de fala com IA.
ÁreaAplicação
SaúdeDitado clínico converte observações do médico em texto e reduz digitação manual.
AtendimentoTranscrição de chamadas em tempo real facilita revisão, identificação de problemas e análise de sentimento.
MídiaLegendas ao vivo ou gravadas aumentam acessibilidade e apoiam públicos multilíngues.
EducaçãoAplicativos escutam o aluno e oferecem retorno sobre pronúncia.
VarejoAssistentes entendem pedidos falados e respondem com informações de produto ou situação do pedido.
Ciclo de interação por fala entre pessoa, aplicação e agente.
Reconhecimento converte voz em dados; síntese transforma a resposta em áudio.

2. do nas Ferramentas Foundry

A do nas Ferramentas Foundry fornece conversão de fala em texto, texto em fala e tradução de fala. Modelos predefinidos e personalizados atendem transcrição, identificação de locutores, vozes personalizadas e outros cenários. Um recurso do fornece e credenciais, enquanto o projeto organiza experiências, agentes e integrações.

No novo portal do , as experiências ficam em Build, Models e AI services. O Playground permite gravar ou enviar áudio, testar vozes, alterar parâmetros e observar resultados antes de escrever código. Quem prefere vídeo pode usá-lo como introdução, mas o texto detalha mais configurações e decisões de implementação.

  • to Text: transforma áudio de microfone, arquivo ou fluxo em texto.
  • Text to : produz áudio natural a partir de texto e de uma voz escolhida.
  • translation: reconhece uma fala e entrega conteúdo em outro idioma.
  • Voice Live: reúne entrada de áudio, raciocínio e resposta falada em tempo real.

3. Como funciona o reconhecimento de fala

Reconhecimento de fala, ou speech-to-text (STT), converte palavras faladas em dados, normalmente texto. Um modelo acústico examina o sinal e o representa como fonemas, que correspondem a unidades sonoras. Em seguida, um modelo de linguagem relaciona esses fonemas a palavras e sequências plausíveis.

O texto reconhecido pode alimentar legendas, transcrições de chamadas, ditado de notas, mensagens de voz e agentes. A to Text da do aceita áudio capturado pelo microfone ou fornecido como arquivo. Uma define regras e que permitem a um software usar funções ou dados de outro.

Pipeline de reconhecimento com áudio, modelo acústico, fonemas, modelo de linguagem e texto.
O modelo acústico interpreta sons; o modelo de linguagem transforma a sequência em palavras contextualizadas.

4. Playground e de conversão de fala em texto

No Playground to Text, você pode enviar um arquivo ou gravar a própria voz. A transcrição mostra rapidamente como uma futura aplicação responderia à entrada. Para integrar a capacidade ao produto, use o de , uma biblioteca cliente que abstrai rede, autenticação, de áudio e interpretação da resposta.

Captura original do Playground Speech to Text no Microsoft Foundry.
A interface real foi preservada em PNG e permite gravar, enviar áudio e conferir a transcrição.
  • Capturar ou encaminhar áudio de microfone, arquivo ou fluxo.
  • Enviar o conteúdo com segurança à do .
  • Receber texto quase em tempo real ou depois do processamento.
  • Usar o na camada cliente ou de serviço como ponte entre aplicação e .

Para Python, instale o pacote -cognitiveservices-speech pelo terminal do . O recurso do Foundry fornece e chave; também pode autenticar. Em produção, mantenha segredos fora do código.

pip install azure-cognitiveservices-speech python-dotenv

5. Cliente Python para reconhecimento contínuo

O fluxo de uma aplicação é: inicializar o e autenticar, capturar ou carregar áudio, transmitir o conteúdo, executar o reconhecimento na nuvem e receber texto com opcionais. SpeechConfig concentra a conexão, AudioConfig indica a origem e SpeechRecognizer executa o reconhecimento.

import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv

load_dotenv()
speech_config = speechsdk.SpeechConfig(
    subscription=os.environ['FOUNDRY_KEY'],
    endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
microphone = speechsdk.audio.AudioConfig(use_default_microphone=True)
recognizer = speechsdk.SpeechRecognizer(
    speech_config=speech_config,
    audio_config=microphone
)

recognizer.recognizing.connect(
    lambda event: print('Parcial:', event.result.text)
)
recognizer.recognized.connect(
    lambda event: print('Reconhecido:', event.result.text)
)

recognizer.start_continuous_recognition()
input('Fale; pressione Enter para encerrar...')
recognizer.stop_continuous_recognition()

O evento recognizing apresenta hipóteses parciais enquanto a pessoa fala; recognized entrega o resultado confirmado. Para uma caixa postal, AudioConfig pode apontar para um arquivo em vez do microfone. O objeto SpeechRecognizer transcreve e a aplicação exibe ou armazena o texto.

Captura original de um arquivo de mensagem de voz no Visual Studio Code.
O exemplo usa um áudio gravado como fonte da transcrição.
Captura original do código Python de reconhecimento de fala.
O código conecta o , seleciona o arquivo e cria SpeechRecognizer.
Captura original do terminal com a transcrição da mensagem.
O resultado reconhecido é devolvido ao cliente como texto.

6. Transcrição em tempo real e em lote

A to Text oferece processamento em tempo real e em lote. Em tempo real, a aplicação escuta um microfone ou outra fonte, transmite o fluxo e recebe texto durante a fala. É indicada para apresentações, demonstrações, legendas e conversas.

Em lote, gravações já armazenadas em compartilhamento, servidor remoto ou do são processadas de forma assíncrona. O aplicativo pode fornecer uma com assinatura de acesso compartilhado (SAS). Os trabalhos são agendados em melhor esforço: normalmente começam em minutos, mas não há garantia exata para a mudança ao estado de execução.

Escolha da modalidade de transcrição.
ModalidadeEntradaComportamentoCenário
Tempo realMicrofone, arquivo ou fluxo ativoTexto retorna enquanto o áudio chegaLegenda, reunião, comando de voz.
Arquivos armazenados e acessíveis por Trabalho assíncrono agendadoArquivo de chamadas, entrevistas e grandes acervos.
Comparação de transcrição em tempo real e em lote.
A origem e a urgência do resultado determinam imediato ou trabalho assíncrono.

7. Como funciona a síntese de fala

Síntese de fala, ou text-to-speech (TTS), vocaliza dados e geralmente transforma texto em áudio. A solução precisa receber o texto e selecionar uma voz. O processamento tokeniza o conteúdo em palavras, associa sons fonéticos, organiza a transcrição em unidades prosódicas como frases e sentenças, produz fonemas e finalmente sintetiza o sinal.

A saída pode responder ao usuário, ler mensagens ou transmitir anúncios. , idioma e pronúncia regional moldam a identidade da experiência; velocidade, tom e volume controlam a entrega. Vozes neurais usam redes neurais para reduzir limitações de entonação e soar mais naturais. A plataforma oferece várias vozes predefinidas e também permite criar vozes personalizadas.

Pipeline de síntese do texto até áudio com voz, velocidade, tom e volume.
Tokenização, fonética, prosódia e fonemas preparam o texto antes da geração do áudio.

8. Playground e de conversão de texto em fala

No Playground Text to , escreva o texto, escolha uma voz sintética e ajuste parâmetros como velocidade e tom. O áudio pode ser reproduzido pelo alto-falante ou salvo em arquivo. O envia texto à do , usa vozes neurais e devolve o áudio, cuidando de autenticação, rede, formatação e reprodução.

Captura original do Playground Text to Speech no Microsoft Foundry.
A interface permite escolher voz, idioma, velocidade, tom e volume antes de gerar o áudio.

Aplicações cliente podem vocalizar imediatamente em computadores e celulares; serviços podem gerar arquivos para reprodução posterior. O pacote Python é o mesmo usado pelo reconhecimento, -cognitiveservices-speech.

9. Cliente Python para síntese

SpeechSynthesizer recebe SpeechConfig e AudioOutputConfig. O exemplo abaixo usa o alto-falante padrão, lê o texto no console e aguarda a conclusão assíncrona. A aplicação verifica sucesso ou cancelamento para expor detalhes de erro quando necessário.

import os
import azure.cognitiveservices.speech as speechsdk
from dotenv import load_dotenv

load_dotenv()
config = speechsdk.SpeechConfig(
    subscription=os.environ['FOUNDRY_KEY'],
    endpoint=os.environ['AZURE_SPEECH_ENDPOINT']
)
config.speech_synthesis_voice_name = 'en-US-Ava:DragonHDLatestNeural'
speaker = speechsdk.audio.AudioOutputConfig(use_default_speaker=True)
synthesizer = speechsdk.SpeechSynthesizer(
    speech_config=config,
    audio_config=speaker
)

message = input('Texto a vocalizar: ')
result = synthesizer.speak_text_async(message).get()
if result.reason == speechsdk.ResultReason.SynthesizingAudioCompleted:
    print('Áudio sintetizado.')
elif result.reason == speechsdk.ResultReason.Canceled:
    details = result.cancellation_details
    print('Síntese cancelada:', details.reason)
    if details.error_details:
        print(details.error_details)

Uma aplicação que vocaliza mensagens pode ler um arquivo de texto, criar SpeechSynthesizer e gerar o áudio. Uma voz neural multilíngue pode adaptar o idioma ao conteúdo de entrada. Para salvar em vez de reproduzir, configure a saída para arquivo.

Captura original de um arquivo de mensagem usado para síntese.
O texto armazenado é a entrada do processo de vocalização.
Captura original do cliente Python de síntese de fala.
O código cria SpeechSynthesizer, lê o texto e trata conclusão ou cancelamento.
Captura original do terminal após a síntese da mensagem.
A execução converte o texto em saída de áudio.

10. Conversas de voz com to e Voice Live

to speech recebe áudio falado e entrega áudio falado, criando uma conversa sem leitura ou digitação. A tradicional reconhece a fala, passa o texto por tradução, resumo, lógica da aplicação ou raciocínio de um agente e sintetiza a resposta. Assistentes, tradução oral, quiosques, navegação, ferramentas industriais, acessibilidade e bots de atendimento são exemplos.

Voice Live reúne reconhecimento, e texto em fala em um serviço gerenciado de baixa latência. Em vez de conectar manualmente vários componentes, a aplicação envia áudio e recebe resposta falada. O serviço também pode retornar elementos visuais, como avatares, e acionar ações.

  • A do executa reconhecimento e síntese.
  • Um agente ou a lógica da aplicação decide o conteúdo da resposta.
  • Ferramentas do Foundry ou servidores MCP podem expor fala como capacidades invocáveis.
  • Um modelo generativo selecionado trabalha com modelos acústicos para sustentar a conversa.
Arquitetura de conversa em tempo real com Voice Live.
Voice Live coordena entrada de áudio, reconhecimento, raciocínio, ferramentas e resposta falada.

11. Criar e integrar um agente com fala

O Playground Voice Live contém amostras de voz prontas e permite criar uma solução. É necessário escolher o modelo generativo do agente e configurar voz, instruções e comportamento. A interação proativa permite que o agente inicie a conversa. Também é possível habilitar o modo Voice em um agente do , encapsulando a configuração na definição e reduzindo o código cliente.

Captura original de um agente no Playground Voice Live.
A experiência permite falar com o agente e ouvir a resposta em tempo real.

Para uma aplicação Python, instale -ai-voicelive, pyaudio, python-dotenv e -identity. O exemplo gerado pelo portal inicia a sessão, conecta microfone e alto-falantes, processa fluxos de entrada e saída e trata interrupções. Ao executar, o assistente envia áudio do microfone ao Voice Live e reproduz a resposta recebida.

pip install azure-ai-voicelive pyaudio python-dotenv azure-identity
Captura original de um cliente Voice Live em execução no terminal.
O cliente inicia a captura do microfone e processa a conversa falada.
Captura original do código de integração exibido pelo Playground Voice Live.
O portal oferece uma base para configurar sessão, áudio, instruções e eventos.

12. Exercício e verificação de conhecimento

O exercício de aproximadamente 25 minutos usa a do nas Ferramentas Foundry e Voice Live para criar um agente capaz de conversar em tempo real. É necessária uma assinatura ; contas novas podem incluir créditos gratuitos por 30 dias.

Perguntas reformuladas

  1. Por que integrar o to Text em vez de depender somente do Playground?
  2. Quais responsabilidades o Text to assume para o desenvolvedor?
  3. Qual é o papel do pacote -ai-voicelive em um agente habilitado para voz?

Respostas comentadas

  • O insere reconhecimento diretamente no código e no fluxo da aplicação; o Playground serve para experimentação.
  • O trata autenticação, comunicação de rede, formatação e geração do áudio, além de reprodução ou gravação conforme a configuração.
  • Voice Live abre a conexão em tempo real, transmite áudio e processa respostas faladas e interrupções; ele não substitui os dispositivos nem armazena gravações permanentemente por padrão.

13. Resumo e referências oficiais

  • to Text converte microfone, arquivo ou fluxo em texto para legendas, transcrições, ditado e entrada de agentes.
  • Reconhecimento pode ocorrer em tempo real ou por trabalhos em lote assíncronos.
  • Text to usa texto, voz, fonética, prosódia e modelos neurais para produzir áudio natural.
  • O de conecta aplicações à do e abstrai autenticação, rede, áudio e respostas.
  • Voice Live combina reconhecimento, raciocínio e síntese em um serviço gerenciado para agentes de voz responsivos.