Extração de informações de documentos, áudio e vídeo no Microsoft Foundry
Voltar para a trilha AI-901
AI-901Capítulo 12

Estudo para a Certificação Microsoft AI-901

Extração de informações de documentos, áudio e vídeo no Microsoft Foundry

Azure Content Understanding, OCR, esquemas, analisadores, JSON, portal do Foundry, API e SDK do Python

Tempo de estudo sugerido: 48 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn

Escudo neon Microsoft Certified AI-901 cercado por símbolos de documentos, áudio, vídeo e extração de informações

1. Por que extrair informações de conteúdo não estruturado

Faturas, formulários, recibos, contratos, chamadas gravadas e reuniões em vídeo concentram dados úteis, mas o trabalho manual de ler, digitar e conferir cada item é lento e sujeito a erros. A extração assistida por IA converte esse material em dados consistentes, pesquisáveis e prontos para automação.

Exemplos de valor empresarial.
EntradaResultado possível
Recibo digitalizadoFornecedor, data, itens e total alimentam uma solicitação de despesas.
Chamada de suporteTranscrição, resumo, sentimento, contatos e ações solicitadas.
Imagem ou vídeo operacionalPessoas, local, eventos, intervalos de tempo e decisões para planejamento de capacidade.
Fluxo de conteúdo não estruturado para dados acionáveis.
Documentos, imagens, áudio e vídeo passam por um analisador e se tornam saída estruturada.

2. Content Understanding in Foundry Tools

Content Understanding in Foundry Tools — apresentado em português pelo Microsoft Learn como Entendimento de Conteúdo do nas Ferramentas Foundry — é uma ferramenta do recurso que usa e modelos especializados para entender documentos, imagens, áudio e vídeo. Ela extrai conteúdo, entidades, campos, relações e significado em um formato definido pelo usuário, normalmente .

O fluxo é uniforme: o serviço ingere o arquivo; OCR, reconhecimento de fala, compreensão de linguagem e modelos multimodais analisam o conteúdo; um esquema orienta a extração; e o resultado legível por máquina pode ser armazenado, pesquisado, analisado ou enviado a sistemas posteriores. A documentação atual também descreve segmentação, classificação, pontuações de confiança e fundamentação dos campos na origem.

3. OCR, layout e compreensão semântica

O Reconhecimento Óptico de Caracteres (OCR) identifica caracteres em fotos e digitalizações e os converte em texto editável e pesquisável. Análise de layout preserva elementos como parágrafos, seções, tabelas, marcas de seleção, fórmulas e hierarquias. Isso é essencial, mas não resolve sozinho o significado empresarial.

Content Understanding acrescenta interpretação semântica e mapeamento por esquema. Assim, “Invoice No.”, “Invoice #” ou até um número sem rótulo podem alimentar o mesmo campo InvoiceNumber. O resultado deixa de ser uma sequência de palavras e passa a representar conceitos, relações e tipos previsíveis.

Comparação entre OCR e extração orientada por esquema.
OCR recupera texto e layout; a camada semântica associa valores aos campos usados pela aplicação.

4. Esquema de fatura e campos aninhados

Um esquema descreve exatamente o que o processo precisa receber. Para uma fatura, campos simples incluem fornecedor, número, data, cliente, endereço, subtotal, imposto, frete e total. A coleção Itens contém objetos aninhados com descrição, preço unitário, quantidade e total da linha.

Fatura Adventure Works e esquema de campos extraídos.
O analisador transforma rótulos e posições variáveis em uma estrutura estável, inclusive a lista aninhada de itens.
Valores preservados do exemplo.
CampoValor
Fornecedor / fatura / dataAdventure Works Cycles / 1234 / 07/03/2025
ClienteJohn Smith — 123 River Street, Marshtown, England GL1 234
ItensBicicleta de corrida vermelha 38″: 1 × 1.299,00; capacete preto: 1 × 25,99; camisa de ciclismo G: 2 × 42,50.
TotaisSubtotal 1.409,99; imposto 140,99; frete 35,00; total 1.585,98.

5. Analisadores predefinidos e personalizados

Um analisador é a unidade reutilizável que determina a modalidade, o modo de extração, o esquema de campos, a estrutura de saída e os modelos usados. Um analisador predefinido funciona sem configuração para um cenário conhecido; um analisador personalizado aplica o esquema e as regras da organização.

  • prebuilt-invoice entende campos comuns de faturas.
  • prebuilt-imageSearch descreve imagens para pesquisa e recuperação.
  • prebuilt-audioSearch transcreve áudio, separa falantes e produz informações conversacionais.
  • prebuilt-videoSearch combina quadros, trilha de áudio, tempo e resumo.
  • A documentação atual também apresenta analisadores-base como prebuilt-document, prebuilt-image, prebuilt-audio e prebuilt-video.
Ciclo de definição e uso de um analisador.
Escolha ou crie o analisador, defina o esquema, envie conteúdo, aguarde a análise e consuma o .

6. Validar documentos no portal do

Antes de programar, o portal permite escolher um analisador, usar arquivos de exemplo ou carregar conteúdo próprio e verificar se texto, layout e campos correspondem ao esperado. A interface nova e a clássica podem diferir, porém cumprem o mesmo papel de experimentação.

Captura original do portal do Microsoft Foundry analisando um documento de identidade.
A exibição de conteúdo mostra texto e estrutura detectados no documento.
Captura original dos campos de uma fatura no portal do Microsoft Foundry.
A exibição de campos mapeia valores da fatura para o esquema do analisador.
Captura original da saída JSON de uma fatura no portal do Microsoft Foundry.
A mesma análise pode ser inspecionada como para integração posterior.

7. Aplicação cliente para documentos com o do Python

Uma aplicação cliente é um programa que autentica no , envia o conteúdo, acompanha a operação e processa o resultado. O pacote -ai-contentunderstanding oferece ContentUnderstandingClient. O tem a forma ://<recurso>.services.ai..com/ e a credencial pode ser uma chave com AzureKeyCredential ou quando configurado.

python -m pip install azure-ai-contentunderstanding

import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential

client = ContentUnderstandingClient(
    endpoint=os.environ['FOUNDRY_ENDPOINT'],
    credential=AzureKeyCredential(os.environ['FOUNDRY_KEY'])
)

poller = client.begin_analyze(
    analyzer_id='prebuilt-invoice',
    inputs=[{'url': os.environ['INVOICE_URL']}]
)
result = poller.result()

for content in result.contents:
    print(getattr(content, 'markdown', None))
    print(getattr(content, 'fields', None))

A resposta inclui status, analyzerId, apiVersion e contents. Campos podem registrar tipo, valor e confiança; markdown preserva conteúdo útil para leitura ou RAG. Mantenha segredos fora do código e valide valores de baixa confiança antes de decisões sensíveis.

8. Operação assíncrona e

A análise pode demorar, portanto a usa uma operação assíncrona. A solicitação inicial devolve um endereço em Operation-Location; o cliente consulta esse endereço até o estado mudar para Succeeded ou Failed. O encapsula esse ciclo no poller retornado por begin_analyze e em result().

  1. Enviar arquivo ou acessível ao analisador.
  2. Guardar o identificador ou Operation-Location.
  3. Consultar com intervalos controlados, sem um loop agressivo.
  4. Ao concluir, ler contents, markdown, fields e pontuações de confiança.
  5. Tratar falhas, limite de tempo e conteúdo incompatível.

9. Extração estruturada de áudio

Para áudio, o serviço pode produzir transcrição, diarização de falantes, resumo e campos definidos pelo esquema. Em uma caixa postal, por exemplo, um esquema pode pedir chamador, resumo, ações, telefone de retorno e contato alternativo.

Resultado do recado de voz do exemplo.
CampoValor extraído
ChamadorAva, da Contoso
ResumoAva acompanhou a reunião anterior e informou que a empresa consegue atender à expectativa de preço.
AçãoRetornar a ligação ou enviar email para combinar os próximos passos.
Contatos555-12345 e Ava@contoso.com
Captura original da transcrição de áudio no portal do Microsoft Foundry.
O analisador predefinido evita ouvir toda a chamada para obter a transcrição.
Captura original dos resultados JSON da análise de áudio.
Campos e informações da chamada ficam disponíveis para processamento automático.

10. Extração estruturada de vídeo

Vídeo combina pistas visuais, áudio e tempo. Em uma reunião, um esquema inicial pode pedir local, participantes presenciais, participantes remotos e total. O quadro de exemplo representa uma sala de conferência com uma pessoa presencial e três remotas, totalizando quatro.

Fotografia original de uma reunião híbrida usada no exemplo de análise de vídeo.
Um único quadro já permite extrair local e presença; o vídeo completo acrescenta contexto temporal.

Um esquema mais rico para a gravação pode contar presença em intervalos, identificar quem falou e o que disse, resumir a discussão e listar responsáveis e ações. A relação temporal entre quadros, fala e eventos é o diferencial em comparação com analisar uma imagem isolada.

11. Cliente para analisadores de áudio e vídeo

O mesmo padrão do cliente de documentos funciona para mídia. Use prebuilt-audioSearch ou prebuilt-videoSearch, forneça uma acessível e aguarde o poller. Conforme o analisador e o esquema, contents pode conter transcrição/markdown, campos estruturados, segmentos e temporais.

analyzer_id = 'prebuilt-audioSearch'
inputs = [{'url': 'https://example.org/samples/voicemail.wav'}]

poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)
result = poller.result()

for content in result.contents:
    print('TRANSCRIÇÃO:', getattr(content, 'markdown', None))
    print('CAMPOS:', getattr(content, 'fields', None))

12. Exercício e avaliação comentada

O exercício de aproximadamente 25 minutos usa Content Understanding no para analisar documentos. É necessária uma assinatura do ; novas contas podem oferecer créditos gratuitos nos primeiros 30 dias. Compare o conteúdo real com campos e antes de automatizar.

Captura original do exercício de extração de informações no Microsoft Foundry.
O laboratório orienta a execução de um analisador e a inspeção do resultado.
Gabarito explicado.
PerguntaResposta e justificativa
Vantagem sobre OCR básicoContent Understanding entende a estrutura do documento e mapeia os dados extraídos para um esquema definido.
Papel principal do analisadorDefinir como o conteúdo é processado e quais dados estruturados serão devolvidos.
O que ocorre após enviar pelo A aplicação acompanha a /operação até o trabalho assíncrono terminar.

13. Resumo e referências oficiais

Content Understanding aplica um fluxo único a documentos, imagens, áudio e vídeo: ingerir, extrair conteúdo, interpretar com IA, mapear para um esquema e devolver dados estruturados. Analisadores predefinidos aceleram cenários comuns; analisadores personalizados dão consistência ao domínio; portal, e do Python atendem da validação à automação em escala.

  • Use OCR para recuperar texto e layout; use esquema e semântica para obter significado empresarial.
  • Modele coleções aninhadas quando o documento contém grupos repetidos, como itens de fatura.
  • Teste no portal e integre somente após verificar campos, e confiança.
  • Trate análise como assíncrona e proteja , chaves, dados pessoais e gravações.