Extração de informações de documentos, áudio e vídeo no Microsoft Foundry
Azure Content Understanding, OCR, esquemas, analisadores, JSON, portal do Foundry, API e SDK do Python
Tempo de estudo sugerido: 48 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn
Por João Ricardo Dutra••Conteúdo autoral completo
1. Por que extrair informações de conteúdo não estruturado
Faturas, formulários, recibos, contratos, chamadas gravadas e reuniões em vídeo concentram dados úteis, mas o trabalho manual de ler, digitar e conferir cada item é lento e sujeito a erros. A extração assistida por IA converte esse material em dados consistentes, pesquisáveis e prontos para automação.
Exemplos de valor empresarial.
Entrada
Resultado possível
Recibo digitalizado
Fornecedor, data, itens e total alimentam uma solicitação de despesas.
Chamada de suporte
Transcrição, resumo, sentimento, contatos e ações solicitadas.
Imagem ou vídeo operacional
Pessoas, local, eventos, intervalos de tempo e decisões para planejamento de capacidade.
Documentos, imagens, áudio e vídeo passam por um analisador e se tornam saída estruturada.
2. Content Understanding in Foundry Tools
Content Understanding in Foundry Tools — apresentado em português pelo Microsoft Learn como Entendimento de Conteúdo do nas Ferramentas Foundry — é uma ferramenta do recurso que usa e modelos especializados para entender documentos, imagens, áudio e vídeo. Ela extrai conteúdo, entidades, campos, relações e significado em um formato definido pelo usuário, normalmente .
O fluxo é uniforme: o serviço ingere o arquivo; OCR, reconhecimento de fala, compreensão de linguagem e modelos multimodais analisam o conteúdo; um esquema orienta a extração; e o resultado legível por máquina pode ser armazenado, pesquisado, analisado ou enviado a sistemas posteriores. A documentação atual também descreve segmentação, classificação, pontuações de confiança e fundamentação dos campos na origem.
3. OCR, layout e compreensão semântica
O Reconhecimento Óptico de Caracteres (OCR) identifica caracteres em fotos e digitalizações e os converte em texto editável e pesquisável. Análise de layout preserva elementos como parágrafos, seções, tabelas, marcas de seleção, fórmulas e hierarquias. Isso é essencial, mas não resolve sozinho o significado empresarial.
Content Understanding acrescenta interpretação semântica e mapeamento por esquema. Assim, “Invoice No.”, “Invoice #” ou até um número sem rótulo podem alimentar o mesmo campo InvoiceNumber. O resultado deixa de ser uma sequência de palavras e passa a representar conceitos, relações e tipos previsíveis.
OCR recupera texto e layout; a camada semântica associa valores aos campos usados pela aplicação.
4. Esquema de fatura e campos aninhados
Um esquema descreve exatamente o que o processo precisa receber. Para uma fatura, campos simples incluem fornecedor, número, data, cliente, endereço, subtotal, imposto, frete e total. A coleção Itens contém objetos aninhados com descrição, preço unitário, quantidade e total da linha.
O analisador transforma rótulos e posições variáveis em uma estrutura estável, inclusive a lista aninhada de itens.
Valores preservados do exemplo.
Campo
Valor
Fornecedor / fatura / data
Adventure Works Cycles / 1234 / 07/03/2025
Cliente
John Smith — 123 River Street, Marshtown, England GL1 234
Itens
Bicicleta de corrida vermelha 38″: 1 × 1.299,00; capacete preto: 1 × 25,99; camisa de ciclismo G: 2 × 42,50.
Totais
Subtotal 1.409,99; imposto 140,99; frete 35,00; total 1.585,98.
5. Analisadores predefinidos e personalizados
Um analisador é a unidade reutilizável que determina a modalidade, o modo de extração, o esquema de campos, a estrutura de saída e os modelos usados. Um analisador predefinido funciona sem configuração para um cenário conhecido; um analisador personalizado aplica o esquema e as regras da organização.
prebuilt-invoice entende campos comuns de faturas.
prebuilt-imageSearch descreve imagens para pesquisa e recuperação.
prebuilt-audioSearch transcreve áudio, separa falantes e produz informações conversacionais.
prebuilt-videoSearch combina quadros, trilha de áudio, tempo e resumo.
A documentação atual também apresenta analisadores-base como prebuilt-document, prebuilt-image, prebuilt-audio e prebuilt-video.
Escolha ou crie o analisador, defina o esquema, envie conteúdo, aguarde a análise e consuma o .
6. Validar documentos no portal do
Antes de programar, o portal permite escolher um analisador, usar arquivos de exemplo ou carregar conteúdo próprio e verificar se texto, layout e campos correspondem ao esperado. A interface nova e a clássica podem diferir, porém cumprem o mesmo papel de experimentação.
A exibição de conteúdo mostra texto e estrutura detectados no documento.A exibição de campos mapeia valores da fatura para o esquema do analisador.A mesma análise pode ser inspecionada como para integração posterior.
7. Aplicação cliente para documentos com o do Python
Uma aplicação cliente é um programa que autentica no , envia o conteúdo, acompanha a operação e processa o resultado. O pacote -ai-contentunderstanding oferece ContentUnderstandingClient. O tem a forma ://<recurso>.services.ai..com/ e a credencial pode ser uma chave com AzureKeyCredential ou quando configurado.
python -m pip install azure-ai-contentunderstanding
import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential
client = ContentUnderstandingClient(
endpoint=os.environ['FOUNDRY_ENDPOINT'],
credential=AzureKeyCredential(os.environ['FOUNDRY_KEY'])
)
poller = client.begin_analyze(
analyzer_id='prebuilt-invoice',
inputs=[{'url': os.environ['INVOICE_URL']}]
)
result = poller.result()
for content in result.contents:
print(getattr(content, 'markdown', None))
print(getattr(content, 'fields', None))
A resposta inclui status, analyzerId, apiVersion e contents. Campos podem registrar tipo, valor e confiança; markdown preserva conteúdo útil para leitura ou RAG. Mantenha segredos fora do código e valide valores de baixa confiança antes de decisões sensíveis.
8. Operação assíncrona e
A análise pode demorar, portanto a usa uma operação assíncrona. A solicitação inicial devolve um endereço em Operation-Location; o cliente consulta esse endereço até o estado mudar para Succeeded ou Failed. O encapsula esse ciclo no poller retornado por begin_analyze e em result().
Enviar arquivo ou acessível ao analisador.
Guardar o identificador ou Operation-Location.
Consultar com intervalos controlados, sem um loop agressivo.
Ao concluir, ler contents, markdown, fields e pontuações de confiança.
Tratar falhas, limite de tempo e conteúdo incompatível.
9. Extração estruturada de áudio
Para áudio, o serviço pode produzir transcrição, diarização de falantes, resumo e campos definidos pelo esquema. Em uma caixa postal, por exemplo, um esquema pode pedir chamador, resumo, ações, telefone de retorno e contato alternativo.
Resultado do recado de voz do exemplo.
Campo
Valor extraído
Chamador
Ava, da Contoso
Resumo
Ava acompanhou a reunião anterior e informou que a empresa consegue atender à expectativa de preço.
Ação
Retornar a ligação ou enviar email para combinar os próximos passos.
Contatos
555-12345 e Ava@contoso.com
O analisador predefinido evita ouvir toda a chamada para obter a transcrição.Campos e informações da chamada ficam disponíveis para processamento automático.
10. Extração estruturada de vídeo
Vídeo combina pistas visuais, áudio e tempo. Em uma reunião, um esquema inicial pode pedir local, participantes presenciais, participantes remotos e total. O quadro de exemplo representa uma sala de conferência com uma pessoa presencial e três remotas, totalizando quatro.
Um único quadro já permite extrair local e presença; o vídeo completo acrescenta contexto temporal.
Um esquema mais rico para a gravação pode contar presença em intervalos, identificar quem falou e o que disse, resumir a discussão e listar responsáveis e ações. A relação temporal entre quadros, fala e eventos é o diferencial em comparação com analisar uma imagem isolada.
11. Cliente para analisadores de áudio e vídeo
O mesmo padrão do cliente de documentos funciona para mídia. Use prebuilt-audioSearch ou prebuilt-videoSearch, forneça uma acessível e aguarde o poller. Conforme o analisador e o esquema, contents pode conter transcrição/markdown, campos estruturados, segmentos e temporais.
analyzer_id = 'prebuilt-audioSearch'
inputs = [{'url': 'https://example.org/samples/voicemail.wav'}]
poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)
result = poller.result()
for content in result.contents:
print('TRANSCRIÇÃO:', getattr(content, 'markdown', None))
print('CAMPOS:', getattr(content, 'fields', None))
12. Exercício e avaliação comentada
O exercício de aproximadamente 25 minutos usa Content Understanding no para analisar documentos. É necessária uma assinatura do ; novas contas podem oferecer créditos gratuitos nos primeiros 30 dias. Compare o conteúdo real com campos e antes de automatizar.
O laboratório orienta a execução de um analisador e a inspeção do resultado.
Content Understanding entende a estrutura do documento e mapeia os dados extraídos para um esquema definido.
Papel principal do analisador
Definir como o conteúdo é processado e quais dados estruturados serão devolvidos.
O que ocorre após enviar pelo
A aplicação acompanha a /operação até o trabalho assíncrono terminar.
13. Resumo e referências oficiais
Content Understanding aplica um fluxo único a documentos, imagens, áudio e vídeo: ingerir, extrair conteúdo, interpretar com IA, mapear para um esquema e devolver dados estruturados. Analisadores predefinidos aceleram cenários comuns; analisadores personalizados dão consistência ao domínio; portal, e do Python atendem da validação à automação em escala.
Use OCR para recuperar texto e layout; use esquema e semântica para obter significado empresarial.
Modele coleções aninhadas quando o documento contém grupos repetidos, como itens de fatura.
Teste no portal e integre somente após verificar campos, e confiança.
Trate análise como assíncrona e proteja , chaves, dados pessoais e gravações.