Preparación para la Certificación Microsoft AI-901
Extracción de información de documentos, audio y vídeo en Microsoft Foundry
Azure Content Understanding, OCR, esquemas, analizadores, JSON, portal de Foundry, API y SDK de Python
Tiempo de estudio sugerido: 48 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. Por qué extraer información del contenido no estructurado
Facturas, formularios, recibos, contratos, llamadas grabadas y reuniones en vídeo contienen datos valiosos, pero leer, escribir y comprobar cada elemento manualmente es lento y propenso a errores. La extracción asistida por IA convierte este material en datos coherentes, buscables y listos para automatización.
Ejemplos de valor empresarial.
Entrada
Resultado posible
Recibo digitalizado
Proveedor, fecha, artículos y total completan una solicitud de gastos.
Llamada de soporte
Transcripción, resumen, sentimiento, contactos y acciones solicitadas.
Imagen o vídeo operativo
Personas, ubicación, eventos e intervalos para planear capacidad.
Documentos, imágenes, audio y vídeo pasan por un analizador y se convierten en salida estructurada.
2. Content Understanding in Foundry Tools
Content Understanding in Foundry Tools conserva ese nombre de producto en Microsoft Learn en español. Es una herramienta del recurso que combina y modelos especializados para comprender documentos, imágenes, audio y vídeo. Extrae contenido, entidades, campos, relaciones y significado en un formato definido por el usuario, normalmente .
El flujo es uniforme: ingerir el archivo; analizarlo con OCR, reconocimiento de voz, comprensión del lenguaje y modelos multimodales; aplicar un esquema; y devolver resultados legibles por máquina para almacenamiento, búsqueda, análisis o sistemas posteriores. La documentación actual también incluye segmentación, clasificación, puntuaciones de confianza y fundamentación en la fuente.
3. OCR, diseño y comprensión semántica
El Reconocimiento Óptico de Caracteres (OCR) identifica caracteres en fotografías y digitalizaciones y los convierte en texto editable y buscable. El análisis de diseño conserva párrafos, secciones, tablas, marcas de selección, fórmulas y jerarquías. Es esencial, pero por sí solo no explica el significado empresarial.
Content Understanding añade interpretación semántica y asignación mediante esquema. “Invoice No.”, “Invoice #” o incluso un número sin etiqueta pueden completar el mismo campo InvoiceNumber. El resultado representa conceptos, relaciones y tipos previsibles, no una cadena plana de palabras.
OCR recupera texto y diseño; la capa semántica asocia valores con campos de la aplicación.
4. Esquema de factura y campos anidados
Un esquema describe exactamente lo que necesita el proceso. Para una factura, los campos simples pueden incluir proveedor, número, fecha, cliente, dirección, subtotal, impuestos, envío y total. La colección Artículos contiene objetos anidados con descripción, precio unitario, cantidad y total de línea.
El analizador transforma etiquetas y posiciones variables en una estructura estable, incluida la lista anidada de artículos.
Valores conservados del ejemplo.
Campo
Valor
Proveedor / factura / fecha
Adventure Works Cycles / 1234 / 07/03/2025
Cliente
John Smith — 123 River Street, Marshtown, England GL1 234
Artículos
Bicicleta de carreras roja de 38″: 1 × 1.299,00; casco negro: 1 × 25,99; camiseta de ciclismo L: 2 × 42,50.
Totales
Subtotal 1.409,99; impuestos 140,99; envío 35,00; total 1.585,98.
5. Analizadores precompilados y personalizados
Un analizador es la unidad reutilizable que determina modalidad, extracción, esquema de campos, estructura de salida y modelos. Un analizador precompilado funciona sin configuración para un escenario conocido; uno personalizado aplica el esquema y las reglas de la organización.
prebuilt-invoice comprende campos comunes de facturas.
prebuilt-imageSearch describe imágenes para búsqueda y recuperación.
prebuilt-audioSearch transcribe audio, separa hablantes y genera información conversacional.
prebuilt-videoSearch combina fotogramas, audio, tiempo y resúmenes.
La documentación actual también enumera analizadores base: prebuilt-document, prebuilt-image, prebuilt-audio y prebuilt-video.
Elija o cree un analizador, defina el esquema, envíe contenido, espere el análisis y consuma .
6. Validar documentos en el portal de
Antes de programar, el portal permite seleccionar un analizador, usar archivos de muestra o cargar contenido propio y comprobar texto, diseño y campos. Los portales nuevo y clásico tienen interfaces diferentes, pero sirven para la misma validación.
La vista de contenido muestra texto y estructura detectados.La vista de campos asigna valores al esquema del analizador.El mismo análisis puede inspeccionarse como para integrarlo.
7. Aplicación cliente de documentos con el de Python
Una aplicación cliente se autentica en el , envía contenido, sigue la operación y procesa el resultado. El paquete -ai-contentunderstanding ofrece ContentUnderstandingClient. El tiene la forma ://<recurso>.services.ai..com/ y la credencial puede usar AzureKeyCredential o .
python -m pip install azure-ai-contentunderstanding
import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential
client = ContentUnderstandingClient(
endpoint=os.environ['FOUNDRY_ENDPOINT'],
credential=AzureKeyCredential(os.environ['FOUNDRY_KEY'])
)
poller = client.begin_analyze(
analyzer_id='prebuilt-invoice',
inputs=[{'url': os.environ['INVOICE_URL']}]
)
result = poller.result()
for content in result.contents:
print(getattr(content, 'markdown', None))
print(getattr(content, 'fields', None))
La respuesta incluye status, analyzerId, apiVersion y contents. Los campos pueden registrar tipo, valor y confianza; markdown conserva contenido legible para revisión o RAG. Mantenga secretos fuera del código y revise valores de baja confianza.
8. Operación asincrónica y
El análisis puede tardar, por lo que la usa una operación asincrónica. La solicitud inicial devuelve una dirección Operation-Location; el cliente la consulta hasta que el estado sea Succeeded o Failed. El encapsula el ciclo en el poller de begin_analyze y la llamada result().
Enviar un archivo o accesible al analizador.
Guardar el identificador u Operation-Location.
Consultar con intervalos controlados.
Al terminar, leer contents, markdown, fields y confianza.
Controlar errores, tiempo de espera y contenido incompatible.
9. Extracción estructurada de audio
Para audio, el servicio puede generar transcripción, diarización, resumen y campos definidos por esquema. Un esquema de buzón de voz puede solicitar persona que llama, resumen, acciones, teléfono de devolución y contacto alternativo.
Resultado del mensaje de voz de ejemplo.
Campo
Valor extraído
Persona que llama
Ava de Contoso
Resumen
Ava dio seguimiento a la reunión anterior e informó que la empresa puede cumplir las expectativas de precio.
Acción
Devolver la llamada o enviar correo para comentar los siguientes pasos.
Contactos
555-12345 y Ava@contoso.com
El analizador precompilado evita escuchar toda la llamada para obtener la transcripción.Los campos e información de la llamada quedan disponibles para procesamiento automático.
10. Extracción estructurada de vídeo
El vídeo combina señales visuales, audio y tiempo. Para una reunión, un esquema inicial puede solicitar ubicación, asistentes presenciales, asistentes remotos y total. El fotograma de ejemplo representa una sala de conferencias con una persona presencial y tres remotas, cuatro en total.
Un fotograma revela ubicación y asistencia; el vídeo completo agrega contexto temporal.
Un esquema más completo puede contar asistencia por intervalos, identificar quién habló y qué dijo, resumir el debate y enumerar acciones asignadas. La relación temporal entre fotogramas, voz y eventos diferencia el vídeo completo de una imagen aislada.
11. Cliente para analizadores de audio y vídeo
El mismo patrón del cliente de documentos funciona para medios. Use prebuilt-audioSearch o prebuilt-videoSearch, proporcione una accesible y espere al poller. Según el analizador y el esquema, contents puede contener transcripción/markdown, campos, segmentos y temporales.
analyzer_id = 'prebuilt-audioSearch'
inputs = [{'url': 'https://example.org/samples/voicemail.wav'}]
poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)
result = poller.result()
for content in result.contents:
print('TRANSCRIPCIÓN:', getattr(content, 'markdown', None))
print('CAMPOS:', getattr(content, 'fields', None))
12. Ejercicio y evaluación comentada
El ejercicio de unos 25 minutos usa Content Understanding en para analizar documentos. Requiere una suscripción de ; las cuentas nuevas pueden incluir créditos gratuitos durante 30 días. Compare el contenido original con los campos y el antes de automatizar.
El laboratorio guía la ejecución de un analizador y la inspección del resultado.
Content Understanding comprende la estructura y asigna los datos extraídos a un esquema definido.
Función principal del analizador
Definir cómo se procesa el contenido y qué datos estructurados se devuelven.
Qué ocurre tras enviar con el
La aplicación consulta la u operación hasta que termina el trabajo asincrónico.
13. Resumen y referencias oficiales
Content Understanding aplica un flujo único a documentos, imágenes, audio y vídeo: ingesta, extracción, razonamiento con IA, asignación al esquema y datos estructurados. Los analizadores precompilados aceleran escenarios comunes; los personalizados aportan coherencia del dominio; portal, y de Python cubren desde validación hasta automatización a escala.
Use OCR para texto y diseño; use esquema y semántica para significado empresarial.
Modele colecciones anidadas para grupos repetidos, como artículos de factura.
Pruebe en el portal y compruebe campos, y confianza antes de integrar.
Trate el análisis como asincrónico y proteja , claves, datos personales y grabaciones.