Extracción de información de documentos, audio y vídeo en Microsoft Foundry
Volver a la ruta AI-901
AI-901Capítulo 12

Preparación para la Certificación Microsoft AI-901

Extracción de información de documentos, audio y vídeo en Microsoft Foundry

Azure Content Understanding, OCR, esquemas, analizadores, JSON, portal de Foundry, API y SDK de Python

Tiempo de estudio sugerido: 48 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 rodeado de símbolos de documentos, audio, vídeo y extracción de información

1. Por qué extraer información del contenido no estructurado

Facturas, formularios, recibos, contratos, llamadas grabadas y reuniones en vídeo contienen datos valiosos, pero leer, escribir y comprobar cada elemento manualmente es lento y propenso a errores. La extracción asistida por IA convierte este material en datos coherentes, buscables y listos para automatización.

Ejemplos de valor empresarial.
EntradaResultado posible
Recibo digitalizadoProveedor, fecha, artículos y total completan una solicitud de gastos.
Llamada de soporteTranscripción, resumen, sentimiento, contactos y acciones solicitadas.
Imagen o vídeo operativoPersonas, ubicación, eventos e intervalos para planear capacidad.
Flujo desde contenido no estructurado hasta datos accionables.
Documentos, imágenes, audio y vídeo pasan por un analizador y se convierten en salida estructurada.

2. Content Understanding in Foundry Tools

Content Understanding in Foundry Tools conserva ese nombre de producto en Microsoft Learn en español. Es una herramienta del recurso que combina y modelos especializados para comprender documentos, imágenes, audio y vídeo. Extrae contenido, entidades, campos, relaciones y significado en un formato definido por el usuario, normalmente .

El flujo es uniforme: ingerir el archivo; analizarlo con OCR, reconocimiento de voz, comprensión del lenguaje y modelos multimodales; aplicar un esquema; y devolver resultados legibles por máquina para almacenamiento, búsqueda, análisis o sistemas posteriores. La documentación actual también incluye segmentación, clasificación, puntuaciones de confianza y fundamentación en la fuente.

3. OCR, diseño y comprensión semántica

El Reconocimiento Óptico de Caracteres (OCR) identifica caracteres en fotografías y digitalizaciones y los convierte en texto editable y buscable. El análisis de diseño conserva párrafos, secciones, tablas, marcas de selección, fórmulas y jerarquías. Es esencial, pero por sí solo no explica el significado empresarial.

Content Understanding añade interpretación semántica y asignación mediante esquema. “Invoice No.”, “Invoice #” o incluso un número sin etiqueta pueden completar el mismo campo InvoiceNumber. El resultado representa conceptos, relaciones y tipos previsibles, no una cadena plana de palabras.

Comparación entre OCR y extracción orientada por esquema.
OCR recupera texto y diseño; la capa semántica asocia valores con campos de la aplicación.

4. Esquema de factura y campos anidados

Un esquema describe exactamente lo que necesita el proceso. Para una factura, los campos simples pueden incluir proveedor, número, fecha, cliente, dirección, subtotal, impuestos, envío y total. La colección Artículos contiene objetos anidados con descripción, precio unitario, cantidad y total de línea.

Factura de Adventure Works y esquema de campos extraídos.
El analizador transforma etiquetas y posiciones variables en una estructura estable, incluida la lista anidada de artículos.
Valores conservados del ejemplo.
CampoValor
Proveedor / factura / fechaAdventure Works Cycles / 1234 / 07/03/2025
ClienteJohn Smith — 123 River Street, Marshtown, England GL1 234
ArtículosBicicleta de carreras roja de 38″: 1 × 1.299,00; casco negro: 1 × 25,99; camiseta de ciclismo L: 2 × 42,50.
TotalesSubtotal 1.409,99; impuestos 140,99; envío 35,00; total 1.585,98.

5. Analizadores precompilados y personalizados

Un analizador es la unidad reutilizable que determina modalidad, extracción, esquema de campos, estructura de salida y modelos. Un analizador precompilado funciona sin configuración para un escenario conocido; uno personalizado aplica el esquema y las reglas de la organización.

  • prebuilt-invoice comprende campos comunes de facturas.
  • prebuilt-imageSearch describe imágenes para búsqueda y recuperación.
  • prebuilt-audioSearch transcribe audio, separa hablantes y genera información conversacional.
  • prebuilt-videoSearch combina fotogramas, audio, tiempo y resúmenes.
  • La documentación actual también enumera analizadores base: prebuilt-document, prebuilt-image, prebuilt-audio y prebuilt-video.
Ciclo de definición y uso de un analizador.
Elija o cree un analizador, defina el esquema, envíe contenido, espere el análisis y consuma .

6. Validar documentos en el portal de

Antes de programar, el portal permite seleccionar un analizador, usar archivos de muestra o cargar contenido propio y comprobar texto, diseño y campos. Los portales nuevo y clásico tienen interfaces diferentes, pero sirven para la misma validación.

Captura original del portal de Microsoft Foundry analizando un documento de identidad.
La vista de contenido muestra texto y estructura detectados.
Captura original de los campos de una factura en el portal de Microsoft Foundry.
La vista de campos asigna valores al esquema del analizador.
Captura original del JSON de una factura en el portal de Microsoft Foundry.
El mismo análisis puede inspeccionarse como para integrarlo.

7. Aplicación cliente de documentos con el de Python

Una aplicación cliente se autentica en el , envía contenido, sigue la operación y procesa el resultado. El paquete -ai-contentunderstanding ofrece ContentUnderstandingClient. El tiene la forma ://<recurso>.services.ai..com/ y la credencial puede usar AzureKeyCredential o .

python -m pip install azure-ai-contentunderstanding

import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential

client = ContentUnderstandingClient(
    endpoint=os.environ['FOUNDRY_ENDPOINT'],
    credential=AzureKeyCredential(os.environ['FOUNDRY_KEY'])
)
poller = client.begin_analyze(
    analyzer_id='prebuilt-invoice',
    inputs=[{'url': os.environ['INVOICE_URL']}]
)
result = poller.result()

for content in result.contents:
    print(getattr(content, 'markdown', None))
    print(getattr(content, 'fields', None))

La respuesta incluye status, analyzerId, apiVersion y contents. Los campos pueden registrar tipo, valor y confianza; markdown conserva contenido legible para revisión o RAG. Mantenga secretos fuera del código y revise valores de baja confianza.

8. Operación asincrónica y

El análisis puede tardar, por lo que la usa una operación asincrónica. La solicitud inicial devuelve una dirección Operation-Location; el cliente la consulta hasta que el estado sea Succeeded o Failed. El encapsula el ciclo en el poller de begin_analyze y la llamada result().

  1. Enviar un archivo o accesible al analizador.
  2. Guardar el identificador u Operation-Location.
  3. Consultar con intervalos controlados.
  4. Al terminar, leer contents, markdown, fields y confianza.
  5. Controlar errores, tiempo de espera y contenido incompatible.

9. Extracción estructurada de audio

Para audio, el servicio puede generar transcripción, diarización, resumen y campos definidos por esquema. Un esquema de buzón de voz puede solicitar persona que llama, resumen, acciones, teléfono de devolución y contacto alternativo.

Resultado del mensaje de voz de ejemplo.
CampoValor extraído
Persona que llamaAva de Contoso
ResumenAva dio seguimiento a la reunión anterior e informó que la empresa puede cumplir las expectativas de precio.
AcciónDevolver la llamada o enviar correo para comentar los siguientes pasos.
Contactos555-12345 y Ava@contoso.com
Captura original de una transcripción de audio en el portal de Microsoft Foundry.
El analizador precompilado evita escuchar toda la llamada para obtener la transcripción.
Captura original del JSON del análisis de audio.
Los campos e información de la llamada quedan disponibles para procesamiento automático.

10. Extracción estructurada de vídeo

El vídeo combina señales visuales, audio y tiempo. Para una reunión, un esquema inicial puede solicitar ubicación, asistentes presenciales, asistentes remotos y total. El fotograma de ejemplo representa una sala de conferencias con una persona presencial y tres remotas, cuatro en total.

Fotografía original de una reunión híbrida usada en el ejemplo de análisis de vídeo.
Un fotograma revela ubicación y asistencia; el vídeo completo agrega contexto temporal.

Un esquema más completo puede contar asistencia por intervalos, identificar quién habló y qué dijo, resumir el debate y enumerar acciones asignadas. La relación temporal entre fotogramas, voz y eventos diferencia el vídeo completo de una imagen aislada.

11. Cliente para analizadores de audio y vídeo

El mismo patrón del cliente de documentos funciona para medios. Use prebuilt-audioSearch o prebuilt-videoSearch, proporcione una accesible y espere al poller. Según el analizador y el esquema, contents puede contener transcripción/markdown, campos, segmentos y temporales.

analyzer_id = 'prebuilt-audioSearch'
inputs = [{'url': 'https://example.org/samples/voicemail.wav'}]

poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)
result = poller.result()

for content in result.contents:
    print('TRANSCRIPCIÓN:', getattr(content, 'markdown', None))
    print('CAMPOS:', getattr(content, 'fields', None))

12. Ejercicio y evaluación comentada

El ejercicio de unos 25 minutos usa Content Understanding en para analizar documentos. Requiere una suscripción de ; las cuentas nuevas pueden incluir créditos gratuitos durante 30 días. Compare el contenido original con los campos y el antes de automatizar.

Captura original del ejercicio de extracción de información en Microsoft Foundry.
El laboratorio guía la ejecución de un analizador y la inspección del resultado.
Respuestas explicadas.
PreguntaRespuesta y motivo
Ventaja sobre OCR básicoContent Understanding comprende la estructura y asigna los datos extraídos a un esquema definido.
Función principal del analizadorDefinir cómo se procesa el contenido y qué datos estructurados se devuelven.
Qué ocurre tras enviar con el La aplicación consulta la u operación hasta que termina el trabajo asincrónico.

13. Resumen y referencias oficiales

Content Understanding aplica un flujo único a documentos, imágenes, audio y vídeo: ingesta, extracción, razonamiento con IA, asignación al esquema y datos estructurados. Los analizadores precompilados aceleran escenarios comunes; los personalizados aportan coherencia del dominio; portal, y de Python cubren desde validación hasta automatización a escala.

  • Use OCR para texto y diseño; use esquema y semántica para significado empresarial.
  • Modele colecciones anidadas para grupos repetidos, como artículos de factura.
  • Pruebe en el portal y compruebe campos, y confianza antes de integrar.
  • Trate el análisis como asincrónico y proteja , claves, datos personales y grabaciones.