Extracción de información: OCR, campos y mapeo
Volver a la ruta AI-901
AI-901Capítulo 6

Preparación para la Certificación Microsoft AI-901

Extracción de información: OCR, campos y mapeo

Documentos, reconocimiento óptico de caracteres, interpretación semántica, normalización, validación e integración

Tiempo de estudio sugerido: 42 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA generativa, visión, voz, nube y agentes

1. Extracción de información y escenarios

Las soluciones de extracción de información con IA convierten contenido no estructurado en campos organizados. Este capítulo se centra en documentos e imágenes, aunque el reconocimiento de voz y las técnicas multimodales también recuperan datos de audio y vídeo.

Los casos van desde leer nombre, cargo, correo y teléfono de una tarjeta de visita hasta automatizaciones financieras, jurídicas, sanitarias y logísticas. La salida estructurada puede alimentar bases de datos, y flujos de trabajo.

Escenarios financieros, jurídicos, sanitarios y logísticos que convergen en datos estructurados.
La misma disciplina de extracción atiende medios y procesos empresariales muy distintos.
Información común en cuatro familias documentales.
DominioDocumentoCampos posibles
FinanzasFacturaProveedor, dirección, contacto, número, fechas, condiciones de pago, partidas, cantidades, precios, totales, impuestos y exenciones.
FinanzasRecibo y extractoComercio, ubicación, ID de transacción, compras, descuentos, pago, cambio, puntos; cuentas, saldos, historial, ingresos, gastos, márgenes, cumplimiento y auditoría.
Legal y cumplimientoContrato y formularioPartes, firmantes, testigos, vigencia, renovación, rescisión, pagos, sanciones, seguros; W-2, 1099, pólizas, reclamaciones, solicitudes y certificaciones.
SaludHistoria clínicaDatos demográficos, número de historia, seguro, diagnósticos, tratamientos, medicamentos, constantes, citas, códigos de facturación y profesionales.
LogísticaEnvío y orden de compraSeguimiento, peso, dimensiones, remitente, destinatario, instrucciones, código, valor, origen, proveedor, artículos, cantidades, calendario y entrega.

2. Cómo combina la extracción las técnicas de IA

Una solución completa suele ejecutar dos grandes tareas. La visión artificial y el reconocimiento óptico de caracteres (OCR) localizan texto visual y lo convierten en datos legibles por máquina. Después, aprendizaje automático o interpreta el significado y asigna cada valor a un campo definido.

Para un reembolso, el sistema puede leer un recibo y devolver proveedor, fecha, subtotal, impuesto y total. Esa estructura reduce la escritura manual, acelera la revisión e inicia aprobaciones automatizadas.

Documento que pasa por OCR, interpretación semántica y esquema estructurado.
OCR indica qué está escrito; la extracción determina el significado y destino de cada valor.
Ejemplo de recibo convertido en campos.
CampoValor
ProveedorFourth Coffee
Fecha15/08/2024
Subtotal6,48 USD
Impuesto0,49 USD
Total reclamado6,97 USD

3. Elección del enfoque

Los documentos determinan la arquitectura. Formularios estables favorecen plantillas; múltiples formatos y diseños exigen modelos flexibles. Un gran volumen se beneficia de automatización y hardware optimizado; usos críticos pueden requerir validación humana.

  • Seguridad y privacidad: proteger documentos confidenciales, controlar accesos y cumplir normas sectoriales.
  • Proceso: deep learning e pueden necesitar muchos recursos.
  • Latencia: el tiempo real puede limitar la complejidad del modelo.
  • Escala: la nube se adapta a cargas variables.
  • Integración: se deben prever compatibilidad de y formatos de datos.

Los servicios administrados reducen el trabajo y aportan escala, precisión e integración probadas. Entre ellos están y Content Understanding in Foundry Tools.

4. Entrada y preprocesamiento de OCR

OCR transforma texto visible en contenido editable y localizable. Puede recibir facturas y recibos digitalizados, fotografías, PDF de imágenes, capturas de pantalla, formularios, notas manuscritas, fotogramas de vídeo y páginas renderizadas.

La calidad de entrada afecta al resultado. El preprocesamiento elimina ruido mediante filtros gaussianos y de mediana, operaciones morfológicas, autoencoders o CNN; mejora el contraste con ecualización de histograma, umbral adaptativo, corrección gamma o modelos aprendidos.

La inclinación se corrige con transformada de Hough, perfiles de proyección, componentes conectados o CNN de regresión. Interpolación bicúbica, bilineal y Lanczos ajusta la resolución; GAN y redes residuales pueden aplicar superresolución.

Cinco etapas de la canalización OCR.
Entrada, mejora, detección, reconocimiento y posprocesamiento convierten una imagen en texto útil.

5. Detección de regiones y orden de lectura

El análisis de diseño separa texto, imágenes, gráficos y espacios. Los métodos clásicos usan componentes conectados, codificación run-length y segmentación por proyección. U-Net, Mask R-CNN, modelos entrenados con PubLayNet y arquitecturas como LayoutLM añaden comprensión visual.

Los caracteres se agrupan en palabras, líneas y párrafos por distancia, espacios y morfología, o mediante redes de grafos y transformers. El orden se obtiene con geometría de cuadros delimitadores o modelos secuenciales y de grafos.

Encabezados, cuerpo, leyendas y tablas también se clasifican. SVM usa fuente, posición y formato; CNN y Transformers aprenden de documentos etiquetados.

6. Reconocimiento de caracteres y contexto

El núcleo de OCR analiza forma, tamaño, bucles, extremos e intersecciones. Los métodos tradicionales usan momentos, descriptores de Fourier y rasgos estructurales; CNN aprende características directamente de los píxeles.

La clasificación puede comparar plantillas, aplicar HMM, SVM o k vecinos, o usar perceptrones multicapa, LeNet, ResNet, DenseNet y EfficientNet para distintas fuentes, tamaños y escrituras.

El contexto resuelve ambigüedades con n-gramas, diccionarios y distancia de Levenshtein, LSTM, transformers similares a BERT y atención. Modelos bayesianos, softmax y ensembles estiman la confianza.

7. Salida y posprocesamiento de OCR

Reglas de proximidad y confianza, RNN/LSTM o transformers unen caracteres en palabras y oraciones. Geometría, redes de grafos, modelos de IA documental y transformers multimodales como LayoutLM preservan párrafos, saltos, espacios y estructura.

La salida guarda coordenadas mediante transformaciones entre píxeles y documento; R-trees y quad-trees aceleran consultas, y regresión predice posiciones. Diccionarios, vocabularios, n-gramas, analizadores probabilísticos, modelos tipo GPT/BERT y ensembles verifican ortografía, gramática y errores.

8. Canalización de extracción de campos

OCR revela qué texto existe. La extracción explica qué significa y dónde se guarda. La entrada contiene texto, cuadros delimitadores, páginas, orden, confianza, líneas, párrafos y de diseño.

La posición es decisiva: “12345” puede ser número de factura, ID de cliente o teléfono según la etiqueta y la zona. Luego se detectan candidatos, se asocian al esquema, se normalizan y se integran.

Cinco etapas de extracción e integración de campos.
La salida OCR se interpreta, estandariza y entrega al proceso empresarial.

9. Plantillas, aprendizaje automático e

Las plantillas usan posiciones, palabras ancla, pares como “Número de factura:”, expresiones regulares y coincidencia de cadenas. Son rápidas, explicables y precisas en diseños estables, pero requieren mantenimiento manual y sufren con variaciones.

Los modelos aprenden relaciones de documentos de ejemplo mediante aprendizaje supervisado, autosupervisado o multimodal. Redes neuronales de grafos representan relaciones espaciales, la atención enfoca regiones y los modelos secuencia a secuencia convierten texto libre en asignaciones.

Los LLM permiten extracción guiada por esquema: el prompt incluye texto y campos. Few-shot learning adapta campos con pocos ejemplos, y el razonamiento paso a paso guía la identificación.

10. Asociación, tablas, confianza y validación

Los valores se emparejan con claves por agrupación espacial, orden, alineación, sangría y posición. El reconocimiento de entidades detecta fechas, importes y nombres; etiquetado gramatical y análisis de dependencias relacionan etiquetas y valores.

CNN especializadas, detección de objetos o grafos localizan tablas. Asociación fila-columna, detección de encabezados y procesamiento jerárquico recuperan partidas, subtotales y estructuras anidadas.

La confianza combina certeza de OCR, coincidencia con patrones y coherencia contextual. La validación cruzada comprueba, por ejemplo, que la suma de partidas coincida con el total.

Etiquetas y valores asociados, validados y convertidos a JSON.
Geometría, lenguaje, reglas cruzadas y confianza producen datos fiables.

11. Normalización e integración empresarial

Las fechas MM/DD/ y DD-MM- se detectan, desambiguan y convierten a ISO. Monedas requieren símbolos y separadores correctos; las medidas pueden necesitar conversión. El texto se normaliza en mayúsculas, codificación y abreviaturas.

La calidad valida patrones de teléfono y correo, rangos y campos obligatorios. Detección de valores atípicos, distribución, comparación histórica y validación entre documentos exponen resultados improbables.

La integración asigna campos a columnas de bases de datos, o colas. Renombrado, conversión de tipos y reglas condicionales adaptan el esquema. Los informes registran confianza por campo, calidad documental y categorías y causas de error.

12. Ejercicio y evaluación

El ejercicio combina OCR y un modelo de lenguaje grande para extraer e interpretar campos de recibos. La siguiente imagen es la captura original y se conserva porque representa una pantalla real.

Captura original de Information Extractor con recibo y campos extraídos.
La captura se conserva en PNG; solo se redibujaron los diagramas conceptuales.

Preguntas reformuladas

  1. ¿La extracción consulta SQL, copia archivos o analiza contenido no estructurado para obtener campos y valores?
  2. ¿OCR recupera contenido en línea, convierte texto visual en texto legible por máquina o transforma en imágenes?
  3. ¿La crea documentos, exige reglas manuales por diseño o relaciona semánticamente valores y campos?

Respuestas

  • Analiza contenido no estructurado e identifica campos y valores relevantes.
  • OCR convierte imágenes de texto en datos textuales legibles por máquina.
  • Los modelos semánticos asocian los valores extraídos con el esquema de campos.

13. Resumen del capítulo

  • La extracción con IA convierte documentos, imágenes y otros medios no estructurados en datos organizados.
  • OCR combina adquisición, mejora, detección, reconocimiento y posprocesamiento.
  • La extracción de campos añade significado, asociación al esquema, normalización y validación.
  • Plantillas, aprendizaje automático e sirven a distintos niveles de variedad, escala y explicación.
  • El diseño debe considerar seguridad, precisión, latencia, escala, integración y revisión humana.
  • y Content Understanding in Foundry Tools aceleran la solución.