Preparación para la Certificación Microsoft AI-901
Extracción de información: OCR, campos y mapeo
Documentos, reconocimiento óptico de caracteres, interpretación semántica, normalización, validación e integración
Tiempo de estudio sugerido: 42 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. Extracción de información y escenarios
Las soluciones de extracción de información con IA convierten contenido no estructurado en campos organizados. Este capítulo se centra en documentos e imágenes, aunque el reconocimiento de voz y las técnicas multimodales también recuperan datos de audio y vídeo.
Los casos van desde leer nombre, cargo, correo y teléfono de una tarjeta de visita hasta automatizaciones financieras, jurídicas, sanitarias y logísticas. La salida estructurada puede alimentar bases de datos, y flujos de trabajo.
La misma disciplina de extracción atiende medios y procesos empresariales muy distintos.
Información común en cuatro familias documentales.
Dominio
Documento
Campos posibles
Finanzas
Factura
Proveedor, dirección, contacto, número, fechas, condiciones de pago, partidas, cantidades, precios, totales, impuestos y exenciones.
Finanzas
Recibo y extracto
Comercio, ubicación, ID de transacción, compras, descuentos, pago, cambio, puntos; cuentas, saldos, historial, ingresos, gastos, márgenes, cumplimiento y auditoría.
Datos demográficos, número de historia, seguro, diagnósticos, tratamientos, medicamentos, constantes, citas, códigos de facturación y profesionales.
Logística
Envío y orden de compra
Seguimiento, peso, dimensiones, remitente, destinatario, instrucciones, código, valor, origen, proveedor, artículos, cantidades, calendario y entrega.
2. Cómo combina la extracción las técnicas de IA
Una solución completa suele ejecutar dos grandes tareas. La visión artificial y el reconocimiento óptico de caracteres (OCR) localizan texto visual y lo convierten en datos legibles por máquina. Después, aprendizaje automático o interpreta el significado y asigna cada valor a un campo definido.
Para un reembolso, el sistema puede leer un recibo y devolver proveedor, fecha, subtotal, impuesto y total. Esa estructura reduce la escritura manual, acelera la revisión e inicia aprobaciones automatizadas.
OCR indica qué está escrito; la extracción determina el significado y destino de cada valor.
Ejemplo de recibo convertido en campos.
Campo
Valor
Proveedor
Fourth Coffee
Fecha
15/08/2024
Subtotal
6,48 USD
Impuesto
0,49 USD
Total reclamado
6,97 USD
3. Elección del enfoque
Los documentos determinan la arquitectura. Formularios estables favorecen plantillas; múltiples formatos y diseños exigen modelos flexibles. Un gran volumen se beneficia de automatización y hardware optimizado; usos críticos pueden requerir validación humana.
Seguridad y privacidad: proteger documentos confidenciales, controlar accesos y cumplir normas sectoriales.
Proceso: deep learning e pueden necesitar muchos recursos.
Latencia: el tiempo real puede limitar la complejidad del modelo.
Escala: la nube se adapta a cargas variables.
Integración: se deben prever compatibilidad de y formatos de datos.
Los servicios administrados reducen el trabajo y aportan escala, precisión e integración probadas. Entre ellos están y Content Understanding in Foundry Tools.
4. Entrada y preprocesamiento de OCR
OCR transforma texto visible en contenido editable y localizable. Puede recibir facturas y recibos digitalizados, fotografías, PDF de imágenes, capturas de pantalla, formularios, notas manuscritas, fotogramas de vídeo y páginas renderizadas.
La calidad de entrada afecta al resultado. El preprocesamiento elimina ruido mediante filtros gaussianos y de mediana, operaciones morfológicas, autoencoders o CNN; mejora el contraste con ecualización de histograma, umbral adaptativo, corrección gamma o modelos aprendidos.
La inclinación se corrige con transformada de Hough, perfiles de proyección, componentes conectados o CNN de regresión. Interpolación bicúbica, bilineal y Lanczos ajusta la resolución; GAN y redes residuales pueden aplicar superresolución.
Entrada, mejora, detección, reconocimiento y posprocesamiento convierten una imagen en texto útil.
5. Detección de regiones y orden de lectura
El análisis de diseño separa texto, imágenes, gráficos y espacios. Los métodos clásicos usan componentes conectados, codificación run-length y segmentación por proyección. U-Net, Mask R-CNN, modelos entrenados con PubLayNet y arquitecturas como LayoutLM añaden comprensión visual.
Los caracteres se agrupan en palabras, líneas y párrafos por distancia, espacios y morfología, o mediante redes de grafos y transformers. El orden se obtiene con geometría de cuadros delimitadores o modelos secuenciales y de grafos.
Encabezados, cuerpo, leyendas y tablas también se clasifican. SVM usa fuente, posición y formato; CNN y Transformers aprenden de documentos etiquetados.
6. Reconocimiento de caracteres y contexto
El núcleo de OCR analiza forma, tamaño, bucles, extremos e intersecciones. Los métodos tradicionales usan momentos, descriptores de Fourier y rasgos estructurales; CNN aprende características directamente de los píxeles.
La clasificación puede comparar plantillas, aplicar HMM, SVM o k vecinos, o usar perceptrones multicapa, LeNet, ResNet, DenseNet y EfficientNet para distintas fuentes, tamaños y escrituras.
El contexto resuelve ambigüedades con n-gramas, diccionarios y distancia de Levenshtein, LSTM, transformers similares a BERT y atención. Modelos bayesianos, softmax y ensembles estiman la confianza.
7. Salida y posprocesamiento de OCR
Reglas de proximidad y confianza, RNN/LSTM o transformers unen caracteres en palabras y oraciones. Geometría, redes de grafos, modelos de IA documental y transformers multimodales como LayoutLM preservan párrafos, saltos, espacios y estructura.
La salida guarda coordenadas mediante transformaciones entre píxeles y documento; R-trees y quad-trees aceleran consultas, y regresión predice posiciones. Diccionarios, vocabularios, n-gramas, analizadores probabilísticos, modelos tipo GPT/BERT y ensembles verifican ortografía, gramática y errores.
8. Canalización de extracción de campos
OCR revela qué texto existe. La extracción explica qué significa y dónde se guarda. La entrada contiene texto, cuadros delimitadores, páginas, orden, confianza, líneas, párrafos y de diseño.
La posición es decisiva: “12345” puede ser número de factura, ID de cliente o teléfono según la etiqueta y la zona. Luego se detectan candidatos, se asocian al esquema, se normalizan y se integran.
La salida OCR se interpreta, estandariza y entrega al proceso empresarial.
9. Plantillas, aprendizaje automático e
Las plantillas usan posiciones, palabras ancla, pares como “Número de factura:”, expresiones regulares y coincidencia de cadenas. Son rápidas, explicables y precisas en diseños estables, pero requieren mantenimiento manual y sufren con variaciones.
Los modelos aprenden relaciones de documentos de ejemplo mediante aprendizaje supervisado, autosupervisado o multimodal. Redes neuronales de grafos representan relaciones espaciales, la atención enfoca regiones y los modelos secuencia a secuencia convierten texto libre en asignaciones.
Los LLM permiten extracción guiada por esquema: el prompt incluye texto y campos. Few-shot learning adapta campos con pocos ejemplos, y el razonamiento paso a paso guía la identificación.
10. Asociación, tablas, confianza y validación
Los valores se emparejan con claves por agrupación espacial, orden, alineación, sangría y posición. El reconocimiento de entidades detecta fechas, importes y nombres; etiquetado gramatical y análisis de dependencias relacionan etiquetas y valores.
CNN especializadas, detección de objetos o grafos localizan tablas. Asociación fila-columna, detección de encabezados y procesamiento jerárquico recuperan partidas, subtotales y estructuras anidadas.
La confianza combina certeza de OCR, coincidencia con patrones y coherencia contextual. La validación cruzada comprueba, por ejemplo, que la suma de partidas coincida con el total.
Geometría, lenguaje, reglas cruzadas y confianza producen datos fiables.
11. Normalización e integración empresarial
Las fechas MM/DD/ y DD-MM- se detectan, desambiguan y convierten a ISO. Monedas requieren símbolos y separadores correctos; las medidas pueden necesitar conversión. El texto se normaliza en mayúsculas, codificación y abreviaturas.
La calidad valida patrones de teléfono y correo, rangos y campos obligatorios. Detección de valores atípicos, distribución, comparación histórica y validación entre documentos exponen resultados improbables.
La integración asigna campos a columnas de bases de datos, o colas. Renombrado, conversión de tipos y reglas condicionales adaptan el esquema. Los informes registran confianza por campo, calidad documental y categorías y causas de error.
12. Ejercicio y evaluación
El ejercicio combina OCR y un modelo de lenguaje grande para extraer e interpretar campos de recibos. La siguiente imagen es la captura original y se conserva porque representa una pantalla real.
La captura se conserva en PNG; solo se redibujaron los diagramas conceptuales.