Visión artificial: píxeles, CNN, ViT y generación de imágenes
Volver a la ruta AI-901
AI-901Capítulo 5

Preparación para la Certificación Microsoft AI-901

Visión artificial: píxeles, CNN, ViT y generación de imágenes

Clasificación, detección, segmentación, filtros, convolución, redes neuronales, modelos multimodales y difusión

Tiempo de estudio sugerido: 38 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA generativa, visión, voz, nube y agentes

1. Introducción a la visión artificial

La visión artificial es un área esencial de la IA que permite procesar información visual. Los vehículos autónomos detectan tráfico y peatones, las cajas inteligentes identifican productos y los timbres con cámara detectan visitantes.

Los equipos no tienen ojos biológicos, pero procesan píxeles de fotografías, vídeos y transmisiones en directo. Con esos valores, el software imita parte de la percepción humana, extrae significado y actúa.

El módulo original ofrece aprendizaje con vídeo o con texto e imágenes. La versión escrita contiene detalles adicionales y puede complementar los vídeos.

2. Clasificación de imágenes

La clasificación de imágenes es una de las técnicas más antiguas. Un modelo entrenado con muchos ejemplos etiquetados analiza las características visuales de una imagen nueva y predice una etiqueta para su tema principal.

En una caja de supermercado, una cámara puede clasificar los productos de una balanza como manzana, naranja o plátano. El entrenamiento necesita muchas imágenes con el nombre correcto; después, la aplicación combina la clase con el peso para calcular el precio.

Comparación de clasificación, detección, segmentación y análisis contextual.
Las tareas avanzan de una etiqueta a ubicación, clase por píxel e interpretación semántica.

3. Detección de objetos y segmentación semántica

Cuando la caja debe localizar varios artículos, la detección de objetos examina distintas regiones. La predicción incluye cada clase y las coordenadas de un cuadro delimitador rectangular.

La segmentación semántica ofrece una ubicación más precisa al asignar una categoría a cada píxel. La máscara resultante sigue la forma del objeto en vez de limitarse a rodearlo.

Diferencias entre tres tareas.
TareaSalidaPregunta
ClasificaciónUna etiqueta, normalmente con probabilidad.¿Cuál es el tema principal?
DetecciónClases y coordenadas de cuadros delimitadores.¿Qué objetos hay y dónde?
Segmentación semánticaUna clase para cada píxel.¿Qué región exacta pertenece a cada categoría?

4. Análisis contextual de imágenes

Los modelos multimodales recientes aprenden relaciones entre objetos visibles y textos descriptivos. Pueden interpretar semánticamente una escena, reconocer objetos y acciones, crear leyendas y sugerir etiquetas.

Una foto puede recibir más que la etiqueta “manzana”: al relacionar persona, alimento y acción, el modelo genera “una persona comiendo una manzana”.

5. Imágenes como matrices de píxeles

Para un equipo, una imagen es una matriz numérica. En una imagen 7 × 7 en escala de grises, cada posición es un píxel: 0 es negro, 255 es blanco y los valores intermedios son tonos de gris. Filas y columnas determinan la resolución.

0   0   0   0   0   0   0
0   0   0   0   0   0   0
0   0 255 255 255  0   0
0   0 255 255 255  0   0
0   0 255 255 255  0   0
0   0   0   0   0   0   0
0   0   0   0   0   0   0

Esa matriz bidimensional x-y tiene un canal. Las imágenes en color suelen usar tres matrices o canales: rojo, verde y azul (RGB). El píxel final combina las tres intensidades.

En el ejemplo, el morado usa rojo 150, verde 0 y azul 255. El centro amarillo usa rojo 255, verde 255 y azul 0.

Matriz de 7 por 7 y tres canales RGB.
La resolución define filas y columnas; RGB combina intensidades de color.

6. Filtros y convolución

Los filtros modifican píxeles para crear efectos o revelar características. Se definen mediante pequeñas matrices de pesos llamadas kernels. Un kernel 3 × 3 cubre un parche, multiplica cada píxel por el peso correspondiente y suma los resultados para crear un valor nuevo.

Kernel de Laplace
-1  -1  -1
-1   8  -1
-1  -1  -1

En el primer parche, la suma ponderada es -255 porque la última posición contiene 255. Al desplazar el kernel un píxel a la derecha, participan dos valores 255 y el resultado es -510. Cada valor se añade a la matriz de salida.

(0 × -1) + (0 × -1) + (0 × -1) +
(0 × -1) + (0 × 8)  + (0 × -1) +
(0 × -1) + (0 × -1) + (255 × -1) = -255

Posición siguiente: ... + (255 × -1) + (255 × -1) = -510

La convolución continúa por toda la imagen. Los valores fuera de 0–255 se ajustan y, como el borde no admite un kernel completo, se aplica padding, normalmente cero. La nueva matriz representa la imagen transformada.

Kernel de Laplace que recorre parches y crea una matriz nueva.
El filtro resalta transiciones bruscas entre píxeles vecinos.

El filtro de Laplace resalta bordes. Otros kernels desenfocan, enfocan, invierten colores o producen distintos efectos. El desplazamiento del kernel origina el nombre filtrado convolucional.

7. Redes neuronales convolucionales

Los editores usan filtros para cambiar la apariencia; la visión artificial busca significado. Una red neuronal convolucional (CNN) aprende filtros que generan mapas numéricos de características y alimenta una red profunda para predecir etiquetas.

En un clasificador de frutas, los pesos comienzan aleatorios. El entrenamiento compara predicciones con etiquetas conocidas y ajusta kernels y red hasta separar manzanas, plátanos y naranjas.

  1. Proporcionar imágenes etiquetadas: 0 para manzana, 1 para plátano y 2 para naranja.
  2. Usar capas convolucionales para crear mapas; puede reducirlos y enfatizar patrones.
  3. Aplanar los mapas en un vector unidimensional.
  4. Enviar el vector a una red neuronal totalmente conectada.
  5. Aplicar softmax para obtener una probabilidad por clase, como [0,2; 0,5; 0,3].
Pipeline simplificado de una CNN para clasificación.
Los filtros aprendidos extraen características y la red conectada las convierte en probabilidades.

Para un plátano, el objetivo ideal es [0,0; 1,0; 0,0]. La diferencia genera la pérdida y los pesos cambian para reducirla. Varias épocas producen parámetros útiles, que se guardan para predecir imágenes sin etiqueta.

Las CNN reales contienen varias capas de convolución, , restricción y transformación. La vista simplificada destaca la idea: filtros producen recursos numéricos y la red predice una clase.

8. Transformers y modelos semánticos del lenguaje

Las CNN impulsaron la visión durante años y siguen apoyando tareas como detección, que combina características con regiones de interés. En NLP, los transformers introdujeron otra arquitectura eficaz.

Procesan grandes colecciones, codifican como embeddings y usan atención para reflejar cada relación contextual. Las dimensiones contienen atributos lingüísticos y los términos usados en contextos semejantes tienden a tener vectores alineados.

Este vocabulario semántico sirve para análisis, traducción y generación. Los encoders reales usan muchas dimensiones y álgebra lineal compleja; la idea clave es que la codificación conserva relaciones entre entidades.

9. Transformers y parches

Un Transformer (ViT) aplica el patrón transformer a imágenes. En lugar de de texto, extrae parches, linealiza sus píxeles y crea un embedding para cada región.

La atención mide relaciones entre parches. Los vectores codifican color, forma, contraste, textura y otras propiedades y forman un mapa multidimensional aprendido de las imágenes de entrenamiento.

Características vistas en contextos parecidos adoptan direcciones próximas. Sombreros y cabezas suelen aparecer juntos. El modelo no comprende ambos objetos como una persona, pero infiere la relación entre sus patrones.

Imagen dividida en parches y convertida en embeddings con autoatención.
El ViT construye relaciones contextuales entre regiones.

10. Modelos multimodales

Un transformer de lenguaje crea vocabulario lingüístico y uno de visión, vocabulario visual. Entrenar imágenes junto a descripciones permite combinar sus encoders en un modelo multimodal.

La atención entre modalidades alinea embeddings en un espacio compartido. Ante una imagen nueva, el modelo reconoce patrones, busca lenguaje relacionado y genera una descripción como “una persona en un parque con sombrero y mochila”.

Codificadores de lenguaje y visión unidos mediante atención entre modalidades.
El espacio compartido vincula texto y características visuales para leyendas, etiquetas y respuestas.

11. Generación de imágenes y vídeos

La arquitectura multimodal que responde sobre una imagen también puede sintetizarla desde un prompt. Las asociaciones aprendidas entre palabras y características guían la composición.

Muchos modelos usan difusión: comienzan con píxeles aleatorios y eliminan ruido iterativamente. Tras cada paso comparan la imagen parcial con el prompt hasta formar una escena coherente. “Un perro con un palo en la boca” evoluciona de ruido a formas vagas y luego al resultado.

Flujo de generación por difusión a partir de un prompt.
La eliminación iterativa de ruido acerca la imagen a las características solicitadas.

El vídeo aplica el mismo principio, pero también modela física y tiempo: un perro debe apoyar las patas y los fotogramas deben formar una secuencia lógica.

12. Ejercicio y evaluación

El ejercicio usa un modelo de visión en Chat Playground para identificar y describir el contenido de imágenes.

Captura original de Chat Playground describiendo hardware.
Se conserva la captura real en PNG; los diagramas conceptuales se recrearon en SVG.

Preguntas reformuladas

  1. ¿La visión artificial manipula principalmente marcas de tiempo, píxeles o nombres de archivo?
  2. ¿En una CNN los filtros embellecen, extraen recursos numéricos o comprimen?
  3. ¿Un ViT es un filtro, un agente que convierte LLM o un modelo que atiende parches y crea embeddings contextuales?

Respuestas

  • Los píxeles son los valores numéricos analizados y manipulados.
  • Los filtros de CNN extraen características numéricas para la red.
  • ViT aplica atención a parches y crea embeddings contextuales.

13. Resumen del capítulo

  • Las imágenes son matrices de píxeles y el color combina canales RGB.
  • Clasificación, detección, segmentación, leyendas y contexto responden preguntas diferentes.
  • Los kernels transforman píxeles y revelan características como bordes.
  • Las CNN aprenden filtros y pesos con imágenes etiquetadas.
  • Los Transformers codifican parches y usan atención.
  • Los modelos multimodales unen vocabularios lingüístico y visual.
  • La difusión interpreta prompts y genera imágenes o vídeos progresivamente.