Visión multimodal y generación de imágenes y vídeo en Microsoft Foundry
Volver a la ruta AI-901
AI-901Capítulo 11

Preparación para la Certificación Microsoft AI-901

Visión multimodal y generación de imágenes y vídeo en Microsoft Foundry

Modelos con visión, Responses API, GPT-Image, Sora, Áreas de juegos e integración asincrónica de vídeo

Tiempo de estudio sugerido: 52 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 rodeado de símbolos de visión, imágenes, vídeo y agentes de IA

1. artificial: interpretar y crear contenido visual

La visión artificial permite que los sistemas de IA interpreten imágenes, vídeos y transmisiones de cámara. Sus modelos automatizan tareas al localizar objetos, reconocer patrones, leer texto y comprender escenas. Los modelos generativos amplían la capacidad para crear imágenes y vídeos originales además de analizarlos.

Aplicaciones representativas de visión artificial.
EscenarioCómo ayuda la visión
FabricaciónLa detección y segmentación encuentran defectos, piezas ausentes y desalineaciones en tiempo real.
SaludEl análisis de radiografías, resonancias y tomografías resalta anomalías y apoya el diagnóstico.
Comercio minoristaLas cámaras detectan estantes vacíos o productos mal ubicados y actualizan el inventario.
Vehículos autónomosSeñales, carriles, peatones y vehículos orientan la navegación y las decisiones.
Mapa de análisis y generación de contenido en visión artificial.
La IA visual conecta imágenes, vídeo y cámaras con análisis, decisiones y contenido nuevo.

2. Modelos multimodales y razonamiento visual

Un modelo multimodal trabaja con más de un tipo de dato, como texto, imagen, audio o vídeo. Al recibir una imagen y una instrucción textual en el mismo contexto puede describir escenas, responder preguntas, interpretar gráficos, leer documentos y explicar capturas. Esta combinación suele llamarse GPT habilitado para visión o GPT con visión.

Las aplicaciones usan la comprensión visual para mejorar flujos; los agentes usan imágenes como evidencia para decidir. Ejemplos: revisar documentos cargados, analizar fotos de soporte y explicar diagramas. Una experiencia multimodal reduce la necesidad de canalizaciones separadas para visión y lenguaje.

Modelo multimodal que combina instrucción textual, imagen y razonamiento.
Texto e imagen entran juntos; el modelo relaciona las modalidades y produce una respuesta contextual.

3. Modelos multimodales en

El catálogo de ofrece modelos propios y de asociados que aceptan imágenes. GPT-4.1, GPT-4.1-mini y GPT-4.1-nano sirven para descripciones, preguntas visuales, documentos, capturas, gráficos y diagramas. La familia GPT-5 agrega razonamiento de contexto amplio, salidas estructuradas y herramientas para agentes y aplicaciones empresariales complejas.

También puede haber modelos multimodales de proveedores como Anthropic. Como el catálogo, las versiones y la disponibilidad regional cambian, confirme que la implementación acepta entrada visual y use el nombre asignado a la implementación.

  • Describir objetos, texto y relaciones de una imagen.
  • Responder preguntas sobre fotos, documentos, interfaces y escenas.
  • Extraer significado de gráficos y combinar evidencia visual con instrucciones.
  • Producir respuestas naturales o estructuradas y, si es compatible, usar herramientas.

4. Análisis de imágenes en el Área de juegos

El Área de juegos de modelos del nuevo permite conversar con una implementación habilitada para visión. Adjunte imágenes, escriba una pregunta y revise la interpretación antes de desarrollar. El portal clásico presenta otra interfaz, pero cumple la misma función de validación.

Captura original de la carga de imágenes en el Área de juegos de Microsoft Foundry.
El usuario adjunta archivos visuales y añade la instrucción textual en el mismo chat.
Captura original del resultado de análisis visual en el Área de juegos.
La implementación describe la imagen y responde en el contexto de la conversación.

5. con texto e imágenes

Para pasar de la prueba al código, OpenAI en Foundry acepta entradas multimodales nativas. Una solicitud incluye una instrucción y una o más imágenes como o datos . El modelo procesa todo en conjunto y devuelve texto, lo que permite cargar imágenes y formular preguntas en tiempo real.

convierte bytes binarios en texto apto para o una de datos. Para imágenes grandes, considere transporte, costo y límites de contexto. Guarde las claves en variables de entorno o use cuando sea compatible.

Flujo de Responses API para análisis multimodal.
La aplicación combina texto e imagen, se autentica en el y recibe una respuesta contextual.

6. Cliente Python para análisis visual

Instale openai, obtenga y credencial, e indique el nombre de la implementación. El cliente apunta al compatible con OpenAI; .create recibe un mensaje con input_text e input_image.

pip install openai

import os
from openai import OpenAI

client = OpenAI(api_key=os.environ['FOUNDRY_KEY'], base_url=os.environ['FOUNDRY_ENDPOINT'])
response = client.responses.create(
    model=os.environ['MODEL_NAME'],
    input=[{'role': 'user', 'content': [
        {'type': 'input_text', 'text': 'Describe la imagen en tres puntos.'},
        {'type': 'input_image', 'image_url': os.environ['IMAGE_URL']}
    ]}]
)
print(response.output_text)
Captura original de una fotografía abierta en Visual Studio Code.
El ejemplo utiliza una fotografía de jirafas como entrada visual.
Captura original del cliente Python para analizar imágenes.
El código carga la imagen, recibe la pregunta y envía texto e imagen juntos.
Captura original del resultado de análisis en el terminal.
La respuesta se basa en el prompt y la imagen de la solicitud.

7. Modelos de generación de imágenes

Los modelos de análisis relacionan información visual con texto; los de generación crean píxeles desde una descripción. En Foundry, GPT-Image admite texto a imagen, variaciones y edición. GPT-Image-1.5 prioriza fidelidad, alineación y flujos empresariales; GPT-Image-1 es una opción general integrada; GPT-Image-1-mini reduce costo y latencia para experimentos y volumen.

El catálogo también puede ofrecer modelos de terceros como FLUX de Black Forest Labs, orientado al fotorrealismo y la flexibilidad de estilo. Elija según calidad, edición, latencia, costo, disponibilidad y requisitos de uso responsable.

Flujo de generación y edición de imágenes en Foundry.
El prompt, una imagen opcional y los parámetros guían al modelo, que devuelve datos de imagen para revisar y guardar.

8. Área de juegos y de generación de imágenes

Después de implementar el modelo, describa la imagen en el Área de juegos y espere el resultado. Mediante , una aplicación crea imágenes o edita existentes. El parámetro model recibe el nombre de la implementación; la autenticación puede usar clave o .

Captura original del Área de juegos generando una imagen.
La interfaz permite refinar el prompt antes de automatizar.
Captura original del código Python para generación de imágenes.
La muestra conecta al y demuestra la generación programática.
import base64
import os
from openai import OpenAI

client = OpenAI(api_key=os.environ['FOUNDRY_KEY'], base_url=os.environ['FOUNDRY_ENDPOINT'])
response = client.responses.create(
    model=os.environ['IMAGE_DEPLOYMENT'],
    input='Ilustración vectorial de un robot con una planta, colores pastel.',
    tools=[{'type': 'image_generation'}]
)
encoded = next(item.result for item in response.output if item.type == 'image_generation_call')
with open('imagen-generada.png', 'wb') as output:
    output.write(base64.b64decode(encoded))

9. Generación de vídeo con Sora

Los modelos de vídeo convierten instrucciones y referencias visuales en clips originales. Sora 1 fue el primer modelo de texto a vídeo de OpenAI disponible en Foundry; crea clips cortos, acepta una imagen guía y admite varias resoluciones y duraciones. Es útil para storyboards, animaciones y prototipos.

Sora 2, presentado en , amplía el flujo a texto a vídeo, imagen a vídeo y remix. Añade audio, mayor realismo y ediciones dirigidas. Se aplica a marketing, avances conceptuales y medios educativos. Los modelos incluyen protecciones de IA responsable y restricciones sobre personas reales, personajes protegidos y contenido sensible.

Captura original de modelos de vídeo en el catálogo de Foundry.
El catálogo muestra las implementaciones disponibles para el recurso y la región.

10. Área de juegos de vídeo e interfaz

En el Área de juegos de vídeo, elija una implementación, describa la escena y configure dimensiones y duración. La generación tarda varios minutos y la interfaz ofrece ejemplos de código. Sora es la familia nativa de salida de vídeo de este módulo; otros modelos multimodales pueden comprender medios sin generar vídeo.

Captura original del Área de juegos de vídeo con un prompt.
El prompt describe la escena y los controles configuran el clip.
Captura original del ejemplo REST de generación de vídeo.
El código del Área de juegos sirve como inicio para la automatización.

es una interfaz entre programas; un es una capa más amigable sobre esas operaciones. Si no existe para un lenguaje, curl puede enviar solicitudes, datos y encabezados directamente.

11. Trabajo asincrónico: crear, consultar y descargar

Renderizar vídeo consume muchos recursos y no debe bloquear una solicitud síncrona. El cliente crea un trabajo, guarda el identificador, consulta hasta completed o failed y descarga el MP4 solo después de finalizar. El material estima entre uno y cinco minutos según duración, resolución y capacidad.

  • Requisitos: recurso Foundry/ OpenAI en una región compatible e implementación Sora.
  • Autenticación: clave de o .
  • separados crean el trabajo, informan su estado y entregan el contenido.
Ciclo asincrónico de generación de vídeo.
El cliente crea un trabajo, consulta con esperas controladas y descarga el MP4 al terminar.
curl -X POST "$FOUNDRY_ENDPOINT/videos"   -H "Content-Type: application/json" -H "api-key: $AZURE_OPENAI_API_KEY"   -d '{"model":"sora-2","prompt":"Lluvia en una ventana de neón","size":"1280x720","seconds":"8"}'

curl -X GET "$FOUNDRY_ENDPOINT/videos/{video_id}" -H "api-key: $AZURE_OPENAI_API_KEY"
curl -L "$FOUNDRY_ENDPOINT/videos/{video_id}/content?variant=video"   -H "api-key: $AZURE_OPENAI_API_KEY" --output resultado.mp4

12. Ejercicio y comprobación de conocimientos

El ejercicio de unos 30 minutos usa modelos generativos en con datos visuales. Requiere una suscripción de ; las cuentas nuevas pueden incluir créditos gratuitos durante 30 días. El laboratorio recorre análisis de imágenes y generación visual.

Captura original del ejercicio de visión artificial en Microsoft Foundry.
El laboratorio combina un agente, una imagen cargada y preguntas sobre su contenido.
Respuestas comentadas de la evaluación.
PreguntaRespuesta y motivo
¿Qué define un modelo multimodal?Comprende y combina más de un tipo de dato, como texto e imagen.
¿Cómo se generan imágenes mediante código?Se envía el prompt a OpenAI con una implementación de generación de imágenes.
¿Qué valor se usa en model?El nombre asignado a la implementación en el recurso de Foundry.
¿Por qué el vídeo es asincrónico?La renderización consume recursos y tarda en finalizar.

13. Resumen y referencias oficiales

Los modelos multimodales conectan visión y lenguaje para analizar documentos, fotos, interfaces y gráficos. GPT-Image crea y edita imágenes; Sora crea y transforma vídeo mediante un flujo asincrónico. Las Áreas de juegos, , las de imagen y llevan estas capacidades a asistentes visuales, accesibilidad, agentes y aplicaciones creativas.

  • Use texto e imagen juntos cuando la respuesta dependa del contexto visual.
  • Envíe el nombre de la implementación y mantenga las credenciales fuera del código.
  • Elija el modelo por la modalidad de salida: comprensión, imagen o vídeo.
  • Valide calidad, derechos de uso, filtros, costo, latencia y disponibilidad regional.