Visão multimodal e geração de imagens e vídeos no Microsoft Foundry
Voltar para a trilha AI-901
AI-901Capítulo 11

Estudo para a Certificação Microsoft AI-901

Visão multimodal e geração de imagens e vídeos no Microsoft Foundry

Modelos com visão, Responses API, GPT-Image, Sora, Playgrounds e integração assíncrona de vídeo

Tempo de estudo sugerido: 52 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn

Escudo neon Microsoft Certified AI-901 cercado por símbolos de visão, imagens, vídeo e agentes de IA

1. computacional: interpretar e criar conteúdo visual

computacional é a área da IA que permite interpretar imagens, vídeos e transmissões de câmera. Seus modelos automatizam tarefas demoradas ao localizar objetos, reconhecer padrões, ler texto e compreender cenas. Modelos generativos ampliam essa capacidade: além de enxergar, a aplicação pode produzir imagens e vídeos originais.

Aplicações representativas de visão computacional.
CenárioComo a visão ajuda
ManufaturaDetecção de objetos e segmentação encontram defeitos, peças ausentes e desalinhamentos em tempo real, reduzindo desperdício.
SaúdeAnálise de radiografias, ressonâncias e tomografias destaca anomalias como fraturas ou tumores e apoia o diagnóstico.
VarejoCâmeras identificam prateleiras vazias ou produtos fora do lugar e atualizam o estoque.
Veículos autônomosSinais, faixas, pedestres e veículos são reconhecidos para orientar navegação e decisões em ambientes dinâmicos.
Mapa de análise e geração de conteúdo na visão computacional.
A IA visual conecta imagens, vídeo e câmera a análise, decisão e geração de novo conteúdo.

2. Modelos multimodais e raciocínio visual

Um modelo multimodal trabalha com mais de um tipo de dado, como texto, imagem, áudio ou vídeo. Ao receber imagem e instrução textual no mesmo contexto, ele pode descrever a cena, responder perguntas, interpretar gráficos, ler documentos e explicar capturas de tela. Essa combinação é frequentemente chamada de GPT habilitado para visão ou GPT com visão.

Aplicações usam entendimento visual para melhorar o fluxo do usuário; agentes usam a imagem como evidência para decidir melhor. Exemplos incluem revisar documentos enviados, analisar fotografias de suporte e explicar diagramas em linguagem simples. Uma única experiência multimodal reduz a necessidade de separados para visão e linguagem.

Modelo multimodal combinando instrução textual, imagem e raciocínio.
Texto e imagem entram juntos; o modelo correlaciona as modalidades e produz uma resposta contextual.

3. Modelos multimodais no

O catálogo do oferece modelos próprios e de parceiros capazes de receber imagens. As famílias GPT-4.1, GPT-4.1-mini e GPT-4.1-nano atendem descrição, perguntas visuais, documentos, capturas, gráficos e diagramas. A família GPT-5 acrescenta raciocínio de contexto amplo, saídas estruturadas e uso de ferramentas para agentes e aplicações empresariais mais complexas.

Também existem ofertas multimodais de parceiros, inclusive modelos de fornecedores como Anthropic. Como catálogo, versões e disponibilidade regional evoluem, confirme no portal qual implantação aceita entrada visual e use sempre o nome atribuído à implantação, não apenas o nome-base do modelo.

  • Descrever objetos, texto e relações presentes em uma imagem.
  • Responder perguntas sobre fotografias, documentos, interfaces e cenas.
  • Extrair significado de gráficos e combinar a leitura visual com instruções no mesmo prompt.
  • Entregar respostas naturais ou estruturadas e, nos modelos compatíveis, acionar ferramentas.

4. Análise de imagens no Playground

No novo portal do , o Model Playground permite conversar com uma implantação habilitada para visão. Você anexa uma ou mais imagens, escreve a pergunta e observa como o modelo interpreta o conteúdo antes de desenvolver a aplicação. O portal clássico possui uma interface diferente, mas o objetivo de validação é o mesmo.

Captura original do envio de imagens ao Playground do Microsoft Foundry.
O usuário anexa arquivos visuais e acrescenta a instrução textual no mesmo chat.
Captura original da resposta de análise visual no Playground.
A implantação descreve a imagem e responde no contexto da conversa.

5. com texto e imagem

Para levar o teste ao código, a OpenAI no Foundry recebe entradas multimodais nativas. Uma única solicitação contém uma instrução e uma ou mais imagens, que podem ser ou dados codificados em . O modelo processa tudo em conjunto e devolve texto, permitindo que usuários enviem imagens e façam perguntas em tempo real.

transforma bytes binários em texto seguro para ou de dados. Para imagens grandes, considere custo, limite de contexto e transporte. Proteja chaves em variáveis de ambiente ou autentique com quando houver suporte.

Fluxo da Responses API para análise multimodal.
Aplicação reúne texto e imagem, autentica no da implantação e recebe uma resposta contextual.

6. Cliente Python para análise visual

Instale o pacote openai, obtenha e credencial do recurso e informe o nome da implantação. O cliente aponta para o compatível com OpenAI; .create recebe uma mensagem multipartes com input_text e input_image.

pip install openai

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ['FOUNDRY_KEY'],
    base_url=os.environ['FOUNDRY_ENDPOINT']
)

response = client.responses.create(
    model=os.environ['MODEL_NAME'],
    input=[{
        'role': 'user',
        'content': [
            {'type': 'input_text', 'text': 'Descreva a imagem em três tópicos.'},
            {'type': 'input_image', 'image_url': os.environ['IMAGE_URL']}
        ]
    }]
)
print(response.output_text)
Captura original de uma fotografia aberta no Visual Studio Code.
O exemplo usa uma imagem de girafas como entrada visual da aplicação.
Captura original do cliente Python para análise de imagem.
O código carrega a imagem, recebe a pergunta e envia uma mensagem com texto e imagem.
Captura original do resultado da análise no terminal.
A resposta é construída a partir do prompt e da imagem enviados juntos.

7. Modelos de geração de imagens

Modelos de análise associam uma imagem ao texto correspondente; modelos de geração fazem o caminho inverso e criam pixels a partir de uma descrição. No Foundry, a família GPT-Image oferece geração de texto para imagem, variações e edição. GPT-Image-1.5 prioriza fidelidade, alinhamento ao prompt, consistência e fluxos empresariais; GPT-Image-1 é uma opção geral amplamente integrada; GPT-Image-1-mini reduz custo e latência em experimentos e alto volume.

O catálogo também pode oferecer modelos de terceiros, como a família FLUX da Black Forest Labs, voltada a imagens fotorealistas e flexibilidade estilística. A escolha depende de qualidade, edição, latência, custo, disponibilidade e requisitos de uso responsável.

Fluxo de geração e edição de imagens no Foundry.
Prompt, imagem opcional e parâmetros orientam o modelo, que devolve uma imagem codificada para validação e armazenamento.

8. Playground e para geração de imagens

Depois de implantar o modelo, descreva a imagem no Playground e aguarde a geração. Pela , a aplicação pode criar imagens novas ou editar existentes. O parâmetro model recebe o nome da implantação configurada no recurso; autenticação pode usar chave ou .

Captura original do Playground durante a geração de uma imagem.
O Playground permite experimentar o prompt antes de automatizar o fluxo.
Captura original do código Python oferecido pelo Playground de imagens.
A amostra conecta ao e demonstra a geração programática.
import base64
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ['FOUNDRY_KEY'],
    base_url=os.environ['FOUNDRY_ENDPOINT']
)
response = client.responses.create(
    model=os.environ['IMAGE_DEPLOYMENT'],
    input='Ilustração vetorial de um robô segurando uma planta, cores suaves.',
    tools=[{'type': 'image_generation'}]
)
encoded = next(item.result for item in response.output
               if item.type == 'image_generation_call')
with open('imagem-gerada.png', 'wb') as output:
    output.write(base64.b64decode(encoded))

9. Geração de vídeo com Sora

Modelos de vídeo transformam instruções e referências visuais em clipes originais. Sora 1 foi o primeiro modelo texto-para-vídeo da OpenAI disponibilizado no Foundry; gera vídeos curtos, aceita imagem orientadora e oferece diferentes resoluções e durações. É útil para storyboards, animações e protótipos criativos.

Sora 2, em no material, amplia o fluxo para texto-para-vídeo, imagem-para-vídeo e remix de vídeo. Também adiciona áudio, maior realismo e edição direcionada. Casos incluem marketing, conceituais e mídia educacional. Os modelos Sora possuem proteções de IA Responsável e restrições sobre pessoas reais, personagens protegidos e categorias sensíveis.

Captura original dos modelos de geração de vídeo no catálogo do Foundry.
O catálogo mostra as implantações de vídeo disponíveis para o recurso e a região.

10. Video Playground e interface

No Video Playground, escolha uma implantação, informe o conteúdo da cena e ajuste dimensões e duração. A geração leva alguns minutos e a interface disponibiliza exemplos de código. Sora é a família nativa de saída em vídeo abordada neste módulo; outros modelos multimodais podem entender texto, imagem ou áudio sem necessariamente produzir vídeo.

Captura original do Playground de vídeo com um prompt.
O prompt descreve a cena e os controles definem características do clipe.
Captura original do exemplo REST para geração de vídeo.
O código do Playground pode ser usado como ponto de partida para automação.

é uma interface entre programas; um é uma camada mais amigável sobre essas operações. Quando não existe para a linguagem escolhida, curl permite enviar requisições, dados e cabeçalhos diretamente à .

11. Trabalho assíncrono: criar, consultar e baixar

Renderizar vídeo exige muitos recursos e não deve bloquear uma requisição síncrona. O cliente cria um trabalho, guarda o identificador retornado, consulta o estado até completed ou failed e baixa o MP4 apenas depois da conclusão. O material estima normalmente de um a cinco minutos, variando conforme duração, resolução e capacidade.

  • Pré-requisitos: recurso Foundry/ OpenAI em região compatível e uma implantação Sora.
  • Autenticação: chave de ou .
  • distintos iniciam o trabalho, consultam o estado e entregam o conteúdo final.
Ciclo assíncrono de geração de vídeo.
O cliente cria o trabalho, consulta o estado com espera controlada e baixa o MP4 quando a renderização termina.
curl -X POST "$FOUNDRY_ENDPOINT/videos"   -H "Content-Type: application/json"   -H "api-key: $AZURE_OPENAI_API_KEY"   -d '{"model":"sora-2","prompt":"Chuva em uma janela neon","size":"1280x720","seconds":"8"}'

curl -X GET "$FOUNDRY_ENDPOINT/videos/{video_id}"   -H "api-key: $AZURE_OPENAI_API_KEY"

curl -L "$FOUNDRY_ENDPOINT/videos/{video_id}/content?variant=video"   -H "api-key: $AZURE_OPENAI_API_KEY" --output resultado.mp4

12. Exercício e verificação de conhecimento

O exercício de aproximadamente 30 minutos usa modelos generativos no para trabalhar com dados visuais. É necessária uma assinatura do ; novas contas podem ter créditos gratuitos por 30 dias. O laboratório percorre análise de imagens e experiências de geração visual.

Captura original do exercício de visão computacional no Microsoft Foundry.
O laboratório combina um agente, uma imagem enviada e perguntas sobre o conteúdo visual.
Respostas comentadas da avaliação.
PerguntaResposta e motivo
O que define um modelo multimodal?Ele entende e combina mais de um tipo de dado, como texto e imagem.
Como gerar imagens por código?Envie o prompt à OpenAI com uma implantação de geração de imagens.
Qual valor usar em model?O nome da implantação definido no recurso do Foundry.
Por que vídeo é assíncrono?A renderização consome muitos recursos e leva tempo para terminar.

13. Resumo e referências oficiais

Modelos multimodais ligam visão e linguagem para analisar documentos, fotografias, telas e gráficos. A família GPT-Image cria e edita imagens; Sora cria e transforma vídeos por um fluxo assíncrono. Playground, , de imagem e permitem validar e integrar essas capacidades em assistentes visuais, acessibilidade, agentes e experiências criativas.

  • Use texto e imagem juntos quando a resposta depender de contexto visual.
  • Passe sempre o nome da implantação e mantenha credenciais fora do código.
  • Escolha o modelo pela modalidade de saída: entendimento, imagem ou vídeo.
  • Valide qualidade, direitos de uso, filtros de conteúdo, custo, latência e disponibilidade regional.