Visão multimodal e geração de imagens e vídeos no Microsoft Foundry
Modelos com visão, Responses API, GPT-Image, Sora, Playgrounds e integração assíncrona de vídeo
Tempo de estudo sugerido: 52 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn
Por João Ricardo Dutra••Conteúdo autoral completo
1. computacional: interpretar e criar conteúdo visual
computacional é a área da IA que permite interpretar imagens, vídeos e transmissões de câmera. Seus modelos automatizam tarefas demoradas ao localizar objetos, reconhecer padrões, ler texto e compreender cenas. Modelos generativos ampliam essa capacidade: além de enxergar, a aplicação pode produzir imagens e vídeos originais.
Aplicações representativas de visão computacional.
Cenário
Como a visão ajuda
Manufatura
Detecção de objetos e segmentação encontram defeitos, peças ausentes e desalinhamentos em tempo real, reduzindo desperdício.
Saúde
Análise de radiografias, ressonâncias e tomografias destaca anomalias como fraturas ou tumores e apoia o diagnóstico.
Varejo
Câmeras identificam prateleiras vazias ou produtos fora do lugar e atualizam o estoque.
Veículos autônomos
Sinais, faixas, pedestres e veículos são reconhecidos para orientar navegação e decisões em ambientes dinâmicos.
A IA visual conecta imagens, vídeo e câmera a análise, decisão e geração de novo conteúdo.
2. Modelos multimodais e raciocínio visual
Um modelo multimodal trabalha com mais de um tipo de dado, como texto, imagem, áudio ou vídeo. Ao receber imagem e instrução textual no mesmo contexto, ele pode descrever a cena, responder perguntas, interpretar gráficos, ler documentos e explicar capturas de tela. Essa combinação é frequentemente chamada de GPT habilitado para visão ou GPT com visão.
Aplicações usam entendimento visual para melhorar o fluxo do usuário; agentes usam a imagem como evidência para decidir melhor. Exemplos incluem revisar documentos enviados, analisar fotografias de suporte e explicar diagramas em linguagem simples. Uma única experiência multimodal reduz a necessidade de separados para visão e linguagem.
Texto e imagem entram juntos; o modelo correlaciona as modalidades e produz uma resposta contextual.
3. Modelos multimodais no
O catálogo do oferece modelos próprios e de parceiros capazes de receber imagens. As famílias GPT-4.1, GPT-4.1-mini e GPT-4.1-nano atendem descrição, perguntas visuais, documentos, capturas, gráficos e diagramas. A família GPT-5 acrescenta raciocínio de contexto amplo, saídas estruturadas e uso de ferramentas para agentes e aplicações empresariais mais complexas.
Também existem ofertas multimodais de parceiros, inclusive modelos de fornecedores como Anthropic. Como catálogo, versões e disponibilidade regional evoluem, confirme no portal qual implantação aceita entrada visual e use sempre o nome atribuído à implantação, não apenas o nome-base do modelo.
Descrever objetos, texto e relações presentes em uma imagem.
Responder perguntas sobre fotografias, documentos, interfaces e cenas.
Extrair significado de gráficos e combinar a leitura visual com instruções no mesmo prompt.
Entregar respostas naturais ou estruturadas e, nos modelos compatíveis, acionar ferramentas.
4. Análise de imagens no Playground
No novo portal do , o Model Playground permite conversar com uma implantação habilitada para visão. Você anexa uma ou mais imagens, escreve a pergunta e observa como o modelo interpreta o conteúdo antes de desenvolver a aplicação. O portal clássico possui uma interface diferente, mas o objetivo de validação é o mesmo.
O usuário anexa arquivos visuais e acrescenta a instrução textual no mesmo chat.A implantação descreve a imagem e responde no contexto da conversa.
5. com texto e imagem
Para levar o teste ao código, a OpenAI no Foundry recebe entradas multimodais nativas. Uma única solicitação contém uma instrução e uma ou mais imagens, que podem ser ou dados codificados em . O modelo processa tudo em conjunto e devolve texto, permitindo que usuários enviem imagens e façam perguntas em tempo real.
transforma bytes binários em texto seguro para ou de dados. Para imagens grandes, considere custo, limite de contexto e transporte. Proteja chaves em variáveis de ambiente ou autentique com quando houver suporte.
Aplicação reúne texto e imagem, autentica no da implantação e recebe uma resposta contextual.
6. Cliente Python para análise visual
Instale o pacote openai, obtenha e credencial do recurso e informe o nome da implantação. O cliente aponta para o compatível com OpenAI; .create recebe uma mensagem multipartes com input_text e input_image.
pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ['FOUNDRY_KEY'],
base_url=os.environ['FOUNDRY_ENDPOINT']
)
response = client.responses.create(
model=os.environ['MODEL_NAME'],
input=[{
'role': 'user',
'content': [
{'type': 'input_text', 'text': 'Descreva a imagem em três tópicos.'},
{'type': 'input_image', 'image_url': os.environ['IMAGE_URL']}
]
}]
)
print(response.output_text)
O exemplo usa uma imagem de girafas como entrada visual da aplicação.O código carrega a imagem, recebe a pergunta e envia uma mensagem com texto e imagem.A resposta é construída a partir do prompt e da imagem enviados juntos.
7. Modelos de geração de imagens
Modelos de análise associam uma imagem ao texto correspondente; modelos de geração fazem o caminho inverso e criam pixels a partir de uma descrição. No Foundry, a família GPT-Image oferece geração de texto para imagem, variações e edição. GPT-Image-1.5 prioriza fidelidade, alinhamento ao prompt, consistência e fluxos empresariais; GPT-Image-1 é uma opção geral amplamente integrada; GPT-Image-1-mini reduz custo e latência em experimentos e alto volume.
O catálogo também pode oferecer modelos de terceiros, como a família FLUX da Black Forest Labs, voltada a imagens fotorealistas e flexibilidade estilística. A escolha depende de qualidade, edição, latência, custo, disponibilidade e requisitos de uso responsável.
Prompt, imagem opcional e parâmetros orientam o modelo, que devolve uma imagem codificada para validação e armazenamento.
8. Playground e para geração de imagens
Depois de implantar o modelo, descreva a imagem no Playground e aguarde a geração. Pela , a aplicação pode criar imagens novas ou editar existentes. O parâmetro model recebe o nome da implantação configurada no recurso; autenticação pode usar chave ou .
O Playground permite experimentar o prompt antes de automatizar o fluxo.A amostra conecta ao e demonstra a geração programática.
import base64
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ['FOUNDRY_KEY'],
base_url=os.environ['FOUNDRY_ENDPOINT']
)
response = client.responses.create(
model=os.environ['IMAGE_DEPLOYMENT'],
input='Ilustração vetorial de um robô segurando uma planta, cores suaves.',
tools=[{'type': 'image_generation'}]
)
encoded = next(item.result for item in response.output
if item.type == 'image_generation_call')
with open('imagem-gerada.png', 'wb') as output:
output.write(base64.b64decode(encoded))
9. Geração de vídeo com Sora
Modelos de vídeo transformam instruções e referências visuais em clipes originais. Sora 1 foi o primeiro modelo texto-para-vídeo da OpenAI disponibilizado no Foundry; gera vídeos curtos, aceita imagem orientadora e oferece diferentes resoluções e durações. É útil para storyboards, animações e protótipos criativos.
Sora 2, em no material, amplia o fluxo para texto-para-vídeo, imagem-para-vídeo e remix de vídeo. Também adiciona áudio, maior realismo e edição direcionada. Casos incluem marketing, conceituais e mídia educacional. Os modelos Sora possuem proteções de IA Responsável e restrições sobre pessoas reais, personagens protegidos e categorias sensíveis.
O catálogo mostra as implantações de vídeo disponíveis para o recurso e a região.
10. Video Playground e interface
No Video Playground, escolha uma implantação, informe o conteúdo da cena e ajuste dimensões e duração. A geração leva alguns minutos e a interface disponibiliza exemplos de código. Sora é a família nativa de saída em vídeo abordada neste módulo; outros modelos multimodais podem entender texto, imagem ou áudio sem necessariamente produzir vídeo.
O prompt descreve a cena e os controles definem características do clipe.O código do Playground pode ser usado como ponto de partida para automação.
é uma interface entre programas; um é uma camada mais amigável sobre essas operações. Quando não existe para a linguagem escolhida, curl permite enviar requisições, dados e cabeçalhos diretamente à .
11. Trabalho assíncrono: criar, consultar e baixar
Renderizar vídeo exige muitos recursos e não deve bloquear uma requisição síncrona. O cliente cria um trabalho, guarda o identificador retornado, consulta o estado até completed ou failed e baixa o MP4 apenas depois da conclusão. O material estima normalmente de um a cinco minutos, variando conforme duração, resolução e capacidade.
Pré-requisitos: recurso Foundry/ OpenAI em região compatível e uma implantação Sora.
Autenticação: chave de ou .
distintos iniciam o trabalho, consultam o estado e entregam o conteúdo final.
O cliente cria o trabalho, consulta o estado com espera controlada e baixa o MP4 quando a renderização termina.
curl -X POST "$FOUNDRY_ENDPOINT/videos" -H "Content-Type: application/json" -H "api-key: $AZURE_OPENAI_API_KEY" -d '{"model":"sora-2","prompt":"Chuva em uma janela neon","size":"1280x720","seconds":"8"}'
curl -X GET "$FOUNDRY_ENDPOINT/videos/{video_id}" -H "api-key: $AZURE_OPENAI_API_KEY"
curl -L "$FOUNDRY_ENDPOINT/videos/{video_id}/content?variant=video" -H "api-key: $AZURE_OPENAI_API_KEY" --output resultado.mp4
12. Exercício e verificação de conhecimento
O exercício de aproximadamente 30 minutos usa modelos generativos no para trabalhar com dados visuais. É necessária uma assinatura do ; novas contas podem ter créditos gratuitos por 30 dias. O laboratório percorre análise de imagens e experiências de geração visual.
O laboratório combina um agente, uma imagem enviada e perguntas sobre o conteúdo visual.
Ele entende e combina mais de um tipo de dado, como texto e imagem.
Como gerar imagens por código?
Envie o prompt à OpenAI com uma implantação de geração de imagens.
Qual valor usar em model?
O nome da implantação definido no recurso do Foundry.
Por que vídeo é assíncrono?
A renderização consome muitos recursos e leva tempo para terminar.
13. Resumo e referências oficiais
Modelos multimodais ligam visão e linguagem para analisar documentos, fotografias, telas e gráficos. A família GPT-Image cria e edita imagens; Sora cria e transforma vídeos por um fluxo assíncrono. Playground, , de imagem e permitem validar e integrar essas capacidades em assistentes visuais, acessibilidade, agentes e experiências criativas.
Use texto e imagem juntos quando a resposta depender de contexto visual.
Passe sempre o nome da implantação e mantenha credenciais fora do código.
Escolha o modelo pela modalidade de saída: entendimento, imagem ou vídeo.
Valide qualidade, direitos de uso, filtros de conteúdo, custo, latência e disponibilidade regional.