Preparación para la Certificación Microsoft AI-901
Modelos generativos y agentes en Microsoft Foundry
Catálogo de modelos, evaluación, implementación, área de juegos, API de respuestas, herramientas, conocimiento y Project API
Tiempo de estudio sugerido: 55 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. , innovación y
La es la rama de la inteligencia artificial que crea contenido nuevo. En poco tiempo ha cambiado el trabajo y ampliado lo que puede hacer el software; como la evolución es rápida, incluso los desarrolladores experimentados necesitan un marco estable para comprender modelos, herramientas y patrones.
Ejemplos actuales de aplicación.
Escenario
Cómo participa la
Marketing
Microsoft Copilot redacta descripciones, publicaciones de blog y contenido social, y ayuda a mantener la voz de la marca.
Atención al cliente
Agentes virtuales interpretan preguntas en lenguaje natural, funcionan todo el día y descargan a los equipos humanos.
Desarrollo
GitHub Copilot propone fragmentos, funciones y módulos a partir de instrucciones naturales.
Imagen y vídeo
Los modelos del catálogo de Foundry crean recursos de campaña, storyboards y arte conceptual desde descripciones.
Educación
Las plataformas generan cuestionarios, explicaciones y guías adaptados al progreso y estilo del estudiante.
cubre el ciclo de descubrir, comparar, evaluar e implementar un modelo, probarlo en el Área de juegos e integrarlo mediante código. Un agente incorpora instrucciones y herramientas para mantener un comportamiento reutilizable y coherente en el portal y en aplicaciones. Esta lectura ofrece el detalle completo; el formato de vídeo puede ser una alternativa.
Descubrimiento, evaluación, implementación, experimentación, integración y gobierno forman un ciclo continuo.
2. Catálogo de modelos y modelos fundacionales
Los LLM sustentan muchas soluciones generativas y agénticas, pero ningún modelo es ideal para todo. Una aplicación ligera de teléfono puede preferir un modelo de lenguaje pequeño; una solución gubernamental puede exigir un modelo especializado. requiere una suscripción y un proyecto de Foundry.
El catálogo de modelos de Foundry centraliza búsquedas por proveedor, origen, capacidad y tarea de inferencia. Reúne modelos comercializados directamente por y opciones de asociados o comunidades abiertas.
Los modelos vendidos por están hospedados por Microsoft conforme a los Términos del producto y ofrecen integración profunda con , empresariales, seguridad preconfigurada y alineación de cumplimiento.
Los modelos de asociados y comunidad amplían la experimentación y la innovación con opciones abiertas, hospedadas por proveedores o especializadas.
Cada ficha suele documentar generación de texto, razonamiento, código, multimodalidad y embeddings; benchmarks, tareas de inferencia, ajuste, tarjetas de modelo, restricciones y advertencias de IA responsable.
Un modelo fundacional es grande y previamente entrenado, con capacidades generales de lenguaje, razonamiento o multimodalidad. Familias como GPT, Claude y Mistral se pueden implementar de inmediato o personalizar mediante ajuste fino y sirven como base de aplicaciones.
La interfaz real del catálogo se conserva en PNG.La ficha reúne datos rápidos, funciones, benchmarks, implementaciones y licencia.
3. Familias conocidas y selección por tarea
Una familia comparte arquitectura o y varía en tamaño, versión, especialización o capacidad. Varias destacan entre las más de mil opciones del catálogo.
GPT-5.x prioriza razonamiento en varios pasos, lógica estructurada, planificación, contexto largo y flujos de agentes. Los niveles ajustables de razonamiento intercambian velocidad por precisión.
Claude Opus 4.5 de Anthropic se orienta a agentes sofisticados, razonamiento complejo de código y tareas de uso del equipo, con grandes ventanas de contexto y salida para especificaciones, diffs de múltiples archivos e investigación extensa.
Mistral Large 3 de Mistral AI es un modelo general capaz que equilibra calidad, coste, latencia y rendimiento para redacción multilingüe, informes estructurados y agentes de latencia media.
La familia GPT-5 puede exigir registro y tener disponibilidad limitada. GPT-4.1 sigue siendo una opción accesible para chat en tiempo real, soporte y sistemas interactivos de alto volumen y baja latencia.
La tarea, calidad, latencia, coste y seguridad orientan la decisión.
Relación inicial entre tarea y tipo de modelo.
Tarea
Ejemplos sugeridos
Motivo
Chat
GPT-5.x chat, Claude Sonnet/Opus, Mistral Large 3, DeepSeek V3.1, Phi-4 o Llama
Razonamiento, conversación y ajuste de seguridad.
Código
GPT-5.1-codex y Claude Sonnet
Razonamiento complejo de código y flujos de agentes.
Resumen
Modelos de razonamiento GPT-5.x y Claude Opus/Sonnet
Contexto largo y compresión de calidad.
Embeddings
text-embedding-3-small y otros modelos de embedding
Representaciones vectoriales semánticas.
Multimodal
Phi-4-multimodal-instruct, GPT-5.x multimodal y Mistral Large 3
Imagen, audio y vídeo en conversaciones.
Sectorial
Modelos ajustados al dominio
Lenguaje y tareas de finanzas, salud, derecho y otros sectores.
Cuando el caso está muy definido, una herramienta de Foundry puede ser preferible a elegir un modelo sin procesar. Sus modelos precompilados ofrecen comportamiento predecible, cumplimiento integrado y resultados más rápidos.
4. Benchmarks, comparaciones y evaluadores
La selección parte de la tarea, tráfico, latencia, coste, seguridad y restricciones empresariales. Los benchmarks usan datos coherentes y las clasificaciones ordenan calidad, seguridad y rendimiento. Las comparaciones laterales incluyen precisión, precio, cumplimiento, desempeño, sector, caso, tipo y licencia.
Clasificaciones y filtros reducen candidatos antes de probar datos propios.
Un flujo útil abre el modelo, entra en Benchmarks y prueba solicitudes con datos propios. Las métricas clásicas de NLP incluyen exactitud, precisión, recall y F1. Las métricas asistidas por IA observan fundamentación, relevancia, coherencia, fluidez y similitud GPT.
Los evaluadores miden calidad, seguridad y eficacia de las salidas. La Biblioteca de evaluadores ofrece componentes reutilizables; los de seguridad buscan contenido dañino, sesgo, injusticia, violencia, autolesión y daños a clases protegidas. Detectan y puntúan problemas, pero no los corrigen por sí solos.
5. Implementación, TPM, cuotas y
Implementar convierte el modelo configurado en un servicio con estable, seguro y escalable. Fija una combinación de versión, comportamiento y protección, favorece rendimiento coherente y limita usos no autorizados o inseguros.
Tipos como standard, global batch y regional provisioned throughput determinan dónde y cómo se procesa la inferencia y se relacionan con rendimiento y .
La versión selecciona la implementación exacta detrás del .
La asignación de por minuto (TPM) controla la capacidad de tráfico y ayuda a definir límites como solicitudes por minuto (RPM).
Un es la unidad mínima de texto o datos que procesa el modelo: palabra, subpalabra, carácter o signo. Más TPM permite más tráfico; menos TPM limita el consumo agregado. Modelos avanzados como DeepSeek R1, Grok y versiones grandes de Llama pueden admitir techos altos, mientras algunos modelos de imagen o especializados usan unidades de capacidad.
limita temporalmente el trabajo cuando se aproxima un límite para mantener estabilidad. Prompts largos, salidas máximas grandes y alta concurrencia consumen cuota y pueden causar errores; reducir max output o solicitudes simultáneas ayuda.
La implementación asigna CPU, GPU, memoria, red y reglas de escala y activa observabilidad.
6. Área de juegos y parámetros de ejecución
El Área de juegos de modelos es la forma más sencilla de interactuar con una implementación. Permite probar prompts, comparar modelos y registrar instrucciones y configuraciones funcionales antes del código.
Temperature equilibra determinismo y creatividad.
Max output limita la longitud y afecta consumo y .
Las instrucciones del sistema establecen rol, conducta, tono, herramientas, límites y formato.
El prompt del usuario contiene la petición final; el del sistema gobierna cómo responder. Un tutor puede explicar paso a paso, citar fuentes y rechazar consejo médico.
El panel controla instrucciones, herramientas, conocimiento, memoria y parámetros.
Tras probar casos representativos, la misma instrucción de sistema, petición y parámetros pasan al código. La vista Código muestra lo que ejecuta el chat y sirve como base para la de respuestas compatible con OpenAI.
El código exportado reproduce la configuración probada.
7. Cliente ligero, de Foundry y de respuestas
Un cliente ligero recoge entrada, llama una remota y muestra la salida sin interfaz pesada, complejo ni muchas dependencias. Puede ser CLI, utilidad de escritorio o web simple. El modelo procesa en el servidor, por lo que el prototipo es pequeño y ampliable.
Con un proyecto y un modelo como gpt-4.1 implementado, el de Foundry expone un cliente de proyecto para operaciones nativas y otro compatible con OpenAI para la de respuestas. Muchas aplicaciones usan ambos.
# Instala: pip install azure-ai-projects azure-identity "openai>=1.3.0"
import os
from openai import OpenAI
client = OpenAI(
base_url=f"{os.environ['AZURE_OPENAI_ENDPOINT']}/openai",
api_key=os.environ['AZURE_OPENAI_API_KEY']
)
result = client.responses.create(
model=os.environ['DEPLOYMENT_NAME'],
input=[
{'role': 'system', 'content': 'Eres un asistente claro y conciso.'},
{'role': 'user', 'content': 'Resume nuestras notas de versión en tres puntos.'}
],
max_output_tokens=300,
temperature=0.7
)
print(result.output_text)
El ejemplo lee , clave y nombre de implementación desde variables de entorno, autentica, envía mensajes system y user y muestra el texto. El modelo trabaja remotamente y el cliente permanece mínimo.
8. Modelo frente a agente
Modelo y agente operan en niveles distintos. El modelo aporta inteligencia directa: recibe un prompt y realiza inferencia. Sirve para experimentos y llamadas a la de respuestas donde solo se necesita generar una salida.
Un agente es una aplicación sobre el modelo. Empaqueta conducta orientada a tareas, elige acciones y reutiliza las mismas reglas en aplicaciones, experiencias y servicios.
El agente añade instrucciones, herramientas, memoria y acciones externas.
9. Anatomía y creación de un agente
Un agente reutilizable en reúne un modelo para lenguaje y razonamiento, instrucciones que definen rol, conducta, estilo, restricciones y salida, y herramientas que ejecutan acciones. El conocimiento es una fuente opcional de contexto.
Puede llamar , funciones, recuperación y otros servicios.
Puede dividir objetivos en pasos, mantener memoria de trabajo, decidir acciones y generar salidas estructuradas.
En el portal se elige el modelo, se escriben instrucciones — por ejemplo, un asistente de agenda que responda con viñetas — y se añaden herramientas y conocimiento.
Herramientas son acciones; conocimiento es contexto.
10. Herramientas, conocimiento y RAG
Herramientas: capacidad de actuar
Las herramientas permiten buscar en la web, consultar bases, leer y escribir archivos, ejecutar código, invocar funciones, o servidores MCP y actualizar sistemas. El modelo examina las capacidades y selecciona una cuando hace falta. El Catálogo de herramientas de Foundry centraliza descubrimiento y gestión. Code Interpreter, fuentes de conocimiento y funciones personalizadas son ejemplos.
Conocimiento: contexto recuperable
El conocimiento conecta documentos y datos mediante generación aumentada por recuperación (RAG). Las fuentes incluyen PDF internos, SharePoint, archivos de y bases con varias fuentes. La canalización ingiere e indexa, busca pasajes y fundamenta la respuesta.
Las preguntas se apoyan en documentos de la organización.
Las respuestas ganan contexto, precisión y trazabilidad.
Al usar una fuente, la respuesta puede citar el almacén consultado.
La recuperación empresarial se mantiene separada de las acciones.
11. Guardar, publicar e invocar un agente
El portal guarda modelo, instrucciones y herramientas como agente y permite refinarlo en el Área de juegos. Publicar crea un recurso administrado de con estable, compartible e integrable sin revelar el proyecto o código fuente.
El agente reutiliza la configuración probada.Conserva modelo, instrucciones, herramientas, conocimiento y memoria.
Una aplicación usa Foundry Projects y Project para integrar agentes en webs, bots y , orquestar varias etapas, enviar entradas o llamadas estructuradas y ejecutar a escala. El agent-id aparece en la vista Código entre las variables .env.
La vista muestra identificadores y para el cliente.
La llamada recupera el agente y lo referencia mediante extra_body. Sin agent_reference se llamaría solo a la implementación de modelo. El de proyecto, y DefaultAzureCredential autentican sin incrustar secretos.
12. Ejercicio guiado de
El ejercicio implementa y explora un modelo generativo y después lo usa en un agente con herramientas de conocimiento. Requiere una suscripción ; una cuenta nueva puede incluir créditos durante los primeros 30 días.
La práctica cubre implementación, exploración y fundamentación con conocimiento.