Modelos generativos y agentes en Microsoft Foundry
Volver a la ruta AI-901
AI-901Capítulo 8

Preparación para la Certificación Microsoft AI-901

Modelos generativos y agentes en Microsoft Foundry

Catálogo de modelos, evaluación, implementación, área de juegos, API de respuestas, herramientas, conocimiento y Project API

Tiempo de estudio sugerido: 55 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA generativa, visión, voz, nube y agentes

1. , innovación y

La es la rama de la inteligencia artificial que crea contenido nuevo. En poco tiempo ha cambiado el trabajo y ampliado lo que puede hacer el software; como la evolución es rápida, incluso los desarrolladores experimentados necesitan un marco estable para comprender modelos, herramientas y patrones.

Ejemplos actuales de aplicación.
EscenarioCómo participa la
MarketingMicrosoft Copilot redacta descripciones, publicaciones de blog y contenido social, y ayuda a mantener la voz de la marca.
Atención al clienteAgentes virtuales interpretan preguntas en lenguaje natural, funcionan todo el día y descargan a los equipos humanos.
DesarrolloGitHub Copilot propone fragmentos, funciones y módulos a partir de instrucciones naturales.
Imagen y vídeoLos modelos del catálogo de Foundry crean recursos de campaña, storyboards y arte conceptual desde descripciones.
EducaciónLas plataformas generan cuestionarios, explicaciones y guías adaptados al progreso y estilo del estudiante.

cubre el ciclo de descubrir, comparar, evaluar e implementar un modelo, probarlo en el Área de juegos e integrarlo mediante código. Un agente incorpora instrucciones y herramientas para mantener un comportamiento reutilizable y coherente en el portal y en aplicaciones. Esta lectura ofrece el detalle completo; el formato de vídeo puede ser una alternativa.

Ciclo de IA generativa en Microsoft Foundry desde el catálogo hasta la operación.
Descubrimiento, evaluación, implementación, experimentación, integración y gobierno forman un ciclo continuo.

2. Catálogo de modelos y modelos fundacionales

Los LLM sustentan muchas soluciones generativas y agénticas, pero ningún modelo es ideal para todo. Una aplicación ligera de teléfono puede preferir un modelo de lenguaje pequeño; una solución gubernamental puede exigir un modelo especializado. requiere una suscripción y un proyecto de Foundry.

El catálogo de modelos de Foundry centraliza búsquedas por proveedor, origen, capacidad y tarea de inferencia. Reúne modelos comercializados directamente por y opciones de asociados o comunidades abiertas.

  • Los modelos vendidos por están hospedados por Microsoft conforme a los Términos del producto y ofrecen integración profunda con , empresariales, seguridad preconfigurada y alineación de cumplimiento.
  • Los modelos de asociados y comunidad amplían la experimentación y la innovación con opciones abiertas, hospedadas por proveedores o especializadas.
  • Cada ficha suele documentar generación de texto, razonamiento, código, multimodalidad y embeddings; benchmarks, tareas de inferencia, ajuste, tarjetas de modelo, restricciones y advertencias de IA responsable.

Un modelo fundacional es grande y previamente entrenado, con capacidades generales de lenguaje, razonamiento o multimodalidad. Familias como GPT, Claude y Mistral se pueden implementar de inmediato o personalizar mediante ajuste fino y sirven como base de aplicaciones.

Captura original del catálogo de modelos de Microsoft Foundry con filtros y proveedores.
La interfaz real del catálogo se conserva en PNG.
Captura original de detalles y capacidades de gpt-4.1 en Microsoft Foundry.
La ficha reúne datos rápidos, funciones, benchmarks, implementaciones y licencia.

3. Familias conocidas y selección por tarea

Una familia comparte arquitectura o y varía en tamaño, versión, especialización o capacidad. Varias destacan entre las más de mil opciones del catálogo.

  • GPT-5.x prioriza razonamiento en varios pasos, lógica estructurada, planificación, contexto largo y flujos de agentes. Los niveles ajustables de razonamiento intercambian velocidad por precisión.
  • Claude Opus 4.5 de Anthropic se orienta a agentes sofisticados, razonamiento complejo de código y tareas de uso del equipo, con grandes ventanas de contexto y salida para especificaciones, diffs de múltiples archivos e investigación extensa.
  • Mistral Large 3 de Mistral AI es un modelo general capaz que equilibra calidad, coste, latencia y rendimiento para redacción multilingüe, informes estructurados y agentes de latencia media.
  • La familia GPT-5 puede exigir registro y tener disponibilidad limitada. GPT-4.1 sigue siendo una opción accesible para chat en tiempo real, soporte y sistemas interactivos de alto volumen y baja latencia.
Mapa de tareas y criterios para seleccionar un modelo generativo.
La tarea, calidad, latencia, coste y seguridad orientan la decisión.
Relación inicial entre tarea y tipo de modelo.
TareaEjemplos sugeridosMotivo
ChatGPT-5.x chat, Claude Sonnet/Opus, Mistral Large 3, DeepSeek V3.1, Phi-4 o LlamaRazonamiento, conversación y ajuste de seguridad.
CódigoGPT-5.1-codex y Claude SonnetRazonamiento complejo de código y flujos de agentes.
ResumenModelos de razonamiento GPT-5.x y Claude Opus/SonnetContexto largo y compresión de calidad.
Embeddingstext-embedding-3-small y otros modelos de embeddingRepresentaciones vectoriales semánticas.
MultimodalPhi-4-multimodal-instruct, GPT-5.x multimodal y Mistral Large 3Imagen, audio y vídeo en conversaciones.
SectorialModelos ajustados al dominioLenguaje y tareas de finanzas, salud, derecho y otros sectores.

Cuando el caso está muy definido, una herramienta de Foundry puede ser preferible a elegir un modelo sin procesar. Sus modelos precompilados ofrecen comportamiento predecible, cumplimiento integrado y resultados más rápidos.

4. Benchmarks, comparaciones y evaluadores

La selección parte de la tarea, tráfico, latencia, coste, seguridad y restricciones empresariales. Los benchmarks usan datos coherentes y las clasificaciones ordenan calidad, seguridad y rendimiento. Las comparaciones laterales incluyen precisión, precio, cumplimiento, desempeño, sector, caso, tipo y licencia.

Captura original de la clasificación de modelos de Microsoft Foundry.
Clasificaciones y filtros reducen candidatos antes de probar datos propios.

Un flujo útil abre el modelo, entra en Benchmarks y prueba solicitudes con datos propios. Las métricas clásicas de NLP incluyen exactitud, precisión, recall y F1. Las métricas asistidas por IA observan fundamentación, relevancia, coherencia, fluidez y similitud GPT.

Los evaluadores miden calidad, seguridad y eficacia de las salidas. La Biblioteca de evaluadores ofrece componentes reutilizables; los de seguridad buscan contenido dañino, sesgo, injusticia, violencia, autolesión y daños a clases protegidas. Detectan y puntúan problemas, pero no los corrigen por sí solos.

5. Implementación, TPM, cuotas y

Implementar convierte el modelo configurado en un servicio con estable, seguro y escalable. Fija una combinación de versión, comportamiento y protección, favorece rendimiento coherente y limita usos no autorizados o inseguros.

  • Tipos como standard, global batch y regional provisioned throughput determinan dónde y cómo se procesa la inferencia y se relacionan con rendimiento y .
  • La versión selecciona la implementación exacta detrás del .
  • La asignación de por minuto (TPM) controla la capacidad de tráfico y ayuda a definir límites como solicitudes por minuto (RPM).

Un es la unidad mínima de texto o datos que procesa el modelo: palabra, subpalabra, carácter o signo. Más TPM permite más tráfico; menos TPM limita el consumo agregado. Modelos avanzados como DeepSeek R1, Grok y versiones grandes de Llama pueden admitir techos altos, mientras algunos modelos de imagen o especializados usan unidades de capacidad.

limita temporalmente el trabajo cuando se aproxima un límite para mantener estabilidad. Prompts largos, salidas máximas grandes y alta concurrencia consumen cuota y pueden causar errores; reducir max output o solicitudes simultáneas ayuda.

Flujo desde la configuración hasta proceso, endpoint seguro, métricas y registros.
La implementación asigna CPU, GPU, memoria, red y reglas de escala y activa observabilidad.

6. Área de juegos y parámetros de ejecución

El Área de juegos de modelos es la forma más sencilla de interactuar con una implementación. Permite probar prompts, comparar modelos y registrar instrucciones y configuraciones funcionales antes del código.

  • Temperature equilibra determinismo y creatividad.
  • Max output limita la longitud y afecta consumo y .
  • Las instrucciones del sistema establecen rol, conducta, tono, herramientas, límites y formato.
  • El prompt del usuario contiene la petición final; el del sistema gobierna cómo responder. Un tutor puede explicar paso a paso, citar fuentes y rechazar consejo médico.
Captura original del Área de juegos de modelos de Microsoft Foundry.
El panel controla instrucciones, herramientas, conocimiento, memoria y parámetros.

Tras probar casos representativos, la misma instrucción de sistema, petición y parámetros pasan al código. La vista Código muestra lo que ejecuta el chat y sirve como base para la de respuestas compatible con OpenAI.

Captura original de la vista Código generada por el Área de juegos.
El código exportado reproduce la configuración probada.

7. Cliente ligero, de Foundry y de respuestas

Un cliente ligero recoge entrada, llama una remota y muestra la salida sin interfaz pesada, complejo ni muchas dependencias. Puede ser CLI, utilidad de escritorio o web simple. El modelo procesa en el servidor, por lo que el prototipo es pequeño y ampliable.

Con un proyecto y un modelo como gpt-4.1 implementado, el de Foundry expone un cliente de proyecto para operaciones nativas y otro compatible con OpenAI para la de respuestas. Muchas aplicaciones usan ambos.

# Instala: pip install azure-ai-projects azure-identity "openai>=1.3.0"
import os
from openai import OpenAI

client = OpenAI(
    base_url=f"{os.environ['AZURE_OPENAI_ENDPOINT']}/openai",
    api_key=os.environ['AZURE_OPENAI_API_KEY']
)
result = client.responses.create(
    model=os.environ['DEPLOYMENT_NAME'],
    input=[
        {'role': 'system', 'content': 'Eres un asistente claro y conciso.'},
        {'role': 'user', 'content': 'Resume nuestras notas de versión en tres puntos.'}
    ],
    max_output_tokens=300,
    temperature=0.7
)
print(result.output_text)

El ejemplo lee , clave y nombre de implementación desde variables de entorno, autentica, envía mensajes system y user y muestra el texto. El modelo trabaja remotamente y el cliente permanece mínimo.

8. Modelo frente a agente

Modelo y agente operan en niveles distintos. El modelo aporta inteligencia directa: recibe un prompt y realiza inferencia. Sirve para experimentos y llamadas a la de respuestas donde solo se necesita generar una salida.

Un agente es una aplicación sobre el modelo. Empaqueta conducta orientada a tareas, elige acciones y reutiliza las mismas reglas en aplicaciones, experiencias y servicios.

Comparación entre inferencia directa y agente orientado a tareas.
El agente añade instrucciones, herramientas, memoria y acciones externas.

9. Anatomía y creación de un agente

Un agente reutilizable en reúne un modelo para lenguaje y razonamiento, instrucciones que definen rol, conducta, estilo, restricciones y salida, y herramientas que ejecutan acciones. El conocimiento es una fuente opcional de contexto.

  • Puede llamar , funciones, recuperación y otros servicios.
  • Puede dividir objetivos en pasos, mantener memoria de trabajo, decidir acciones y generar salidas estructuradas.
  • En el portal se elige el modelo, se escriben instrucciones — por ejemplo, un asistente de agenda que responda con viñetas — y se añaden herramientas y conocimiento.
Modelo, instrucciones, herramientas y conocimiento forman un agente.
Herramientas son acciones; conocimiento es contexto.

10. Herramientas, conocimiento y RAG

Herramientas: capacidad de actuar

Las herramientas permiten buscar en la web, consultar bases, leer y escribir archivos, ejecutar código, invocar funciones, o servidores MCP y actualizar sistemas. El modelo examina las capacidades y selecciona una cuando hace falta. El Catálogo de herramientas de Foundry centraliza descubrimiento y gestión. Code Interpreter, fuentes de conocimiento y funciones personalizadas son ejemplos.

Conocimiento: contexto recuperable

El conocimiento conecta documentos y datos mediante generación aumentada por recuperación (RAG). Las fuentes incluyen PDF internos, SharePoint, archivos de y bases con varias fuentes. La canalización ingiere e indexa, busca pasajes y fundamenta la respuesta.

  • Las preguntas se apoyan en documentos de la organización.
  • Las respuestas ganan contexto, precisión y trazabilidad.
  • Al usar una fuente, la respuesta puede citar el almacén consultado.
  • La recuperación empresarial se mantiene separada de las acciones.

11. Guardar, publicar e invocar un agente

El portal guarda modelo, instrucciones y herramientas como agente y permite refinarlo en el Área de juegos. Publicar crea un recurso administrado de con estable, compartible e integrable sin revelar el proyecto o código fuente.

Captura original del diálogo para crear un agente en Microsoft Foundry.
El agente reutiliza la configuración probada.
Captura original de learning-agent en el Área de juegos.
Conserva modelo, instrucciones, herramientas, conocimiento y memoria.

Una aplicación usa Foundry Projects y Project para integrar agentes en webs, bots y , orquestar varias etapas, enviar entradas o llamadas estructuradas y ejecutar a escala. El agent-id aparece en la vista Código entre las variables .env.

Captura original de variables de entorno de un agente de Microsoft Foundry.
La vista muestra identificadores y para el cliente.
# Instala: pip install --pre "azure-ai-projects>=2.0.0b1" azure-identity
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient

project = AIProjectClient(
    endpoint='https://SU-RECURSO.services.ai.azure.com/api/projects/SU-PROYECTO',
    credential=DefaultAzureCredential()
)
agent = project.agents.get(agent_name='learning-agent')
openai_client = project.get_openai_client()
response = openai_client.responses.create(
    input=[{'role': 'user', 'content': 'Explica en qué tareas puedes ayudar.'}],
    extra_body={'agent': {'name': agent.name, 'type': 'agent_reference'}}
)
print(response.output_text)

La llamada recupera el agente y lo referencia mediante extra_body. Sin agent_reference se llamaría solo a la implementación de modelo. El de proyecto, y DefaultAzureCredential autentican sin incrustar secretos.

12. Ejercicio guiado de

El ejercicio implementa y explora un modelo generativo y después lo usa en un agente con herramientas de conocimiento. Requiere una suscripción ; una cuenta nueva puede incluir créditos durante los primeros 30 días.

Captura original del agente de gastos del ejercicio de Microsoft Foundry.
La práctica cubre implementación, exploración y fundamentación con conocimiento.

13. Comprobación de conocimientos

Preguntas reformuladas

  1. ¿El catálogo solo contiene modelos Microsoft, reúne varios proveedores o sustituye la suscripción ?
  2. ¿Un modelo fundacional es pequeño e inútil, una herramienta de benchmark o un modelo grande previamente entrenado?
  3. ¿Por qué usar el Área de juegos: evitar , generar todas las instrucciones o validar prompts y ajustes reutilizables?
  4. ¿Publicar hace gratis al agente, lo limita al portal o crea un recurso administrado con estable?
  5. ¿Qué parte del ejemplo Python invoca el agente publicado y no solo un modelo?

Respuestas explicadas

  • El catálogo descubre, filtra, compara y prueba modelos de múltiples proveedores.
  • El modelo fundacional es grande, previamente entrenado, utilizable y personalizable.
  • El Área de juegos valida conducta y guarda ajustes reproducibles en código.
  • Publicar crea un recurso integrable; siguen existiendo costes de modelos, , herramientas y datos.
  • .create incluye extra_body con agent_reference; esa referencia selecciona el agente.

14. Resumen del capítulo

  • Los modelos de lenguaje sustentan y el catálogo combina opciones de , asociados y comunidad.
  • Tarea, calidad, latencia, coste, seguridad, benchmarks y pruebas propias guían la elección.
  • La implementación asigna proceso, crea y activa métricas; TPM, RPM y gobiernan capacidad.
  • El Área de juegos convierte experimentos en configuración reproducible por de respuestas y .
  • Un modelo infiere; un agente combina modelo, instrucciones, herramientas, memoria y conocimiento.
  • RAG fundamenta respuestas; las herramientas actúan sobre archivos, , bases y servidores MCP.
  • Foundry Projects y Project integran agentes publicados en webs, bots y con identidad, escala y gobierno.