IA generativa: LLM, prompts, RAG y agentes de IA
Volver a la ruta AI-901
AI-901Capítulo 2

Preparación para la Certificación Microsoft AI-901

IA generativa: LLM, prompts, RAG y agentes de IA

Tokenización, transformers, embeddings, atención, generación de finalizaciones, diseño de prompts y sistemas multiagente

Tiempo de estudio sugerido: 32 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA generativa, visión, voz, nube y agentes

1. Introducción a la

Objetivos de aprendizaje

  • Explicar cómo los modelos de lenguaje grandes y pequeños representan relaciones lingüísticas y semánticas.
  • Describir tokenización, vectores, embeddings, atención, codificador, decodificador y predicción de finalizaciones.
  • Distinguir prompts del sistema y del usuario, y aplicar historial, RAG y buenas prácticas de instrucciones.
  • Identificar los componentes de agentes de IA y la colaboración en sistemas multiagente.

La ha ganado visibilidad porque crea material original con apariencia humana, como poesía, prosa, imágenes y código. El resultado puede parecer extraordinario, pero nace de métodos matemáticos perfeccionados durante años de investigación en estadística, ciencia de datos y aprendizaje automático.

Comprender estos mecanismos a alto nivel ayuda a evaluar la tecnología actual y a descubrir posibilidades futuras. También explica por qué los modelos generativos impulsan agentes capaces de buscar información, elegir los siguientes pasos y completar tareas.

El material original de Microsoft Learn puede estudiarse en vídeo o mediante texto e imágenes. La versión escrita suele contener más detalles y puede complementar la presentación audiovisual.

2. Modelos de lenguaje y predicción de finalizaciones

Los modelos de lenguaje grandes, o LLM, y sus familiares más compactos, los modelos de lenguaje pequeños, o SLM, codifican relaciones entre palabras, fragmentos y significados de un vocabulario. Esas relaciones permiten razonar sobre entradas de lenguaje natural y generar respuestas coherentes y pertinentes.

En esencia, el entrenamiento enseña al modelo a completar secuencias iniciadas por un prompt. Se parece al texto predictivo del móvil, pero a una escala mucho mayor: en cada paso, el modelo considera lo ya escrito, estima qué elementos influyen más en la continuación y elige un siguiente probable.

En “Oí a un perro...”, por ejemplo, “oí” indica que podría aparecer un sonido y “perro” sugiere sonidos asociados al animal. Una persona predice “ladrar” porque dispone de vocabulario, conoce estructuras lingüísticas y relaciona palabras con conceptos. El entrenamiento busca dar capacidades comparables al modelo.

Bases de una predicción lingüística.
BaseContribución
Vocabulario amplioAporta muchas unidades posibles para construir la continuación.
Estructura lingüísticaRepresenta patrones de orden y relaciones que forman frases con sentido.
SemánticaRelaciona palabras y fragmentos con conceptos, contextos y usos semejantes.

3. Tokenización: del texto a identificadores

El primer paso consiste en crear un vocabulario muy grande a partir de extensos conjuntos de entrenamiento, incluido contenido público de Internet y otras fuentes. Los modelos actuales pueden trabajar con cientos de miles de .

Un no se limita a una palabra completa. El vocabulario también puede contener subpalabras, signos de puntuación y secuencias habituales de caracteres. Por tanto, un prefijo como “in” en “increíble” puede ser una unidad propia. Cada distinto recibe un identificador entero único y las repeticiones reutilizan ese ID.

Ejemplo didáctico de tokenización por palabras.
ID
Yo1
2
un3
perro4
ladrar5
fuerte6
a7
gato8

El ejemplo usa palabras enteras para simplificar. En un modelo real también participan subpalabras y puntuación, y el vocabulario crece al procesar más datos de entrenamiento.

4. Transformer: codificador, atención y decodificador

Los ID por sí solos no expresan significado. Cada recibe inicialmente un vector, es decir, una lista de números. El transformer convierte esos vectores iniciales en representaciones con propiedades lingüísticas y semánticas. Como dichas propiedades quedan incorporadas al vector, el resultado se denomina embedding.

Una explicación simplificada divide el transformer en dos bloques. El codificador crea embeddings mediante atención: examina un en el contexto de sus vecinos, asigna pesos de influencia y envía el resultado a una red neuronal totalmente conectada. La atención multicabezal evalúa varias características en paralelo para mejorar la eficiencia.

El decodificador usa los embeddings para estimar el próximo de una secuencia iniciada por un prompt. También combina atención y una red prealimentada. La arquitectura real es más amplia; la idea clave es que la atención captura características de cada según los contextos en los que se usa.

Flujo desde tokens hasta codificador, embeddings, decodificador y siguiente token.
El SVG redibuja la arquitectura conceptual: y posición entran en el codificador, los embeddings aportan contexto y el decodificador predice la continuación.

5. Posición, atención y embeddings

Antes del entrenamiento, los valores de los vectores pueden comenzar de forma aleatoria. Entran en el modelo junto con una codificación posicional porque el orden modifica el significado y las relaciones. Una tabla didáctica puede usar tres dimensiones, mientras que los vectores reales contienen miles de elementos.

Durante el entrenamiento, la atención evalúa cada en contexto. En “Oí a un perro ladrar”, “oí” y “perro” influyen más sobre “ladrar” que artículos o pronombres. Al principio el modelo desconoce esos pesos; la exposición repetida a grandes colecciones de texto revela patrones de proximidad y frecuencia, y sus parámetros se ajustan iterativamente.

El resultado es un espacio vectorial donde usados en situaciones parecidas apuntan en direcciones semejantes. Los embeddings de “perro”, “cachorro” y “gato” suelen estar más próximos que los de “coche” o “monopatín”. La similitud de coseno mide matemáticamente esta cercanía semántica.

Representación simplificada de embeddings en un espacio vectorial.
Los vectores relacionados semánticamente apuntan en direcciones parecidas; un modelo real usa muchas más de tres dimensiones.

6. Cómo genera una finalización el decodificador

Cuando los embeddings ya representan relaciones contextuales, el decodificador predice la continuación a . Durante el entrenamiento utiliza atención enmascarada: al predecir una posición, solo puede considerar los anteriores e ignora los posteriores.

Como la secuencia correcta se conoce durante el entrenamiento, la predicción puede compararse con el siguiente real. El error guía los ajustes de pesos en iteraciones posteriores. Durante la generación, el próximo es desconocido; la atención y la red prealimentada puntúan candidatos, se añade el elegido y el ciclo continúa hasta predecir el final.

Ante “Cuando mi perro era un...”, el contexto hace que “cachorro” sea más probable que “gato” o “monopatín”. La salida completa surge de condicionar cada nueva predicción en todo lo generado hasta ese momento.

7. Prompts del sistema y del usuario

Un prompt es la entrada enviada a un LLM para obtener una finalización. Puede ser una pregunta, una orden o un comentario informal que inicia una conversación.

Los dos tipos principales de prompt.
TipoResponsabilidadEjemplo reformulado
Prompt del sistemaEstablece comportamiento, tono, rol y restricciones persistentes.Actúa como asistente útil y responde de manera cordial.
Prompt del usuarioSolicita una respuesta a una pregunta o instrucción concreta.Resume para un ejecutivo la adopción de en un máximo de seis puntos profesionales.

Normalmente, la aplicación proporciona el prompt del sistema. El prompt del usuario puede escribirlo una persona en el chat o generarlo la aplicación en su nombre. La respuesta debe resolver la petición concreta respetando las instrucciones generales.

Prompts del sistema y del usuario que entran en un modelo de lenguaje.
El sistema fija las reglas globales; el usuario aporta la tarea que produce una finalización.

8. Historial de conversación y RAG

Las aplicaciones conversacionales suelen conservar el historial e incluir versiones resumidas de turnos anteriores en prompts posteriores. Esto mantiene la continuidad y permite entender una pregunta como “¿Cuáles son los riesgos de privacidad?” después de hablar sobre adopción corporativa de .

Historial resumido que conserva el contexto conversacional.
Los mensajes anteriores y la nueva pregunta forman un contexto para producir una respuesta coherente.

La generación aumentada por recuperación, o RAG, incorpora contexto externo. La aplicación busca en documentos, correos u otras fuentes, selecciona fragmentos pertinentes y los incluye en el prompt. Así, la respuesta se fundamenta en la información recuperada y no solo en el conocimiento general del modelo.

Un asistente de gastos puede recibir una pregunta sobre el límite para viajes, buscar la política interna, recuperar la sección relevante y enviarla junto con la consulta. Sin recuperación, el modelo probablemente recomendaría consultar la política; con RAG puede responder según las reglas reales de la organización.

Flujo RAG entre pregunta, recuperación, prompt aumentado y respuesta fundamentada.
RAG conecta una pregunta con fuentes pertinentes y fundamenta la finalización del modelo.

9. Cómo escribir prompts mejores

La calidad de la respuesta depende tanto del modelo elegido como de las instrucciones recibidas. Un prompt bien diseñado reduce ambigüedades y comunica de forma explícita el resultado esperado.

  • Sé claro y específico: formula la pregunta o tarea sin expresiones vagas.
  • Añade contexto: indica tema, audiencia, objetivo y formato esperado.
  • Incluye ejemplos cuando quieras reproducir un estilo o patrón concreto.
  • Pide una estructura: solicita viñetas, tablas, pasos numerados u otro formato útil.
Cuatro recomendaciones para mejorar prompts.
Claridad, contexto, ejemplos y estructura facilitan que el modelo siga la intención.

10. Agentes de IA y sistemas multiagente

Un agente de IA es una aplicación de que hace más que responder. Razona sobre lenguaje natural, usa herramientas, considera las condiciones del contexto y ejecuta una acción adecuada en nombre del usuario.

Los tres elementos de un agente.
ElementoFunción
Modelo de lenguaje grandeAporta el núcleo de comprensión del lenguaje y razonamiento.
InstruccionesUn prompt del sistema describe el rol, el comportamiento y los límites del agente.
HerramientasLas de conocimiento acceden a búsquedas y bases de datos; las de acción envían correos, actualizan calendarios o controlan dispositivos.
Modelo, instrucciones y herramientas reunidos en un agente de IA.
Los tres componentes permiten convertir contexto en una acción controlada.

Los agentes también pueden colaborar. En un sistema multiagente, cada participante tiene una especialidad: uno recopila datos, otro los analiza y un tercero ejecuta la acción. Intercambian prompts para identificar tareas, asignar responsabilidades y compartir resultados, creando flujos capaces de resolver procesos más complejos.

Sistema multiagente con especialistas en recopilación, análisis y acción.
La coordinación mediante prompts divide un flujo complejo entre agentes especializados.

11. Exploración práctica y comprobación de conocimientos

El ejercicio del módulo utiliza un chat playground para interactuar con un modelo generativo y observar en la práctica el efecto de los prompts del sistema, las herramientas y la fundamentación con datos.

Captura original del chat playground utilizado en el ejercicio de IA generativa.
Se conserva el print de la interfaz real en PNG según la regla para capturas de pantalla.

Preguntas reformuladas

  1. ¿Qué describe un LLM: un modelo que genera texto parecido al humano, uno exclusivo para imágenes o un pequeño modelo móvil?
  2. ¿Para qué sirve la tokenización: ordenar palabras, dividir el texto en unidades menores o convertir directamente el mensaje a binario?
  3. ¿Qué son embeddings: palabras adicionales, SLM especializados o vectores de que capturan significado?
  4. ¿Qué hace la atención: elimina palabras, evalúa relaciones entre próximos o filtra contenido inapropiado?
  5. ¿Para qué sirve un prompt del sistema: aportar contexto e instrucciones, elegir el sistema operativo o guardar preferencias?
  6. En IA, ¿qué es un agente: un sistema que ejecuta tareas para el usuario, un modelo secreto o un operador humano de escalado?

Respuestas

  • Un LLM es un modelo de IA diseñado para comprender y generar texto con características humanas.
  • La tokenización divide el texto en unidades menores que reciben identificadores.
  • Los embeddings son representaciones vectoriales que incorporan propiedades semánticas y contextuales.
  • La atención examina cómo cada se relaciona y recibe influencia de los cercanos.
  • El prompt del sistema aporta contexto global, comportamiento y restricciones al modelo.
  • Un agente es un sistema de IA que usa herramientas y realiza tareas en nombre del usuario.

12. Resumen del capítulo

  • Los LLM y SLM aprenden relaciones lingüísticas y semánticas para predecir finalizaciones.
  • La tokenización crea unidades identificadas; los transformers convierten vectores iniciales en embeddings contextuales.
  • Atención, codificación posicional y similitud vectorial representan contexto y proximidad semántica.
  • El decodificador usa atención enmascarada y genera la salida iterativamente, a .
  • Prompts del sistema y del usuario, historial y RAG controlan el comportamiento y aportan contexto.
  • Los agentes combinan modelo, instrucciones y herramientas; los sistemas multiagente distribuyen flujos complejos entre especialistas.