Preparación para la Certificación Microsoft AI-901
IA generativa: LLM, prompts, RAG y agentes de IA
Tokenización, transformers, embeddings, atención, generación de finalizaciones, diseño de prompts y sistemas multiagente
Tiempo de estudio sugerido: 32 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. Introducción a la
Objetivos de aprendizaje
Explicar cómo los modelos de lenguaje grandes y pequeños representan relaciones lingüísticas y semánticas.
Describir tokenización, vectores, embeddings, atención, codificador, decodificador y predicción de finalizaciones.
Distinguir prompts del sistema y del usuario, y aplicar historial, RAG y buenas prácticas de instrucciones.
Identificar los componentes de agentes de IA y la colaboración en sistemas multiagente.
La ha ganado visibilidad porque crea material original con apariencia humana, como poesía, prosa, imágenes y código. El resultado puede parecer extraordinario, pero nace de métodos matemáticos perfeccionados durante años de investigación en estadística, ciencia de datos y aprendizaje automático.
Comprender estos mecanismos a alto nivel ayuda a evaluar la tecnología actual y a descubrir posibilidades futuras. También explica por qué los modelos generativos impulsan agentes capaces de buscar información, elegir los siguientes pasos y completar tareas.
El material original de Microsoft Learn puede estudiarse en vídeo o mediante texto e imágenes. La versión escrita suele contener más detalles y puede complementar la presentación audiovisual.
2. Modelos de lenguaje y predicción de finalizaciones
Los modelos de lenguaje grandes, o LLM, y sus familiares más compactos, los modelos de lenguaje pequeños, o SLM, codifican relaciones entre palabras, fragmentos y significados de un vocabulario. Esas relaciones permiten razonar sobre entradas de lenguaje natural y generar respuestas coherentes y pertinentes.
En esencia, el entrenamiento enseña al modelo a completar secuencias iniciadas por un prompt. Se parece al texto predictivo del móvil, pero a una escala mucho mayor: en cada paso, el modelo considera lo ya escrito, estima qué elementos influyen más en la continuación y elige un siguiente probable.
En “Oí a un perro...”, por ejemplo, “oí” indica que podría aparecer un sonido y “perro” sugiere sonidos asociados al animal. Una persona predice “ladrar” porque dispone de vocabulario, conoce estructuras lingüísticas y relaciona palabras con conceptos. El entrenamiento busca dar capacidades comparables al modelo.
Bases de una predicción lingüística.
Base
Contribución
Vocabulario amplio
Aporta muchas unidades posibles para construir la continuación.
Estructura lingüística
Representa patrones de orden y relaciones que forman frases con sentido.
Semántica
Relaciona palabras y fragmentos con conceptos, contextos y usos semejantes.
3. Tokenización: del texto a identificadores
El primer paso consiste en crear un vocabulario muy grande a partir de extensos conjuntos de entrenamiento, incluido contenido público de Internet y otras fuentes. Los modelos actuales pueden trabajar con cientos de miles de .
Un no se limita a una palabra completa. El vocabulario también puede contener subpalabras, signos de puntuación y secuencias habituales de caracteres. Por tanto, un prefijo como “in” en “increíble” puede ser una unidad propia. Cada distinto recibe un identificador entero único y las repeticiones reutilizan ese ID.
Ejemplo didáctico de tokenización por palabras.
ID
Yo
1
oí
2
un
3
perro
4
ladrar
5
fuerte
6
a
7
gato
8
El ejemplo usa palabras enteras para simplificar. En un modelo real también participan subpalabras y puntuación, y el vocabulario crece al procesar más datos de entrenamiento.
4. Transformer: codificador, atención y decodificador
Los ID por sí solos no expresan significado. Cada recibe inicialmente un vector, es decir, una lista de números. El transformer convierte esos vectores iniciales en representaciones con propiedades lingüísticas y semánticas. Como dichas propiedades quedan incorporadas al vector, el resultado se denomina embedding.
Una explicación simplificada divide el transformer en dos bloques. El codificador crea embeddings mediante atención: examina un en el contexto de sus vecinos, asigna pesos de influencia y envía el resultado a una red neuronal totalmente conectada. La atención multicabezal evalúa varias características en paralelo para mejorar la eficiencia.
El decodificador usa los embeddings para estimar el próximo de una secuencia iniciada por un prompt. También combina atención y una red prealimentada. La arquitectura real es más amplia; la idea clave es que la atención captura características de cada según los contextos en los que se usa.
El SVG redibuja la arquitectura conceptual: y posición entran en el codificador, los embeddings aportan contexto y el decodificador predice la continuación.
5. Posición, atención y embeddings
Antes del entrenamiento, los valores de los vectores pueden comenzar de forma aleatoria. Entran en el modelo junto con una codificación posicional porque el orden modifica el significado y las relaciones. Una tabla didáctica puede usar tres dimensiones, mientras que los vectores reales contienen miles de elementos.
Durante el entrenamiento, la atención evalúa cada en contexto. En “Oí a un perro ladrar”, “oí” y “perro” influyen más sobre “ladrar” que artículos o pronombres. Al principio el modelo desconoce esos pesos; la exposición repetida a grandes colecciones de texto revela patrones de proximidad y frecuencia, y sus parámetros se ajustan iterativamente.
El resultado es un espacio vectorial donde usados en situaciones parecidas apuntan en direcciones semejantes. Los embeddings de “perro”, “cachorro” y “gato” suelen estar más próximos que los de “coche” o “monopatín”. La similitud de coseno mide matemáticamente esta cercanía semántica.
Los vectores relacionados semánticamente apuntan en direcciones parecidas; un modelo real usa muchas más de tres dimensiones.
6. Cómo genera una finalización el decodificador
Cuando los embeddings ya representan relaciones contextuales, el decodificador predice la continuación a . Durante el entrenamiento utiliza atención enmascarada: al predecir una posición, solo puede considerar los anteriores e ignora los posteriores.
Como la secuencia correcta se conoce durante el entrenamiento, la predicción puede compararse con el siguiente real. El error guía los ajustes de pesos en iteraciones posteriores. Durante la generación, el próximo es desconocido; la atención y la red prealimentada puntúan candidatos, se añade el elegido y el ciclo continúa hasta predecir el final.
Ante “Cuando mi perro era un...”, el contexto hace que “cachorro” sea más probable que “gato” o “monopatín”. La salida completa surge de condicionar cada nueva predicción en todo lo generado hasta ese momento.
7. Prompts del sistema y del usuario
Un prompt es la entrada enviada a un LLM para obtener una finalización. Puede ser una pregunta, una orden o un comentario informal que inicia una conversación.
Los dos tipos principales de prompt.
Tipo
Responsabilidad
Ejemplo reformulado
Prompt del sistema
Establece comportamiento, tono, rol y restricciones persistentes.
Actúa como asistente útil y responde de manera cordial.
Prompt del usuario
Solicita una respuesta a una pregunta o instrucción concreta.
Resume para un ejecutivo la adopción de en un máximo de seis puntos profesionales.
Normalmente, la aplicación proporciona el prompt del sistema. El prompt del usuario puede escribirlo una persona en el chat o generarlo la aplicación en su nombre. La respuesta debe resolver la petición concreta respetando las instrucciones generales.
El sistema fija las reglas globales; el usuario aporta la tarea que produce una finalización.
8. Historial de conversación y RAG
Las aplicaciones conversacionales suelen conservar el historial e incluir versiones resumidas de turnos anteriores en prompts posteriores. Esto mantiene la continuidad y permite entender una pregunta como “¿Cuáles son los riesgos de privacidad?” después de hablar sobre adopción corporativa de .
Los mensajes anteriores y la nueva pregunta forman un contexto para producir una respuesta coherente.
La generación aumentada por recuperación, o RAG, incorpora contexto externo. La aplicación busca en documentos, correos u otras fuentes, selecciona fragmentos pertinentes y los incluye en el prompt. Así, la respuesta se fundamenta en la información recuperada y no solo en el conocimiento general del modelo.
Un asistente de gastos puede recibir una pregunta sobre el límite para viajes, buscar la política interna, recuperar la sección relevante y enviarla junto con la consulta. Sin recuperación, el modelo probablemente recomendaría consultar la política; con RAG puede responder según las reglas reales de la organización.
RAG conecta una pregunta con fuentes pertinentes y fundamenta la finalización del modelo.
9. Cómo escribir prompts mejores
La calidad de la respuesta depende tanto del modelo elegido como de las instrucciones recibidas. Un prompt bien diseñado reduce ambigüedades y comunica de forma explícita el resultado esperado.
Sé claro y específico: formula la pregunta o tarea sin expresiones vagas.
Añade contexto: indica tema, audiencia, objetivo y formato esperado.
Incluye ejemplos cuando quieras reproducir un estilo o patrón concreto.
Pide una estructura: solicita viñetas, tablas, pasos numerados u otro formato útil.
Claridad, contexto, ejemplos y estructura facilitan que el modelo siga la intención.
10. Agentes de IA y sistemas multiagente
Un agente de IA es una aplicación de que hace más que responder. Razona sobre lenguaje natural, usa herramientas, considera las condiciones del contexto y ejecuta una acción adecuada en nombre del usuario.
Los tres elementos de un agente.
Elemento
Función
Modelo de lenguaje grande
Aporta el núcleo de comprensión del lenguaje y razonamiento.
Instrucciones
Un prompt del sistema describe el rol, el comportamiento y los límites del agente.
Herramientas
Las de conocimiento acceden a búsquedas y bases de datos; las de acción envían correos, actualizan calendarios o controlan dispositivos.
Los tres componentes permiten convertir contexto en una acción controlada.
Los agentes también pueden colaborar. En un sistema multiagente, cada participante tiene una especialidad: uno recopila datos, otro los analiza y un tercero ejecuta la acción. Intercambian prompts para identificar tareas, asignar responsabilidades y compartir resultados, creando flujos capaces de resolver procesos más complejos.
La coordinación mediante prompts divide un flujo complejo entre agentes especializados.
11. Exploración práctica y comprobación de conocimientos
El ejercicio del módulo utiliza un chat playground para interactuar con un modelo generativo y observar en la práctica el efecto de los prompts del sistema, las herramientas y la fundamentación con datos.
Se conserva el print de la interfaz real en PNG según la regla para capturas de pantalla.