Preparación para la Certificación Microsoft AI-901
Introducción a la inteligencia artificial: cargas de trabajo e IA responsable
IA generativa, agentes, lenguaje natural, voz, visión artificial, extracción de información y los seis principios de IA responsable
Tiempo de estudio sugerido: 30 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. Introducción a las cargas de trabajo de inteligencia artificial
Objetivos de aprendizaje
Reconocer las capacidades principales de IA: generación de contenido, agentes, lenguaje, voz, visión artificial y extracción de información.
Distinguir modelos de lenguaje grandes y pequeños, prompts, instrucciones y herramientas de agentes.
Explicar el análisis de texto, el reconocimiento y la síntesis de voz, las tareas de visión y OCR.
Aplicar los seis principios de IA responsable a casos prácticos.
Este capítulo ofrece un recorrido conceptual por las capacidades esenciales de la inteligencia artificial. Su objetivo es crear intuición sobre qué hace cada carga de trabajo y cuándo resulta útil, sin exigir programación ni matemáticas de modelos de aprendizaje automático.
Microsoft Learn ofrece el módulo original en vídeo y como texto con imágenes. La experiencia escrita suele aportar más detalle y puede complementar la presentación audiovisual.
Ask Anton muestra cómo una aplicación de IA puede responder preguntas sobre el contenido. La experiencia basada en requiere una suscripción que permita crear un proyecto de e implementar un modelo. La alternativa del navegador ejecuta modelos localmente y puede buscar documentación. Ask Anton es un ejemplo educativo, no un producto de Microsoft con soporte ni un componente oficial de Microsoft Learn o AI Skills Navigator.
La introducción conecta seis familias de capacidades de IA que suelen trabajar juntas.
2. y modelos de lenguaje
La crea contenido nuevo. La salida puede ser una conversación en lenguaje natural, una imagen, vídeo, código u otro formato. Por ejemplo, un sitio sobre historia de la informática puede ofrecer un chat que componga respuestas originales sobre personas, tecnologías y acontecimientos.
Captura original de la interfaz: la conversación convierte el archivo histórico en una experiencia interactiva.
La generación depende de un modelo de lenguaje entrenado con grandes cantidades de datos, incluidos documentos públicos y contenidos de Internet. El usuario envía un prompt - una pregunta o instrucción en lenguaje natural - y el modelo usa relaciones semánticas aprendidas para construir una secuencia coherente.
Los modelos de lenguaje grandes, o LLM, tienen muchos parámetros y suelen generalizar bien en tareas variadas, aunque pueden costar más al entrenar y operar. Los modelos de lenguaje pequeños, o SLM, pueden adaptarse mejor a dominios concretos, aplicaciones locales y agentes en dispositivos donde importan el tamaño y el costo.
La generación transforma un prompt en una respuesta nueva; el agente añade instrucciones y herramientas.
3. Agentes de IA
Un agente es una aplicación basada en que puede interpretar y producir lenguaje, razonar sobre una solicitud, usar herramientas para automatizar tareas y responder a las condiciones del contexto antes de actuar.
Elementos centrales de un agente de IA.
Elemento
Propósito
Modelo de lenguaje
Aporta comprensión del lenguaje y razonamiento.
Instrucciones
Un prompt del sistema define función, comportamiento, límites y forma de trabajo.
Herramientas
Conectan el agente con conocimiento, como buscadores y bases de datos, o con acciones, como enviar correo, actualizar calendarios y controlar dispositivos.
Esta combinación permite crear asistentes digitales que colaboran con personas y automatizan etapas de trabajo. Un agente puede recuperar información, escoger una herramienta adecuada y actuar dentro de los permisos otorgados.
Bots conversacionales.
Asistentes que automatizan tareas.
Borradores de documentos y otros contenidos.
Traducción automática.
Resumen o explicación de documentos complejos.
4. Texto y procesamiento del lenguaje natural
El procesamiento del lenguaje natural, o NLP, reúne modelos y técnicas para interpretar el lenguaje humano. Sustenta los LLM de y también herramientas especializadas de análisis textual que buscan resultados predecibles o reglas personalizadas.
El ejemplo combina resumen y extracción de entidades de un artículo histórico.
Técnicas habituales de análisis de texto.
Técnica
Resultado
Detección de idioma
Identifica uno o varios idiomas y suele iniciar flujos de procesamiento con varias etapas.
Clasificación y sentimiento
Asigna una categoría y puede estimar si el texto expresa una opinión positiva, negativa o neutra.
Extracción de términos y entidades
Localiza frases importantes y menciones de personas, lugares y organizaciones. Una variante detecta y oculta PII, como nombres, direcciones y teléfonos.
Resumen
Reduce el volumen del texto conservando las ideas principales.
El flujo puede detectar idioma, clasificar, extraer entidades y PII y después resumir o activar una acción.
Analizar documentos y transcripciones de llamadas o reuniones para descubrir temas y entidades.
Evaluar sentimiento en redes sociales, opiniones de productos y artículos.
Crear bots de preguntas frecuentes o diálogos predecibles sin la complejidad de la .
Ocultar PII antes de compartir o analizar datos para cumplir normas de privacidad y legislación.
5. Reconocimiento y síntesis de voz
Las capacidades de voz permiten interactuar con aplicaciones y agentes mediante lenguaje hablado. En el ejemplo histórico, un micrófono recibe preguntas y la aplicación puede devolver una respuesta sintetizada.
La interfaz de ejemplo demuestra una conversación habilitada para voz.
El reconocimiento de voz convierte una señal de audio en texto para que la aplicación interprete las palabras. La síntesis de voz hace el recorrido inverso y transforma texto en audio. Juntas, ambas capacidades ofrecen una interacción oral completa.
La tecnología mejora con rapidez para separar la voz del ruido, reconocer interrupciones y crear voces más expresivas y humanas.
El reconocimiento transcribe audio; la síntesis vocaliza el texto.
Agentes que entienden órdenes habladas y responden en voz alta.
Transcripción de llamadas y reuniones.
Descripciones de audio para vídeo o texto.
Traducción automática de voz entre idiomas.
6. artificial
La visión artificial analiza entradas visuales como fotografías, vídeos y transmisiones de cámaras. Un sitio de historia informática podría recibir una foto de un equipo antiguo para identificarlo y describirlo.
El ejemplo muestra cómo se identifica y describe una entrada visual.
Los modelos de visión aprenden patrones a partir de grandes colecciones de imágenes. La tarea determina las etiquetas de entrenamiento y la forma de la predicción.
Cuatro tipos de modelo de visión artificial.
Tarea
Resultado
Clasificación de imágenes
Predice la etiqueta más adecuada para el tema principal de una imagen sin etiquetar.
Detección de objetos
Identifica objetos específicos y su ubicación.
Segmentación semántica
Asigna píxeles individuales a un objeto en lugar de limitarse a dibujar un cuadro.
Modelos multimodales
Combinan características visuales y descripciones textuales para interpretar imágenes con mayor contexto.
Cada tarea de visión responde una pregunta distinta sobre el contenido visual.
Agentes que interpretan imágenes.
Etiquetas y subtítulos automáticos.
Búsqueda visual.
Control de inventario e identificación de artículos en tiendas.
Videovigilancia.
Autenticación por reconocimiento facial.
Robótica y vehículos autónomos.
7. Extracción de información
La IA puede localizar datos y descubrir conocimiento en fuentes no estructuradas, como documentos digitalizados, formularios, imágenes y grabaciones de audio o vídeo. En el ejemplo, los números de serie leídos en fotos permiten averiguar el equipo de origen.
La aplicación combina visión e interpretación textual para identificar el componente.
El reconocimiento óptico de caracteres, u OCR, localiza texto dentro de una imagen. Un modelo analítico interpreta después los valores y los asigna a campos, como proveedor, fecha, importe e impuesto de un recibo de gastos.
La extracción tradicional se centraba en formularios de texto, mientras que modelos recientes también obtienen información de imágenes, audio y vídeo. El objetivo es convertir contenido variado en datos estructurados para búsqueda y procesos empresariales.
OCR y modelos analíticos transforman contenido no estructurado en campos, búsqueda y automatización.
Procesamiento de formularios como solicitudes de gastos.
Digitalización a gran escala de registros en papel, como archivos censales.
Indexación documental para búsqueda.
Detección de puntos importantes y acciones posteriores en reuniones grabadas o transcritas.
8. Principios de IA responsable
La IA responsable combina prácticas y barreras de protección para reducir contenido o acciones dañinas, ilegales u ofensivas. Los filtros ayudan, pero la responsabilidad debe formar parte de la concepción, el diseño, la implementación y la operación.
El ejemplo muestra una barrera que bloquea información capaz de fomentar actividades perjudiciales.
Seis principios de IA responsable.
Principio
Aplicación
Equidad
Los datos seleccionados por personas pueden contener sesgos; hay que evaluar entrenamiento y resultados para reducir discriminación.
Confiabilidad y seguridad
Los modelos probabilísticos pueden fallar; la aplicación debe reconocer incertidumbre, fijar límites y mitigar riesgos.
Privacidad y seguridad
Los datos pueden incluir información personal u organizativa; datos y modelos deben protegerse frente a exposición.
Inclusión
Los beneficios de la IA deben ser accesibles y el sistema no debe excluir grupos de usuarios.
Transparencia
Las personas deben saber que interviene IA y conocer, de manera adecuada, su funcionamiento y limitaciones.
Responsabilidad
Personas y organizaciones siguen respondiendo por los sistemas que crean y distribuyen, con apoyo de un marco de gobernanza.
Equidad, confiabilidad y seguridad, privacidad y seguridad, inclusión, transparencia y responsabilidad trabajan conjuntamente.
9. Aplicación de IA responsable en escenarios reales
Admisión universitaria: comprobar criterios académicos relevantes sin discriminación demográfica injustificada.
Robótica guiada por visión: usar la confianza de la predicción y detener acciones físicas por debajo del umbral seguro.
Identificación facial en zonas seguras: eliminar imágenes temporales cuando ya no se necesiten y limitar el acceso.
Agentes de voz: incluir subtítulos para personas con discapacidad auditiva.
Crédito bancario con IA: informar sobre el uso de IA y describir características relevantes de los datos sin revelar información confidencial.
10. Exploración práctica y Ask Anton
El ejercicio del módulo permite experimentar las cargas de trabajo en Computing History Agent. Integra conversación textual, generación, voz, visión y extracción en una sola aplicación.
Se conserva el print original porque representa la interfaz real de la actividad.
Antes de comenzar, elija la experiencia adecuada. La opción de utiliza recursos de ; la alternativa del navegador reduce la configuración y ejecuta modelos localmente. Ambas son demostraciones educativas y no servicios con soporte.
Utilice estas preguntas reformuladas para verificar las diferencias del capítulo y después compare su razonamiento con las respuestas.
¿Qué definición representa mejor la : una técnica obsoleta, una capacidad limitada a científicos de datos o una forma basada en modelos de crear contenido nuevo desde un prompt?
¿Un agente de IA es el desarrollador, cualquier usuario de IA o una aplicación que realiza tareas en nombre del usuario?
Cuando una aplicación lee un correo en voz alta, ¿usa reconocimiento de voz, síntesis de voz o análisis de sentimiento?
Respuestas
La usa un modelo, normalmente de lenguaje, para producir contenido original en respuesta a un prompt.
El agente es la aplicación que combina modelo, instrucciones y herramientas para actuar por el usuario.
Leer texto en voz alta es síntesis de voz, porque convierte texto en audio.
12. Resumen del capítulo
La crea texto, imágenes, vídeo, código y otros formatos; los agentes añaden instrucciones, herramientas y acción.
NLP admite detección de idioma, clasificación, sentimiento, entidades, PII y resumen.
El reconocimiento de voz convierte audio en texto y la síntesis convierte texto en audio.
La visión artificial incluye clasificación, detección, segmentación y modelos multimodales.
La extracción combina OCR y modelos analíticos para estructurar documentos, imágenes, audio y vídeo.
La IA responsable se apoya en equidad, confiabilidad y seguridad, privacidad y seguridad, inclusión, transparencia y responsabilidad.