Introducción a la inteligencia artificial: cargas de trabajo e IA responsable
Volver a la ruta AI-901
AI-901Capítulo 1

Preparación para la Certificación Microsoft AI-901

Introducción a la inteligencia artificial: cargas de trabajo e IA responsable

IA generativa, agentes, lenguaje natural, voz, visión artificial, extracción de información y los seis principios de IA responsable

Tiempo de estudio sugerido: 30 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA generativa, visión, voz, nube y agentes

1. Introducción a las cargas de trabajo de inteligencia artificial

Objetivos de aprendizaje

  • Reconocer las capacidades principales de IA: generación de contenido, agentes, lenguaje, voz, visión artificial y extracción de información.
  • Distinguir modelos de lenguaje grandes y pequeños, prompts, instrucciones y herramientas de agentes.
  • Explicar el análisis de texto, el reconocimiento y la síntesis de voz, las tareas de visión y OCR.
  • Aplicar los seis principios de IA responsable a casos prácticos.

Este capítulo ofrece un recorrido conceptual por las capacidades esenciales de la inteligencia artificial. Su objetivo es crear intuición sobre qué hace cada carga de trabajo y cuándo resulta útil, sin exigir programación ni matemáticas de modelos de aprendizaje automático.

Microsoft Learn ofrece el módulo original en vídeo y como texto con imágenes. La experiencia escrita suele aportar más detalle y puede complementar la presentación audiovisual.

Ask Anton muestra cómo una aplicación de IA puede responder preguntas sobre el contenido. La experiencia basada en requiere una suscripción que permita crear un proyecto de e implementar un modelo. La alternativa del navegador ejecuta modelos localmente y puede buscar documentación. Ask Anton es un ejemplo educativo, no un producto de Microsoft con soporte ni un componente oficial de Microsoft Learn o AI Skills Navigator.

Mapa de las cargas de trabajo de inteligencia artificial del capítulo.
La introducción conecta seis familias de capacidades de IA que suelen trabajar juntas.

2. y modelos de lenguaje

La crea contenido nuevo. La salida puede ser una conversación en lenguaje natural, una imagen, vídeo, código u otro formato. Por ejemplo, un sitio sobre historia de la informática puede ofrecer un chat que componga respuestas originales sobre personas, tecnologías y acontecimientos.

Captura de pantalla original del Computing History Agent respondiendo una pregunta.
Captura original de la interfaz: la conversación convierte el archivo histórico en una experiencia interactiva.

La generación depende de un modelo de lenguaje entrenado con grandes cantidades de datos, incluidos documentos públicos y contenidos de Internet. El usuario envía un prompt - una pregunta o instrucción en lenguaje natural - y el modelo usa relaciones semánticas aprendidas para construir una secuencia coherente.

Los modelos de lenguaje grandes, o LLM, tienen muchos parámetros y suelen generalizar bien en tareas variadas, aunque pueden costar más al entrenar y operar. Los modelos de lenguaje pequeños, o SLM, pueden adaptarse mejor a dominios concretos, aplicaciones locales y agentes en dispositivos donde importan el tamaño y el costo.

Flujo entre prompt, modelo de lenguaje, respuesta y componentes de un agente.
La generación transforma un prompt en una respuesta nueva; el agente añade instrucciones y herramientas.

3. Agentes de IA

Un agente es una aplicación basada en que puede interpretar y producir lenguaje, razonar sobre una solicitud, usar herramientas para automatizar tareas y responder a las condiciones del contexto antes de actuar.

Elementos centrales de un agente de IA.
ElementoPropósito
Modelo de lenguajeAporta comprensión del lenguaje y razonamiento.
InstruccionesUn prompt del sistema define función, comportamiento, límites y forma de trabajo.
HerramientasConectan el agente con conocimiento, como buscadores y bases de datos, o con acciones, como enviar correo, actualizar calendarios y controlar dispositivos.

Esta combinación permite crear asistentes digitales que colaboran con personas y automatizan etapas de trabajo. Un agente puede recuperar información, escoger una herramienta adecuada y actuar dentro de los permisos otorgados.

  • Bots conversacionales.
  • Asistentes que automatizan tareas.
  • Borradores de documentos y otros contenidos.
  • Traducción automática.
  • Resumen o explicación de documentos complejos.

4. Texto y procesamiento del lenguaje natural

El procesamiento del lenguaje natural, o NLP, reúne modelos y técnicas para interpretar el lenguaje humano. Sustenta los LLM de y también herramientas especializadas de análisis textual que buscan resultados predecibles o reglas personalizadas.

Captura original del agente extrayendo personas, lugares y fechas de un texto.
El ejemplo combina resumen y extracción de entidades de un artículo histórico.
Técnicas habituales de análisis de texto.
TécnicaResultado
Detección de idiomaIdentifica uno o varios idiomas y suele iniciar flujos de procesamiento con varias etapas.
Clasificación y sentimientoAsigna una categoría y puede estimar si el texto expresa una opinión positiva, negativa o neutra.
Extracción de términos y entidadesLocaliza frases importantes y menciones de personas, lugares y organizaciones. Una variante detecta y oculta PII, como nombres, direcciones y teléfonos.
ResumenReduce el volumen del texto conservando las ideas principales.
Flujo de procesamiento del lenguaje natural.
El flujo puede detectar idioma, clasificar, extraer entidades y PII y después resumir o activar una acción.
  • Analizar documentos y transcripciones de llamadas o reuniones para descubrir temas y entidades.
  • Evaluar sentimiento en redes sociales, opiniones de productos y artículos.
  • Crear bots de preguntas frecuentes o diálogos predecibles sin la complejidad de la .
  • Ocultar PII antes de compartir o analizar datos para cumplir normas de privacidad y legislación.

5. Reconocimiento y síntesis de voz

Las capacidades de voz permiten interactuar con aplicaciones y agentes mediante lenguaje hablado. En el ejemplo histórico, un micrófono recibe preguntas y la aplicación puede devolver una respuesta sintetizada.

Captura de pantalla original del agente recibiendo una pregunta hablada.
La interfaz de ejemplo demuestra una conversación habilitada para voz.

El reconocimiento de voz convierte una señal de audio en texto para que la aplicación interprete las palabras. La síntesis de voz hace el recorrido inverso y transforma texto en audio. Juntas, ambas capacidades ofrecen una interacción oral completa.

La tecnología mejora con rapidez para separar la voz del ruido, reconocer interrupciones y crear voces más expresivas y humanas.

Flujos de voz a texto y de texto a voz.
El reconocimiento transcribe audio; la síntesis vocaliza el texto.
  • Agentes que entienden órdenes habladas y responden en voz alta.
  • Transcripción de llamadas y reuniones.
  • Descripciones de audio para vídeo o texto.
  • Traducción automática de voz entre idiomas.

6. artificial

La visión artificial analiza entradas visuales como fotografías, vídeos y transmisiones de cámaras. Un sitio de historia informática podría recibir una foto de un equipo antiguo para identificarlo y describirlo.

Captura original del agente analizando la imagen de un equipo antiguo.
El ejemplo muestra cómo se identifica y describe una entrada visual.

Los modelos de visión aprenden patrones a partir de grandes colecciones de imágenes. La tarea determina las etiquetas de entrenamiento y la forma de la predicción.

Cuatro tipos de modelo de visión artificial.
TareaResultado
Clasificación de imágenesPredice la etiqueta más adecuada para el tema principal de una imagen sin etiquetar.
Detección de objetosIdentifica objetos específicos y su ubicación.
Segmentación semánticaAsigna píxeles individuales a un objeto en lugar de limitarse a dibujar un cuadro.
Modelos multimodalesCombinan características visuales y descripciones textuales para interpretar imágenes con mayor contexto.
Comparación de clasificación, detección, segmentación y modelos multimodales.
Cada tarea de visión responde una pregunta distinta sobre el contenido visual.
  • Agentes que interpretan imágenes.
  • Etiquetas y subtítulos automáticos.
  • Búsqueda visual.
  • Control de inventario e identificación de artículos en tiendas.
  • Videovigilancia.
  • Autenticación por reconocimiento facial.
  • Robótica y vehículos autónomos.

7. Extracción de información

La IA puede localizar datos y descubrir conocimiento en fuentes no estructuradas, como documentos digitalizados, formularios, imágenes y grabaciones de audio o vídeo. En el ejemplo, los números de serie leídos en fotos permiten averiguar el equipo de origen.

Captura original del agente leyendo un número de serie en una imagen.
La aplicación combina visión e interpretación textual para identificar el componente.

El reconocimiento óptico de caracteres, u OCR, localiza texto dentro de una imagen. Un modelo analítico interpreta después los valores y los asigna a campos, como proveedor, fecha, importe e impuesto de un recibo de gastos.

La extracción tradicional se centraba en formularios de texto, mientras que modelos recientes también obtienen información de imágenes, audio y vídeo. El objetivo es convertir contenido variado en datos estructurados para búsqueda y procesos empresariales.

Flujo de extracción para documentos, imágenes, audio y vídeo.
OCR y modelos analíticos transforman contenido no estructurado en campos, búsqueda y automatización.
  • Procesamiento de formularios como solicitudes de gastos.
  • Digitalización a gran escala de registros en papel, como archivos censales.
  • Indexación documental para búsqueda.
  • Detección de puntos importantes y acciones posteriores en reuniones grabadas o transcritas.

8. Principios de IA responsable

La IA responsable combina prácticas y barreras de protección para reducir contenido o acciones dañinas, ilegales u ofensivas. Los filtros ayudan, pero la responsabilidad debe formar parte de la concepción, el diseño, la implementación y la operación.

Captura original de una respuesta rechazada por motivos de seguridad.
El ejemplo muestra una barrera que bloquea información capaz de fomentar actividades perjudiciales.
Seis principios de IA responsable.
PrincipioAplicación
EquidadLos datos seleccionados por personas pueden contener sesgos; hay que evaluar entrenamiento y resultados para reducir discriminación.
Confiabilidad y seguridadLos modelos probabilísticos pueden fallar; la aplicación debe reconocer incertidumbre, fijar límites y mitigar riesgos.
Privacidad y seguridadLos datos pueden incluir información personal u organizativa; datos y modelos deben protegerse frente a exposición.
InclusiónLos beneficios de la IA deben ser accesibles y el sistema no debe excluir grupos de usuarios.
TransparenciaLas personas deben saber que interviene IA y conocer, de manera adecuada, su funcionamiento y limitaciones.
ResponsabilidadPersonas y organizaciones siguen respondiendo por los sistemas que crean y distribuyen, con apoyo de un marco de gobernanza.
Los seis principios de IA responsable.
Equidad, confiabilidad y seguridad, privacidad y seguridad, inclusión, transparencia y responsabilidad trabajan conjuntamente.

9. Aplicación de IA responsable en escenarios reales

  • Admisión universitaria: comprobar criterios académicos relevantes sin discriminación demográfica injustificada.
  • Robótica guiada por visión: usar la confianza de la predicción y detener acciones físicas por debajo del umbral seguro.
  • Identificación facial en zonas seguras: eliminar imágenes temporales cuando ya no se necesiten y limitar el acceso.
  • Agentes de voz: incluir subtítulos para personas con discapacidad auditiva.
  • Crédito bancario con IA: informar sobre el uso de IA y describir características relevantes de los datos sin revelar información confidencial.

10. Exploración práctica y Ask Anton

El ejercicio del módulo permite experimentar las cargas de trabajo en Computing History Agent. Integra conversación textual, generación, voz, visión y extracción en una sola aplicación.

Captura original de la página inicial del ejercicio Computing History Agent.
Se conserva el print original porque representa la interfaz real de la actividad.

Antes de comenzar, elija la experiencia adecuada. La opción de utiliza recursos de ; la alternativa del navegador reduce la configuración y ejecuta modelos localmente. Ambas son demostraciones educativas y no servicios con soporte.

11. Comprobación de conocimientos

Utilice estas preguntas reformuladas para verificar las diferencias del capítulo y después compare su razonamiento con las respuestas.

  1. ¿Qué definición representa mejor la : una técnica obsoleta, una capacidad limitada a científicos de datos o una forma basada en modelos de crear contenido nuevo desde un prompt?
  2. ¿Un agente de IA es el desarrollador, cualquier usuario de IA o una aplicación que realiza tareas en nombre del usuario?
  3. Cuando una aplicación lee un correo en voz alta, ¿usa reconocimiento de voz, síntesis de voz o análisis de sentimiento?

Respuestas

  • La usa un modelo, normalmente de lenguaje, para producir contenido original en respuesta a un prompt.
  • El agente es la aplicación que combina modelo, instrucciones y herramientas para actuar por el usuario.
  • Leer texto en voz alta es síntesis de voz, porque convierte texto en audio.

12. Resumen del capítulo

  • La crea texto, imágenes, vídeo, código y otros formatos; los agentes añaden instrucciones, herramientas y acción.
  • NLP admite detección de idioma, clasificación, sentimiento, entidades, PII y resumen.
  • El reconocimiento de voz convierte audio en texto y la síntesis convierte texto en audio.
  • La visión artificial incluye clasificación, detección, segmentación y modelos multimodales.
  • La extracción combina OCR y modelos analíticos para estructurar documentos, imágenes, audio y vídeo.
  • La IA responsable se apoya en equidad, confiabilidad y seguridad, privacidad y seguridad, inclusión, transparencia y responsabilidad.