Preparación para la Certificación Microsoft AI-901
Análisis de texto: tokenización, estadística y modelos semánticos
Preprocesamiento, TF-IDF, bag-of-words, Naive Bayes, TextRank, embeddings, similitud de coseno y aritmética vectorial
Tiempo de estudio sugerido: 36 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn
Por João Ricardo Dutra••Contenido original completo
1. Introducción al análisis de texto
Objetivos de aprendizaje
Explicar cómo la tokenización y el preprocesamiento preparan un corpus.
Aplicar conceptualmente frecuencia, TF-IDF, bag-of-words, Naive Bayes y TextRank.
Interpretar embeddings, similitud de coseno, aritmética vectorial y relaciones semánticas.
Relacionar modelos semánticos con resumen, palabras clave, entidades, clasificación y sentimiento.
El análisis de texto es una disciplina del procesamiento del lenguaje natural, o NLP, que extrae significado, estructura y conocimiento de texto no estructurado. Las organizaciones lo usan para convertir opiniones de clientes, incidencias de soporte, contratos y publicaciones sociales en información útil para decidir.
Las técnicas evolucionaron desde recuentos estadísticos hasta modelos vectoriales capaces de representar significado. Este avance responde a un reto central: el lenguaje humano es complejo y los equipos necesitan representaciones numéricas para analizarlo.
Cargas de trabajo habituales de análisis de texto.
Tarea
Resultado
Detección de idioma
Identifica uno o varios idiomas y suele iniciar un flujo con varias etapas.
Extracción de términos clave
Encuentra palabras y frases importantes para revelar temas.
Detección de entidades
Localiza personas, lugares, fechas, organizaciones y otras entidades con nombre.
Detección de PII
Identifica y puede ocultar nombres, direcciones, teléfonos, cuentas financieras y otros datos confidenciales.
Clasificación de texto
Agrupa documentos por contenido, como correo no deseado o legítimo.
Análisis de sentimiento
Clasifica el tono como positivo, neutro o negativo.
Resumen
Reduce el volumen y conserva los puntos más importantes.
Microsoft Learn ofrece el material original en vídeo y texto. La versión escrita suele aportar más detalle y puede complementar los vídeos.
2. Tokenización de un corpus
El primer paso es dividir la colección de textos, llamada corpus, en . Para simplificar, cada palabra distinta puede considerarse , aunque los sistemas reales también usan subpalabras, combinaciones y puntuación.
En “Elegimos ir a la Luna”, cada aparición ocupa una posición. Si un término se repite, reutiliza su identificador de vocabulario. Esta representación discreta permite contar frecuencias y detectar las palabras dominantes.
Secuencia tokenizada simplificada.
Posición
1
Nosotros
2
elegimos
3
ir
4
a
5
la
6
Luna
La tokenización depende del problema. Una solución puede conservar mayúsculas y puntuación cuando aportan significado, o quitarlas si solo interesa comparar frecuencias.
3. Normalización, stop words y n-gramas
Técnicas de preprocesamiento.
Técnica
Funcionamiento
Consideración
Normalización
Puede quitar puntuación y convertir el texto a minúsculas.
Mejora recuentos simples, pero puede borrar diferencias entre el apellido “Banks”, el sustantivo “banks” y el punto que cierra una oración.
Eliminación de stop words
Excluye palabras funcionales que ayudan a leer, pero aportan poco significado temático.
La lista debe adaptarse al idioma y al dominio.
Extracción de n-gramas
Agrupa secuencias frecuentes: una palabra es unigram, dos forman bigram y tres, trigram.
Expresiones como “inteligencia artificial” o “procesamiento del lenguaje natural” deben mantenerse unidas cuando su sentido depende de la combinación.
4. Stemming, lematización y categorías gramaticales
Stemming consolida variantes eliminando terminaciones como “s”, “ing” y “ed”. Agrupa términos con una raíz común antes del recuento, aunque el fragmento resultante no siempre sea una palabra válida.
La lematización también busca una forma base, o lema, pero aplica reglas lingüísticas y vocabulario. Por eso tiende a devolver palabras reconocibles, como transformar “running” en “run”, en lugar de limitarse a cortar caracteres.
El etiquetado de categorías gramaticales, o POS tagging, marca sustantivos, verbos, adjetivos, adverbios y otras clases. Reglas lingüísticas y modelos estadísticos analizan el y su contexto para elegir la etiqueta.
5. Análisis de frecuencia
Tras tokenizar, normalizar y lematizar, un recuento sencillo muestra cuántas veces aparece cada término. La hipótesis es que las palabras recurrentes ayudan a identificar los temas.
En un texto sobre beneficios empresariales de la IA, los recuentos podrían mostrar “IA” cuatro veces, “empresa” tres y “beneficio”, “cliente”, “decisión” y “mercado” dos veces. El patrón apunta al valor de automatización, análisis predictivo, productividad, personalización y adaptación.
Ejemplo parcial de frecuencia.
Término
Frecuencia
IA
4
empresa
3
beneficio
2
cliente
2
decisión
2
mercado
2
capacidad
1
precisión
1
6. TF-IDF: relevancia entre documentos
La frecuencia bruta funciona en un documento, pero los términos comunes a todo el corpus dificultan distinguir archivos. TF-IDF aumenta el peso de palabras frecuentes en un documento y poco habituales en la colección.
Un ejemplo describe creación declarativa de agentes en Microsoft Copilot Studio mediante lenguaje natural, prompts, plantillas, intenciones, acciones, conexiones, publicación, orquestación, gobernanza y ciclo de vida. Otro presenta desarrollo basado en código en con ,, conversaciones, herramientas, estado, , Python, C#, servicios de IA de Microsoft y CI/CD.
“Agente”, “Microsoft” e “IA” aparecen en ambos y revelan el tema general, pero no los separan. TF-IDF destaca “Copilot”, “Studio” y “declarativo” en el primero, y “código”, “desarrollar” y “Foundry” en el segundo.
TF(t,d) = número de apariciones de t en el documento d
IDF(t) = log(N / df(t))
TF-IDF(t,d) = TF(t,d) × log(N / df(t))
N es el total de documentos y df(t), cuántos contienen el término. Una palabra presente en los dos documentos con N = 2 tiene IDF (2/2) = 0. En el ejemplo, “copilot” y “studio” alcanzan 2,0794, “declarativo” 1,3863; “código”, “desarrollar” y “foundry” llegan a 2,0794 en el otro texto.
7. Bag-of-words, Naive Bayes y clasificación
Bag-of-words representa un documento como vector de apariciones o frecuencias e ignora gramática y orden. Los algoritmos de aprendizaje automático usan ese vector como características de entrada.
Naive Bayes es un clasificador probabilístico basado en el teorema de Bayes. Para filtrar spam, puede aprender que expresiones equivalentes a “cura milagrosa”, “adelgaza rápido” y “antienvejecimiento” aparecen más en mensajes sospechosos y usar esa evidencia para estimar la clase.
La misma estructura admite análisis de sentimiento. Las frecuencias se convierten en características y el modelo estima probabilidades para etiquetas positivas o negativas.
8. TextRank y resumen extractivo
TextRank es un algoritmo no supervisado basado en grafos. Cada oración puede ser un nodo y las aristas se ponderan según la similitud. Como PageRank, parte de que una oración es importante si se parece a otras oraciones importantes.
Construir el grafo con oraciones como nodos y similitud por solapamiento de palabras o coseno entre vectores como peso.
Actualizar iterativamente el rango de cada nodo con las puntuaciones y pesos de sus vecinos; el factor d suele ser 0,85.
Tras la convergencia, seleccionar las oraciones mejor puntuadas.
El grosor de las conexiones representa semejanza; los nodos centrales tienden a formar el resumen extractivo.
En el ejemplo de nube, cinco oraciones tratan recursos bajo demanda, servidores y almacenamiento, como plataforma de Microsoft, reducción de costos y escalabilidad. Los diez pesos son 0,5; 0,6; 0,2; 0,7; 0,2; 0,1; 0,1; 0,5; 0,4 y 0,3. Las oraciones 1, 3 y 5 pueden obtener los rangos más altos.
Seleccionar frases existentes es resumen extractivo. Los modelos semánticos también permiten resumen abstractivo, que genera una redacción nueva. TextRank puede operar con palabras: los términos son nodos, las coapariciones son aristas y los mejor clasificados se convierten en palabras clave.
9. Modelos semánticos y embeddings
Los avances de NLP produjeron modelos de deep learning que representan como vectores densos multidimensionales llamados embeddings. Word2Vec y GloVe popularizaron el método: el entrenamiento asigna valores que reflejan características semánticas inferidas del uso.
Las relaciones matemáticas entre vectores hacen más eficientes muchas tareas que los métodos puramente estadísticos. La atención amplió el enfoque al medir la influencia de los cercanos y crear embeddings contextualizados, base de la familia GPT y de la .
Vectores tridimensionales didácticos.
Palabra
Vector
perro
[0,8; 0,6; 0,1]
cachorro
[0,9; 0,7; 0,4]
gato
[0,7; 0,5; 0,2]
gatito
[0,8; 0,6; 0,5]
joven
[0,1; 0,1; 0,3]
pelota
[0,3; 0,9; 0,1]
árbol
[0,2; 0,1; 0,9]
Perro y gato apuntan en direcciones cercanas, igual que cachorro y gatito; árbol, joven y pelota expresan sentidos distintos.
10. Similitud de coseno y términos relacionados
La similitud de coseno compara la orientación de dos vectores. Valores próximos a 1 indican direcciones semejantes y valores menores, significados más lejanos.
similitud_coseno(A,B) = (A · B) / (||A|| × ||B||)
Para perro [0,8; 0,6; 0,1] y gato [0,7; 0,5; 0,2], el producto escalar es 0,88, las magnitudes aproximadas son 1,005 y 0,883 y la similitud llega a 0,992. Perro y árbol dan 0,333; gato y árbol, 0,452. Árbol es el elemento semánticamente diferente.
Perro y gato tienen orientaciones casi iguales; árbol queda lejos de ambos.
11. Aritmética vectorial y analogías
Sumar o restar embeddings puede representar transformaciones lingüísticas. Con los vectores didácticos, perro + joven produce [0,9; 0,7; 0,4], o cachorro; gato + joven produce [0,8; 0,6; 0,5], o gatito.
La relación funciona al revés: cachorro − joven devuelve perro y gatito − joven devuelve gato. En producción, el cálculo raramente coincide exactamente; se busca el vector de más cercano.
El componente semántico “joven” desplaza perro y gato hacia cachorro y gatito.
La idea resuelve analogías. Para completar “cachorro es a perro como gatito es a qué”, se calcula gatito − cachorro + perro. El resultado [0,7; 0,5; 0,2] corresponde a gato.
Las operaciones capturan patrones lingüísticos y permiten razonar sobre relaciones.
12. Tareas con modelos semánticos
Uso de embeddings en análisis de texto.
Tarea
Enfoque semántico
Resumen
Representa oraciones por promedio o de embeddings y extrae las centrales; modelos generativos también crean resúmenes abstractivos.
Palabras clave
Compara cada palabra con el vector global del documento o identifica términos centrales.
Reconocimiento de entidades
Modelos ajustados aprenden agrupaciones de personas, organizaciones y lugares y consideran el contexto.
Clasificación
Agrega embeddings en un vector de documento para un clasificador o lo compara con prototipos de clase.
Sentimiento
Agrupa documentos semánticamente semejantes y separa categorías emocionales.
13. Ejercicio y comprobación de conocimientos
El ejercicio usa Language Playground para experimentar con tareas lingüísticas y observar cómo la IA analiza texto.
Se conserva la captura real en PNG; solo los diagramas conceptuales se redibujaron.