Análisis de texto: tokenización, estadística y modelos semánticos
Volver a la ruta AI-901
AI-901Capítulo 3

Preparación para la Certificación Microsoft AI-901

Análisis de texto: tokenización, estadística y modelos semánticos

Preprocesamiento, TF-IDF, bag-of-words, Naive Bayes, TextRank, embeddings, similitud de coseno y aritmética vectorial

Tiempo de estudio sugerido: 36 minutos • Nivel principiante • Reescritura original basada en objetivos de Microsoft Learn

Escudo neón Microsoft Certified AI-901 Azure AI Fundamentals rodeado de símbolos de IA generativa, visión, voz, nube y agentes

1. Introducción al análisis de texto

Objetivos de aprendizaje

  • Explicar cómo la tokenización y el preprocesamiento preparan un corpus.
  • Aplicar conceptualmente frecuencia, TF-IDF, bag-of-words, Naive Bayes y TextRank.
  • Interpretar embeddings, similitud de coseno, aritmética vectorial y relaciones semánticas.
  • Relacionar modelos semánticos con resumen, palabras clave, entidades, clasificación y sentimiento.

El análisis de texto es una disciplina del procesamiento del lenguaje natural, o NLP, que extrae significado, estructura y conocimiento de texto no estructurado. Las organizaciones lo usan para convertir opiniones de clientes, incidencias de soporte, contratos y publicaciones sociales en información útil para decidir.

Las técnicas evolucionaron desde recuentos estadísticos hasta modelos vectoriales capaces de representar significado. Este avance responde a un reto central: el lenguaje humano es complejo y los equipos necesitan representaciones numéricas para analizarlo.

Cargas de trabajo habituales de análisis de texto.
TareaResultado
Detección de idiomaIdentifica uno o varios idiomas y suele iniciar un flujo con varias etapas.
Extracción de términos claveEncuentra palabras y frases importantes para revelar temas.
Detección de entidadesLocaliza personas, lugares, fechas, organizaciones y otras entidades con nombre.
Detección de PIIIdentifica y puede ocultar nombres, direcciones, teléfonos, cuentas financieras y otros datos confidenciales.
Clasificación de textoAgrupa documentos por contenido, como correo no deseado o legítimo.
Análisis de sentimientoClasifica el tono como positivo, neutro o negativo.
ResumenReduce el volumen y conserva los puntos más importantes.

Microsoft Learn ofrece el material original en vídeo y texto. La versión escrita suele aportar más detalle y puede complementar los vídeos.

2. Tokenización de un corpus

El primer paso es dividir la colección de textos, llamada corpus, en . Para simplificar, cada palabra distinta puede considerarse , aunque los sistemas reales también usan subpalabras, combinaciones y puntuación.

En “Elegimos ir a la Luna”, cada aparición ocupa una posición. Si un término se repite, reutiliza su identificador de vocabulario. Esta representación discreta permite contar frecuencias y detectar las palabras dominantes.

Secuencia tokenizada simplificada.
Posición
1Nosotros
2elegimos
3ir
4a
5la
6Luna

La tokenización depende del problema. Una solución puede conservar mayúsculas y puntuación cuando aportan significado, o quitarlas si solo interesa comparar frecuencias.

3. Normalización, stop words y n-gramas

Técnicas de preprocesamiento.
TécnicaFuncionamientoConsideración
NormalizaciónPuede quitar puntuación y convertir el texto a minúsculas.Mejora recuentos simples, pero puede borrar diferencias entre el apellido “Banks”, el sustantivo “banks” y el punto que cierra una oración.
Eliminación de stop wordsExcluye palabras funcionales que ayudan a leer, pero aportan poco significado temático.La lista debe adaptarse al idioma y al dominio.
Extracción de n-gramasAgrupa secuencias frecuentes: una palabra es unigram, dos forman bigram y tres, trigram.Expresiones como “inteligencia artificial” o “procesamiento del lenguaje natural” deben mantenerse unidas cuando su sentido depende de la combinación.

4. Stemming, lematización y categorías gramaticales

Stemming consolida variantes eliminando terminaciones como “s”, “ing” y “ed”. Agrupa términos con una raíz común antes del recuento, aunque el fragmento resultante no siempre sea una palabra válida.

La lematización también busca una forma base, o lema, pero aplica reglas lingüísticas y vocabulario. Por eso tiende a devolver palabras reconocibles, como transformar “running” en “run”, en lugar de limitarse a cortar caracteres.

El etiquetado de categorías gramaticales, o POS tagging, marca sustantivos, verbos, adjetivos, adverbios y otras clases. Reglas lingüísticas y modelos estadísticos analizan el y su contexto para elegir la etiqueta.

5. Análisis de frecuencia

Tras tokenizar, normalizar y lematizar, un recuento sencillo muestra cuántas veces aparece cada término. La hipótesis es que las palabras recurrentes ayudan a identificar los temas.

En un texto sobre beneficios empresariales de la IA, los recuentos podrían mostrar “IA” cuatro veces, “empresa” tres y “beneficio”, “cliente”, “decisión” y “mercado” dos veces. El patrón apunta al valor de automatización, análisis predictivo, productividad, personalización y adaptación.

Ejemplo parcial de frecuencia.
TérminoFrecuencia
IA4
empresa3
beneficio2
cliente2
decisión2
mercado2
capacidad1
precisión1

6. TF-IDF: relevancia entre documentos

La frecuencia bruta funciona en un documento, pero los términos comunes a todo el corpus dificultan distinguir archivos. TF-IDF aumenta el peso de palabras frecuentes en un documento y poco habituales en la colección.

Un ejemplo describe creación declarativa de agentes en Microsoft Copilot Studio mediante lenguaje natural, prompts, plantillas, intenciones, acciones, conexiones, publicación, orquestación, gobernanza y ciclo de vida. Otro presenta desarrollo basado en código en con , , conversaciones, herramientas, estado, , Python, C#, servicios de IA de Microsoft y CI/CD.

“Agente”, “Microsoft” e “IA” aparecen en ambos y revelan el tema general, pero no los separan. TF-IDF destaca “Copilot”, “Studio” y “declarativo” en el primero, y “código”, “desarrollar” y “Foundry” en el segundo.

TF(t,d) = número de apariciones de t en el documento d
IDF(t) = log(N / df(t))
TF-IDF(t,d) = TF(t,d) × log(N / df(t))

N es el total de documentos y df(t), cuántos contienen el término. Una palabra presente en los dos documentos con N = 2 tiene IDF (2/2) = 0. En el ejemplo, “copilot” y “studio” alcanzan 2,0794, “declarativo” 1,3863; “código”, “desarrollar” y “foundry” llegan a 2,0794 en el otro texto.

7. Bag-of-words, Naive Bayes y clasificación

Bag-of-words representa un documento como vector de apariciones o frecuencias e ignora gramática y orden. Los algoritmos de aprendizaje automático usan ese vector como características de entrada.

Naive Bayes es un clasificador probabilístico basado en el teorema de Bayes. Para filtrar spam, puede aprender que expresiones equivalentes a “cura milagrosa”, “adelgaza rápido” y “antienvejecimiento” aparecen más en mensajes sospechosos y usar esa evidencia para estimar la clase.

La misma estructura admite análisis de sentimiento. Las frecuencias se convierten en características y el modelo estima probabilidades para etiquetas positivas o negativas.

8. TextRank y resumen extractivo

TextRank es un algoritmo no supervisado basado en grafos. Cada oración puede ser un nodo y las aristas se ponderan según la similitud. Como PageRank, parte de que una oración es importante si se parece a otras oraciones importantes.

  1. Construir el grafo con oraciones como nodos y similitud por solapamiento de palabras o coseno entre vectores como peso.
  2. Actualizar iterativamente el rango de cada nodo con las puntuaciones y pesos de sus vecinos; el factor d suele ser 0,85.
  3. Tras la convergencia, seleccionar las oraciones mejor puntuadas.
TextRank(Sᵢ) = (1 − d) + d × Σ[(wⱼᵢ / Σwⱼₖ) × TextRank(Sⱼ)]
Grafo TextRank con cinco oraciones y pesos de similitud.
El grosor de las conexiones representa semejanza; los nodos centrales tienden a formar el resumen extractivo.

En el ejemplo de nube, cinco oraciones tratan recursos bajo demanda, servidores y almacenamiento, como plataforma de Microsoft, reducción de costos y escalabilidad. Los diez pesos son 0,5; 0,6; 0,2; 0,7; 0,2; 0,1; 0,1; 0,5; 0,4 y 0,3. Las oraciones 1, 3 y 5 pueden obtener los rangos más altos.

Seleccionar frases existentes es resumen extractivo. Los modelos semánticos también permiten resumen abstractivo, que genera una redacción nueva. TextRank puede operar con palabras: los términos son nodos, las coapariciones son aristas y los mejor clasificados se convierten en palabras clave.

9. Modelos semánticos y embeddings

Los avances de NLP produjeron modelos de deep learning que representan como vectores densos multidimensionales llamados embeddings. Word2Vec y GloVe popularizaron el método: el entrenamiento asigna valores que reflejan características semánticas inferidas del uso.

Las relaciones matemáticas entre vectores hacen más eficientes muchas tareas que los métodos puramente estadísticos. La atención amplió el enfoque al medir la influencia de los cercanos y crear embeddings contextualizados, base de la familia GPT y de la .

Vectores tridimensionales didácticos.
PalabraVector
perro[0,8; 0,6; 0,1]
cachorro[0,9; 0,7; 0,4]
gato[0,7; 0,5; 0,2]
gatito[0,8; 0,6; 0,5]
joven[0,1; 0,1; 0,3]
pelota[0,3; 0,9; 0,1]
árbol[0,2; 0,1; 0,9]
Vectores de palabras proyectados en tres dimensiones.
Perro y gato apuntan en direcciones cercanas, igual que cachorro y gatito; árbol, joven y pelota expresan sentidos distintos.

10. Similitud de coseno y términos relacionados

La similitud de coseno compara la orientación de dos vectores. Valores próximos a 1 indican direcciones semejantes y valores menores, significados más lejanos.

similitud_coseno(A,B) = (A · B) / (||A|| × ||B||)

Para perro [0,8; 0,6; 0,1] y gato [0,7; 0,5; 0,2], el producto escalar es 0,88, las magnitudes aproximadas son 1,005 y 0,883 y la similitud llega a 0,992. Perro y árbol dan 0,333; gato y árbol, 0,452. Árbol es el elemento semánticamente diferente.

Comparación de similitud entre perro, gato y árbol.
Perro y gato tienen orientaciones casi iguales; árbol queda lejos de ambos.

11. Aritmética vectorial y analogías

Sumar o restar embeddings puede representar transformaciones lingüísticas. Con los vectores didácticos, perro + joven produce [0,9; 0,7; 0,4], o cachorro; gato + joven produce [0,8; 0,6; 0,5], o gatito.

La relación funciona al revés: cachorro − joven devuelve perro y gatito − joven devuelve gato. En producción, el cálculo raramente coincide exactamente; se busca el vector de más cercano.

Suma vectorial que transforma un animal adulto en joven.
El componente semántico “joven” desplaza perro y gato hacia cachorro y gatito.

La idea resuelve analogías. Para completar “cachorro es a perro como gatito es a qué”, se calcula gatito − cachorro + perro. El resultado [0,7; 0,5; 0,2] corresponde a gato.

Analogía vectorial entre cachorro, perro, gatito y gato.
Las operaciones capturan patrones lingüísticos y permiten razonar sobre relaciones.

12. Tareas con modelos semánticos

Uso de embeddings en análisis de texto.
TareaEnfoque semántico
ResumenRepresenta oraciones por promedio o de embeddings y extrae las centrales; modelos generativos también crean resúmenes abstractivos.
Palabras claveCompara cada palabra con el vector global del documento o identifica términos centrales.
Reconocimiento de entidadesModelos ajustados aprenden agrupaciones de personas, organizaciones y lugares y consideran el contexto.
ClasificaciónAgrega embeddings en un vector de documento para un clasificador o lo compara con prototipos de clase.
SentimientoAgrupa documentos semánticamente semejantes y separa categorías emocionales.

13. Ejercicio y comprobación de conocimientos

El ejercicio usa Language Playground para experimentar con tareas lingüísticas y observar cómo la IA analiza texto.

Captura original de Language Playground detectando japonés.
Se conserva la captura real en PNG; solo los diagramas conceptuales se redibujaron.

Preguntas reformuladas

  1. ¿La tokenización traduce, resume o divide el texto en unidades menores?
  2. ¿Qué técnica mide la importancia de una palabra en un documento dentro de una colección: Naive Bayes, TF-IDF o Word2Vec?
  3. ¿Qué hacen los embeddings en NLP: duplican , definen stop words o representan relaciones semánticas en varias dimensiones?

Respuestas

  • La tokenización divide el corpus en unidades menores identificables y analizables.
  • TF-IDF equilibra frecuencia local y rareza en la colección.
  • Los embeddings son vectores multidimensionales que codifican relaciones semánticas.

14. Resumen del capítulo

  • Tokenización y preprocesamiento convierten lenguaje en unidades analizables.
  • Frecuencia, TF-IDF, bag-of-words, Naive Bayes y TextRank extraen patrones estadísticos.
  • TextRank produce resúmenes extractivos y palabras clave mediante centralidad.
  • Los embeddings representan significado y la similitud de coseno mide proximidad.
  • La aritmética vectorial expresa transformaciones y analogías lingüísticas.
  • Los modelos semánticos apoyan resumen, palabras clave, entidades, clasificación y sentimiento.