Análise de texto: tokenização, estatística e modelos semânticos
Voltar para a trilha AI-901
AI-901Capítulo 3

Estudo para a Certificação Microsoft AI-901

Análise de texto: tokenização, estatística e modelos semânticos

Pré-processamento, TF-IDF, bag-of-words, Naive Bayes, TextRank, embeddings, similaridade de cosseno e aritmética vetorial

Tempo de estudo sugerido: 36 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn

Escudo neon Microsoft Certified AI-901 Azure AI Fundamentals cercado por símbolos de IA generativa, visão, fala, nuvem e agentes

1. Introdução à análise de texto

Objetivos de aprendizagem

  • Explicar como tokenização e pré-processamento preparam um corpus para análise.
  • Aplicar frequência, TF-IDF, bag-of-words, Naive Bayes e TextRank em nível conceitual.
  • Interpretar embeddings, similaridade de cosseno, aritmética vetorial e relações semânticas.
  • Relacionar modelos semânticos a resumo, palavras-chave, entidades, classificação e sentimento.

Análise de texto é uma área do processamento de linguagem natural, ou NLP, que extrai significado, estrutura e insights de texto não estruturado. Organizações a utilizam para transformar avaliações de clientes, chamados de suporte, contratos e publicações em redes sociais em informações que orientam decisões.

As técnicas evoluíram de contagens estatísticas de termos para modelos vetoriais capazes de representar significado. Esse progresso atende a um problema central: a linguagem humana é complexa, enquanto computadores precisam de representações numéricas para analisá-la.

Cargas de trabalho comuns de análise de texto.
TarefaResultado
Detecção de idiomaIdentifica um ou mais idiomas e frequentemente inicia um com várias etapas.
Extração de termos-chaveEncontra palavras e frases relevantes para revelar temas.
Detecção de entidadesLocaliza pessoas, lugares, datas, organizações e outras entidades nomeadas.
Detecção de PIIIdentifica e pode ocultar nomes, endereços, telefones, contas financeiras e outros dados sensíveis.
Classificação de textoAgrupa documentos pelo conteúdo, como spam e não spam.
Análise de sentimentoClassifica o tom como positivo, neutro ou negativo.
ResumoReduz o volume mantendo os pontos mais importantes.

O Microsoft Learn oferece o conteúdo original em vídeo e em formato textual. A versão escrita costuma aprofundar detalhes e pode complementar os vídeos.

2. Tokenização de um corpus

O primeiro passo da análise é dividir o conjunto de textos, chamado corpus, em . Para simplificar, cada palavra distinta pode ser tratada como , embora sistemas reais também utilizem partes de palavras, combinações de termos e pontuação.

Na frase “Escolhemos ir à Lua”, cada ocorrência ocupa uma posição na sequência. Se um termo aparecer duas vezes, ele reutiliza o mesmo identificador de vocabulário. Essa representação discreta permite contar frequências e descobrir quais termos dominam o assunto.

Exemplo simplificado de sequência tokenizada.
Posição
1Nós
2escolhemos
3ir
4para
5a
6Lua

A forma de tokenizar depende do problema. Uma solução pode preservar maiúsculas e pontuação quando esses sinais carregam significado, ou removê-los quando o objetivo é apenas comparar frequências.

3. Normalização, stop words e n-gramas

Técnicas de pré-processamento.
TécnicaComo funcionaCuidado
NormalizaçãoPode remover pontuação e converter o texto para minúsculas.Melhora contagens simples, mas pode apagar diferenças como o sobrenome “Banks”, o substantivo “banks” e um ponto que marca fim de frase.
Remoção de stop wordsExclui termos funcionais, como artigos e pronomes, que ajudam a leitura mas carregam pouco significado temático.A lista deve respeitar idioma e contexto; uma palavra aparentemente comum pode ser relevante em determinado domínio.
Extração de n-gramasAgrupa sequências frequentes. Uma palavra é unigram, duas formam bigram e três formam trigram.Expressões como “inteligência artificial” e “processamento de linguagem natural” devem ser entendidas como unidades quando o sentido depende da combinação.

4. Stemming, lematização e classes gramaticais

Stemming consolida variações removendo terminações como “s”, “ing” e “ed”. A intenção é reunir termos de mesma raiz antes da contagem, mesmo que o fragmento resultante nem sempre seja uma palavra válida.

Lematização também busca a forma básica, chamada lema, porém aplica vocabulário e regras linguísticas. Por isso, tende a produzir palavras reconhecíveis, como reduzir uma forma equivalente a “running” para “run”, em vez de apenas cortar caracteres.

A marcação de classes gramaticais, ou POS tagging, atribui a cada uma categoria como substantivo, verbo, adjetivo ou advérbio. Regras e modelos estatísticos consideram tanto o quanto o contexto para decidir a etiqueta correta.

5. Análise de frequência

Depois de tokenizar, normalizar e lematizar, uma contagem simples mostra quantas vezes cada termo aparece. A hipótese é que palavras recorrentes ajudam a indicar os temas de um documento.

Em um texto sobre benefícios da IA nas empresas, por exemplo, os termos normalizados mais frequentes podem ser “IA” quatro vezes, “negócio” três vezes e “benefício”, “cliente”, “decisão” e “mercado” duas vezes cada. Esse padrão sugere que o assunto central é o valor empresarial da IA: automação, análise preditiva, produtividade, personalização e adaptação ao mercado.

Exemplo parcial de frequência após pré-processamento.
TermoFrequência
IA4
negócio3
benefício2
cliente2
decisão2
mercado2
capacidade1
precisão1

6. TF-IDF: relevância entre documentos

Frequência isolada funciona bem em um documento, mas termos comuns a todo o corpus dificultam a distinção entre arquivos. TF-IDF, sigla de frequência do termo e frequência inversa do documento, aumenta o peso de palavras frequentes em um documento e raras na coleção.

Considere dois textos sobre agentes. Um descreve criação declarativa no Microsoft Copilot Studio por linguagem natural, prompts, modelos, intenções, ações, conexões de dados, publicação em canais, orquestração, governança e ciclo de vida. Outro apresenta desenvolvimento baseado em código no , com SDKs, , conversas, chamada de ferramentas, estado, , Python, C#, serviços de IA da Microsoft e CI/CD.

“Agente”, “Microsoft” e “IA” aparecem muito nos dois textos e indicam um tema geral, mas pouco ajudam a separá-los. TF-IDF destaca “Copilot”, “Studio” e “declarativo” no primeiro, enquanto “código”, “desenvolver” e “Foundry” se tornam mais discriminantes no segundo.

TF(t,d) = número de ocorrências de t no documento d
IDF(t) = log(N / df(t))
TF-IDF(t,d) = TF(t,d) × log(N / df(t))

N representa o total de documentos e df(t), quantos documentos contêm o termo. Se uma palavra aparece nos dois documentos de um corpus com N = 2, seu IDF é (2/2) = 0 e ela não recebe peso discriminante. No exemplo, “copilot” e “studio” chegam a 2,0794, “declarativo” a 1,3863; no segundo texto, “código”, “desenvolver” e “foundry” chegam a 2,0794.

7. Bag-of-words, Naive Bayes e classificação

Bag-of-words transforma um documento em um vetor de ocorrências ou frequências, ignorando gramática e ordem das palavras. Esse vetor pode alimentar algoritmos de aprendizado de máquina.

Naive Bayes é um classificador probabilístico baseado no teorema de Bayes. Em filtragem de spam, um modelo pode aprender que expressões equivalentes a “cura milagrosa”, “perca peso rápido” e “antienvelhecimento” aparecem com maior frequência em mensagens suspeitas e usar essas evidências para estimar a classe.

A mesma estrutura pode classificar sentimento. As frequências tornam-se recursos de entrada, e o modelo calcula probabilidades para rótulos como positivo ou negativo.

8. TextRank e resumo extrativo

TextRank é um algoritmo não supervisionado baseado em grafos. Cada sentença pode ser um nó; as arestas conectam sentenças e recebem pesos de acordo com a semelhança entre seus termos. O princípio é semelhante ao PageRank: uma sentença se torna importante quando se parece com outras sentenças também importantes.

  1. Construir o grafo com sentenças como nós e similaridade, por sobreposição de palavras ou cosseno entre vetores, como peso das arestas.
  2. Atualizar iterativamente o ranking de cada nó a partir das pontuações e pesos de seus vizinhos. O fator de amortecimento d costuma ser 0,85.
  3. Após a convergência, selecionar as sentenças de maior pontuação para formar o resumo.
TextRank(Sᵢ) = (1 − d) + d × Σ[(wⱼᵢ / Σwⱼₖ) × TextRank(Sⱼ)]
Grafo TextRank com cinco sentenças conectadas por pesos de similaridade.
A espessura das conexões representa semelhança; nós centrais tendem a compor o resumo extrativo.

No exemplo de computação em nuvem, cinco sentenças falam sobre recursos sob demanda, servidores e armazenamento, como plataforma da Microsoft, redução de custos e escalabilidade. Os dez pesos entre pares são 0,5; 0,6; 0,2; 0,7; 0,2; 0,1; 0,1; 0,5; 0,4 e 0,3. As sentenças 1, 3 e 5 podem alcançar as melhores pontuações e formar um resumo conciso.

Selecionar frases existentes caracteriza resumo extrativo. Modelos semânticos recentes também permitem resumo abstrativo, que gera uma nova redação para condensar os temas. TextRank ainda pode operar no nível de palavras: termos viram nós, coocorrências dentro de uma janela viram arestas e os nós mais bem ranqueados tornam-se palavras-chave.

9. Modelos semânticos e embeddings

O avanço do NLP trouxe modelos de deep learning que representam como vetores densos multidimensionais, ou embeddings. Word2Vec e GloVe popularizaram essa abordagem: durante o treinamento, as dimensões passam a refletir características semânticas inferidas do uso dos termos.

Relações matemáticas entre vetores tornam tarefas de análise mais eficientes que técnicas puramente estatísticas. A atenção ampliou esse método ao medir a influência dos vizinhos e produzir embeddings contextualizados, base de modelos modernos como a família GPT e da .

Vetores tridimensionais didáticos.
PalavraVetor
cão[0,8; 0,6; 0,1]
filhote[0,9; 0,7; 0,4]
gato[0,7; 0,5; 0,2]
gatinho[0,8; 0,6; 0,5]
jovem[0,1; 0,1; 0,3]
bola[0,3; 0,9; 0,1]
árvore[0,2; 0,1; 0,9]
Vetores de palavras projetados em três dimensões.
Cão e gato apontam para direções próximas; filhote e gatinho também, enquanto árvore, jovem e bola representam sentidos diferentes.

10. Similaridade de cosseno e termos relacionados

A similaridade de cosseno compara a orientação de dois vetores. Valores próximos de 1 indicam direções semelhantes; valores menores sugerem significados mais distantes.

similaridade_cosseno(A,B) = (A · B) / (||A|| × ||B||)

Para cão [0,8; 0,6; 0,1] e gato [0,7; 0,5; 0,2], o produto escalar é 0,88, as magnitudes são aproximadamente 1,005 e 0,883, e a similaridade chega a 0,992. Cão e árvore produzem 0,333; gato e árvore, 0,452. Árvore é, portanto, o termo semanticamente destoante.

Comparação visual da similaridade entre cão, gato e árvore.
Cão e gato possuem orientação quase igual; árvore permanece distante dos dois vetores.

11. Aritmética vetorial e analogias

Somar ou subtrair embeddings pode representar transformações linguísticas. Com os vetores didáticos, cão + jovem resulta em [0,9; 0,7; 0,4], correspondente a filhote; gato + jovem resulta em [0,8; 0,6; 0,5], correspondente a gatinho.

A relação funciona no sentido inverso: filhote − jovem retorna cão, e gatinho − jovem retorna gato. Em aplicações reais, a conta raramente produz igualdade exata; o sistema procura o cujo vetor esteja mais próximo do resultado.

Transformação de animal adulto em jovem por adição vetorial.
O componente semântico “jovem” desloca os vetores de cão e gato para filhote e gatinho.

A mesma ideia resolve analogias. Para completar “filhote está para cão assim como gatinho está para quê?”, calcula-se gatinho − filhote + cão. O resultado [0,7; 0,5; 0,2] coincide com o vetor de gato.

Analogia vetorial entre filhote, cão, gatinho e gato.
Operações vetoriais capturam padrões linguísticos e permitem raciocínio por relações.

12. Tarefas com modelos semânticos

Aplicações de embeddings em análise de texto.
TarefaUso semântico
Resumo de textoRepresenta sentenças por média ou de embeddings e extrai as mais centrais; modelos generativos também criam resumos abstrativos.
Extração de palavras-chaveCompara cada palavra ao vetor global do documento ou identifica termos centrais no conjunto de vetores.
Reconhecimento de entidades nomeadasModelos ajustados aprendem agrupamentos de pessoas, organizações, locais e outros tipos e usam o contexto durante a inferência.
Classificação de textoAgrega embeddings em um vetor de documento e o fornece a um classificador ou o compara a vetores protótipos de classes.
Análise de sentimentoAgrupa documentos semanticamente semelhantes e separa categorias emocionais.

13. Exercício e verificação de conhecimentos

O exercício utiliza o Language Playground para experimentar tarefas de linguagem e observar como a IA analisa texto.

Captura original do Language Playground detectando japonês em um texto.
A captura da interface real foi preservada em PNG; apenas diagramas conceituais foram redesenhados.

Perguntas reescritas

  1. Tokenização serve para traduzir, resumir ou dividir o texto em unidades menores para análise?
  2. Qual técnica mede a importância de uma palavra em um documento dentro de uma coleção: Naive Bayes, TF-IDF ou Word2Vec?
  3. Qual é o papel dos embeddings em NLP: duplicar , definir stop words ou representar relações semânticas em várias dimensões?

Gabarito comentado

  • Tokenização divide o corpus em unidades menores que podem ser identificadas e analisadas.
  • TF-IDF equilibra frequência local e raridade no conjunto de documentos.
  • Embeddings são vetores multidimensionais que codificam relações semânticas entre .

14. Resumo do capítulo

  • Tokenização e pré-processamento convertem linguagem em unidades analisáveis.
  • Frequência, TF-IDF, bag-of-words, Naive Bayes e TextRank extraem padrões estatísticos do texto.
  • TextRank produz resumos extrativos e palavras-chave por centralidade em grafos.
  • Embeddings representam significado, e similaridade de cosseno mede proximidade semântica.
  • Aritmética vetorial expressa transformações e analogias linguísticas.
  • Modelos semânticos apoiam resumo, palavras-chave, entidades, classificação e sentimento.