Análise de texto: tokenização, estatística e modelos semânticos
Pré-processamento, TF-IDF, bag-of-words, Naive Bayes, TextRank, embeddings, similaridade de cosseno e aritmética vetorial
Tempo de estudo sugerido: 36 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn
Por João Ricardo Dutra••Conteúdo autoral completo
1. Introdução à análise de texto
Objetivos de aprendizagem
Explicar como tokenização e pré-processamento preparam um corpus para análise.
Aplicar frequência, TF-IDF, bag-of-words, Naive Bayes e TextRank em nível conceitual.
Interpretar embeddings, similaridade de cosseno, aritmética vetorial e relações semânticas.
Relacionar modelos semânticos a resumo, palavras-chave, entidades, classificação e sentimento.
Análise de texto é uma área do processamento de linguagem natural, ou NLP, que extrai significado, estrutura e insights de texto não estruturado. Organizações a utilizam para transformar avaliações de clientes, chamados de suporte, contratos e publicações em redes sociais em informações que orientam decisões.
As técnicas evoluíram de contagens estatísticas de termos para modelos vetoriais capazes de representar significado. Esse progresso atende a um problema central: a linguagem humana é complexa, enquanto computadores precisam de representações numéricas para analisá-la.
Cargas de trabalho comuns de análise de texto.
Tarefa
Resultado
Detecção de idioma
Identifica um ou mais idiomas e frequentemente inicia um com várias etapas.
Extração de termos-chave
Encontra palavras e frases relevantes para revelar temas.
Detecção de entidades
Localiza pessoas, lugares, datas, organizações e outras entidades nomeadas.
Detecção de PII
Identifica e pode ocultar nomes, endereços, telefones, contas financeiras e outros dados sensíveis.
Classificação de texto
Agrupa documentos pelo conteúdo, como spam e não spam.
Análise de sentimento
Classifica o tom como positivo, neutro ou negativo.
Resumo
Reduz o volume mantendo os pontos mais importantes.
O Microsoft Learn oferece o conteúdo original em vídeo e em formato textual. A versão escrita costuma aprofundar detalhes e pode complementar os vídeos.
2. Tokenização de um corpus
O primeiro passo da análise é dividir o conjunto de textos, chamado corpus, em . Para simplificar, cada palavra distinta pode ser tratada como , embora sistemas reais também utilizem partes de palavras, combinações de termos e pontuação.
Na frase “Escolhemos ir à Lua”, cada ocorrência ocupa uma posição na sequência. Se um termo aparecer duas vezes, ele reutiliza o mesmo identificador de vocabulário. Essa representação discreta permite contar frequências e descobrir quais termos dominam o assunto.
Exemplo simplificado de sequência tokenizada.
Posição
1
Nós
2
escolhemos
3
ir
4
para
5
a
6
Lua
A forma de tokenizar depende do problema. Uma solução pode preservar maiúsculas e pontuação quando esses sinais carregam significado, ou removê-los quando o objetivo é apenas comparar frequências.
3. Normalização, stop words e n-gramas
Técnicas de pré-processamento.
Técnica
Como funciona
Cuidado
Normalização
Pode remover pontuação e converter o texto para minúsculas.
Melhora contagens simples, mas pode apagar diferenças como o sobrenome “Banks”, o substantivo “banks” e um ponto que marca fim de frase.
Remoção de stop words
Exclui termos funcionais, como artigos e pronomes, que ajudam a leitura mas carregam pouco significado temático.
A lista deve respeitar idioma e contexto; uma palavra aparentemente comum pode ser relevante em determinado domínio.
Extração de n-gramas
Agrupa sequências frequentes. Uma palavra é unigram, duas formam bigram e três formam trigram.
Expressões como “inteligência artificial” e “processamento de linguagem natural” devem ser entendidas como unidades quando o sentido depende da combinação.
4. Stemming, lematização e classes gramaticais
Stemming consolida variações removendo terminações como “s”, “ing” e “ed”. A intenção é reunir termos de mesma raiz antes da contagem, mesmo que o fragmento resultante nem sempre seja uma palavra válida.
Lematização também busca a forma básica, chamada lema, porém aplica vocabulário e regras linguísticas. Por isso, tende a produzir palavras reconhecíveis, como reduzir uma forma equivalente a “running” para “run”, em vez de apenas cortar caracteres.
A marcação de classes gramaticais, ou POS tagging, atribui a cada uma categoria como substantivo, verbo, adjetivo ou advérbio. Regras e modelos estatísticos consideram tanto o quanto o contexto para decidir a etiqueta correta.
5. Análise de frequência
Depois de tokenizar, normalizar e lematizar, uma contagem simples mostra quantas vezes cada termo aparece. A hipótese é que palavras recorrentes ajudam a indicar os temas de um documento.
Em um texto sobre benefícios da IA nas empresas, por exemplo, os termos normalizados mais frequentes podem ser “IA” quatro vezes, “negócio” três vezes e “benefício”, “cliente”, “decisão” e “mercado” duas vezes cada. Esse padrão sugere que o assunto central é o valor empresarial da IA: automação, análise preditiva, produtividade, personalização e adaptação ao mercado.
Exemplo parcial de frequência após pré-processamento.
Termo
Frequência
IA
4
negócio
3
benefício
2
cliente
2
decisão
2
mercado
2
capacidade
1
precisão
1
6. TF-IDF: relevância entre documentos
Frequência isolada funciona bem em um documento, mas termos comuns a todo o corpus dificultam a distinção entre arquivos. TF-IDF, sigla de frequência do termo e frequência inversa do documento, aumenta o peso de palavras frequentes em um documento e raras na coleção.
Considere dois textos sobre agentes. Um descreve criação declarativa no Microsoft Copilot Studio por linguagem natural, prompts, modelos, intenções, ações, conexões de dados, publicação em canais, orquestração, governança e ciclo de vida. Outro apresenta desenvolvimento baseado em código no , com SDKs, , conversas, chamada de ferramentas, estado, , Python, C#, serviços de IA da Microsoft e CI/CD.
“Agente”, “Microsoft” e “IA” aparecem muito nos dois textos e indicam um tema geral, mas pouco ajudam a separá-los. TF-IDF destaca “Copilot”, “Studio” e “declarativo” no primeiro, enquanto “código”, “desenvolver” e “Foundry” se tornam mais discriminantes no segundo.
TF(t,d) = número de ocorrências de t no documento d
IDF(t) = log(N / df(t))
TF-IDF(t,d) = TF(t,d) × log(N / df(t))
N representa o total de documentos e df(t), quantos documentos contêm o termo. Se uma palavra aparece nos dois documentos de um corpus com N = 2, seu IDF é (2/2) = 0 e ela não recebe peso discriminante. No exemplo, “copilot” e “studio” chegam a 2,0794, “declarativo” a 1,3863; no segundo texto, “código”, “desenvolver” e “foundry” chegam a 2,0794.
7. Bag-of-words, Naive Bayes e classificação
Bag-of-words transforma um documento em um vetor de ocorrências ou frequências, ignorando gramática e ordem das palavras. Esse vetor pode alimentar algoritmos de aprendizado de máquina.
Naive Bayes é um classificador probabilístico baseado no teorema de Bayes. Em filtragem de spam, um modelo pode aprender que expressões equivalentes a “cura milagrosa”, “perca peso rápido” e “antienvelhecimento” aparecem com maior frequência em mensagens suspeitas e usar essas evidências para estimar a classe.
A mesma estrutura pode classificar sentimento. As frequências tornam-se recursos de entrada, e o modelo calcula probabilidades para rótulos como positivo ou negativo.
8. TextRank e resumo extrativo
TextRank é um algoritmo não supervisionado baseado em grafos. Cada sentença pode ser um nó; as arestas conectam sentenças e recebem pesos de acordo com a semelhança entre seus termos. O princípio é semelhante ao PageRank: uma sentença se torna importante quando se parece com outras sentenças também importantes.
Construir o grafo com sentenças como nós e similaridade, por sobreposição de palavras ou cosseno entre vetores, como peso das arestas.
Atualizar iterativamente o ranking de cada nó a partir das pontuações e pesos de seus vizinhos. O fator de amortecimento d costuma ser 0,85.
Após a convergência, selecionar as sentenças de maior pontuação para formar o resumo.
A espessura das conexões representa semelhança; nós centrais tendem a compor o resumo extrativo.
No exemplo de computação em nuvem, cinco sentenças falam sobre recursos sob demanda, servidores e armazenamento, como plataforma da Microsoft, redução de custos e escalabilidade. Os dez pesos entre pares são 0,5; 0,6; 0,2; 0,7; 0,2; 0,1; 0,1; 0,5; 0,4 e 0,3. As sentenças 1, 3 e 5 podem alcançar as melhores pontuações e formar um resumo conciso.
Selecionar frases existentes caracteriza resumo extrativo. Modelos semânticos recentes também permitem resumo abstrativo, que gera uma nova redação para condensar os temas. TextRank ainda pode operar no nível de palavras: termos viram nós, coocorrências dentro de uma janela viram arestas e os nós mais bem ranqueados tornam-se palavras-chave.
9. Modelos semânticos e embeddings
O avanço do NLP trouxe modelos de deep learning que representam como vetores densos multidimensionais, ou embeddings. Word2Vec e GloVe popularizaram essa abordagem: durante o treinamento, as dimensões passam a refletir características semânticas inferidas do uso dos termos.
Relações matemáticas entre vetores tornam tarefas de análise mais eficientes que técnicas puramente estatísticas. A atenção ampliou esse método ao medir a influência dos vizinhos e produzir embeddings contextualizados, base de modelos modernos como a família GPT e da .
Vetores tridimensionais didáticos.
Palavra
Vetor
cão
[0,8; 0,6; 0,1]
filhote
[0,9; 0,7; 0,4]
gato
[0,7; 0,5; 0,2]
gatinho
[0,8; 0,6; 0,5]
jovem
[0,1; 0,1; 0,3]
bola
[0,3; 0,9; 0,1]
árvore
[0,2; 0,1; 0,9]
Cão e gato apontam para direções próximas; filhote e gatinho também, enquanto árvore, jovem e bola representam sentidos diferentes.
10. Similaridade de cosseno e termos relacionados
A similaridade de cosseno compara a orientação de dois vetores. Valores próximos de 1 indicam direções semelhantes; valores menores sugerem significados mais distantes.
similaridade_cosseno(A,B) = (A · B) / (||A|| × ||B||)
Para cão [0,8; 0,6; 0,1] e gato [0,7; 0,5; 0,2], o produto escalar é 0,88, as magnitudes são aproximadamente 1,005 e 0,883, e a similaridade chega a 0,992. Cão e árvore produzem 0,333; gato e árvore, 0,452. Árvore é, portanto, o termo semanticamente destoante.
Cão e gato possuem orientação quase igual; árvore permanece distante dos dois vetores.
11. Aritmética vetorial e analogias
Somar ou subtrair embeddings pode representar transformações linguísticas. Com os vetores didáticos, cão + jovem resulta em [0,9; 0,7; 0,4], correspondente a filhote; gato + jovem resulta em [0,8; 0,6; 0,5], correspondente a gatinho.
A relação funciona no sentido inverso: filhote − jovem retorna cão, e gatinho − jovem retorna gato. Em aplicações reais, a conta raramente produz igualdade exata; o sistema procura o cujo vetor esteja mais próximo do resultado.
O componente semântico “jovem” desloca os vetores de cão e gato para filhote e gatinho.
A mesma ideia resolve analogias. Para completar “filhote está para cão assim como gatinho está para quê?”, calcula-se gatinho − filhote + cão. O resultado [0,7; 0,5; 0,2] coincide com o vetor de gato.
Operações vetoriais capturam padrões linguísticos e permitem raciocínio por relações.
12. Tarefas com modelos semânticos
Aplicações de embeddings em análise de texto.
Tarefa
Uso semântico
Resumo de texto
Representa sentenças por média ou de embeddings e extrai as mais centrais; modelos generativos também criam resumos abstrativos.
Extração de palavras-chave
Compara cada palavra ao vetor global do documento ou identifica termos centrais no conjunto de vetores.
Reconhecimento de entidades nomeadas
Modelos ajustados aprendem agrupamentos de pessoas, organizações, locais e outros tipos e usam o contexto durante a inferência.
Classificação de texto
Agrega embeddings em um vetor de documento e o fornece a um classificador ou o compara a vetores protótipos de classes.
Análise de sentimento
Agrupa documentos semanticamente semelhantes e separa categorias emocionais.
13. Exercício e verificação de conhecimentos
O exercício utiliza o Language Playground para experimentar tarefas de linguagem e observar como a IA analisa texto.
A captura da interface real foi preservada em PNG; apenas diagramas conceituais foram redesenhados.