Introdução à Inteligência Artificial: cargas de trabalho e IA responsável
IA generativa, agentes, linguagem natural, fala, visão computacional, extração de informações e os seis princípios de IA responsável
Tempo de estudo sugerido: 30 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn
Por João Ricardo Dutra••Conteúdo autoral completo
1. Introdução às cargas de trabalho de inteligência artificial
Objetivos de aprendizagem
Reconhecer as principais capacidades de IA: geração de conteúdo, agentes, linguagem, fala, visão computacional e extração de informações.
Diferenciar modelos de linguagem grandes e pequenos, prompts, instruções e ferramentas de agentes.
Explicar técnicas de análise de texto, reconhecimento e síntese de fala, tarefas de visão e OCR.
Aplicar os seis princípios de IA responsável a cenários reais.
Este capítulo apresenta uma visão conceitual das capacidades centrais da inteligência artificial. O foco é desenvolver intuição sobre o que cada carga de trabalho faz e quando ela é adequada, sem exigir programação nem aprofundamento matemático em modelos de aprendizado de máquina.
O material pode ser estudado em formato textual ou em vídeo no Microsoft Learn. A versão em texto normalmente traz mais detalhes e funciona como complemento para quem prefere a apresentação audiovisual.
O exemplo Ask Anton demonstra como uma aplicação de IA pode responder perguntas sobre o conteúdo. Há uma experiência baseada no , que exige uma assinatura capaz de criar um projeto no e implantar um modelo, e uma opção executada no navegador com modelos locais e pesquisa de documentação. Ask Anton é apenas uma demonstração: não é um produto com suporte da Microsoft, nem parte oficial do Microsoft Learn ou do AI Skills Navigator.
A introdução conecta seis famílias de capacidades que frequentemente trabalham em conjunto.
2. e modelos de linguagem
é a área da IA que cria conteúdo novo. A saída pode ser uma conversa em linguagem natural, mas também pode assumir a forma de imagem, vídeo, código ou outro formato. Um site sobre história da computação, por exemplo, pode oferecer um chat que produz respostas próprias para perguntas sobre pessoas, tecnologias e acontecimentos.
Captura de tela do exemplo original: uma interface conversacional torna o acervo mais interativo.
A geração depende de um modelo de linguagem treinado com grandes volumes de dados, como documentos públicos e materiais disponíveis na Internet. O usuário fornece um prompt - uma pergunta ou instrução em linguagem natural - e o modelo usa as relações semânticas aprendidas entre elementos da linguagem para construir uma sequência coerente.
Modelos de linguagem grandes, ou LLMs, possuem muitos parâmetros e costumam generalizar bem para tarefas variadas, mas seu treinamento e uso podem exigir mais recursos. Modelos de linguagem pequenos, ou SLMs, podem ser mais apropriados para domínios específicos, aplicações locais e agentes executados em dispositivos, nos quais implantação e custo precisam ser menores.
A geração transforma um prompt em uma nova resposta; um agente acrescenta instruções e ferramentas ao modelo.
3. Agentes de IA
Um agente é uma aplicação baseada em capaz de interpretar e produzir linguagem, raciocinar sobre uma solicitação, usar ferramentas para automatizar tarefas e reagir às condições do contexto antes de executar uma ação.
Elementos fundamentais de um agente de IA.
Elemento
Função
Modelo de linguagem
Atua como o mecanismo de compreensão e raciocínio do agente.
Instruções
Um prompt de sistema define papel, comportamento, limites e modo de trabalho.
Ferramentas
Conectam o agente ao mundo: fontes de conhecimento, como pesquisa e bancos de dados, e ações, como enviar mensagens, atualizar calendários ou controlar dispositivos.
Com essa combinação, agentes podem funcionar como assistentes digitais que colaboram com pessoas e automatizam etapas de trabalho. Eles não se limitam a conversar: podem consultar informações, decidir qual ferramenta usar e agir dentro das permissões concedidas.
Chatbots que respondem perguntas ou mantêm uma conversa.
Assistentes que automatizam tarefas em apoio a usuários humanos.
Criação de rascunhos de documentos e outros conteúdos para refinamento posterior.
automática entre idiomas.
Resumo e explicação de documentos complexos.
4. Texto e processamento de linguagem natural
Processamento de linguagem natural, ou NLP, reúne modelos e técnicas usados para interpretar linguagem humana. Esses fundamentos sustentam os LLMs de e também soluções especializadas de análise textual, que priorizam resultados previsíveis ou regras personalizadas.
O exemplo combina resumo com extração de entidades em um artigo histórico.
Técnicas comuns de análise de texto.
Técnica
O que produz
Detecção de idioma
Identifica o idioma ou os idiomas de um documento e costuma iniciar fluxos com várias etapas.
Classificação e análise de sentimento
Atribui uma categoria e pode estimar se o texto expressa opinião positiva, negativa ou neutra.
Extração de termos e entidades
Localiza palavras importantes e referências a pessoas, lugares e organizações. Uma variante detecta e oculta PII, como nomes, endereços e telefones.
Resumo
Reduz o volume do texto preservando seus pontos essenciais.
Um fluxo pode detectar idioma, classificar, extrair entidades e PII e então resumir ou acionar outra etapa.
Examinar documentos e transcrições de chamadas ou reuniões para descobrir assuntos e menções específicas.
Avaliar sentimento e opinião em redes sociais, análises de produtos e artigos.
Criar bots de perguntas frequentes ou diálogos previsíveis que não precisam da complexidade de .
Remover PII antes de compartilhar ou analisar dados para atender políticas de privacidade e legislação.
5. Reconhecimento e síntese de fala
Recursos de fala permitem que aplicações e agentes interajam por linguagem oral. No exemplo histórico, um botão de microfone recebe perguntas faladas e o sistema pode devolver uma resposta sintetizada em áudio.
A interface de exemplo demonstra uma experiência conversacional habilitada para fala.
Reconhecimento de fala converte o sinal de áudio em texto para que a aplicação possa interpretar as palavras. Síntese de fala realiza o caminho inverso: transforma texto em um sinal audível. As duas capacidades podem formar uma conversa por voz completa.
A tecnologia continua evoluindo para separar voz e ruído de fundo, reconhecer interrupções e produzir vozes mais expressivas e naturais.
Reconhecimento transcreve áudio; síntese vocaliza o conteúdo textual.
Agentes que entendem comandos falados, realizam tarefas e respondem por voz.
Transcrição automática de reuniões e chamadas.
Geração automática de descrições em áudio para vídeos ou textos.
automática de fala entre idiomas.
6. computacional
computacional trata da análise de entradas visuais, como fotografias, vídeos e transmissões ao vivo de câmeras. Um site de história da computação poderia receber a foto de um computador antigo e então identificá-lo e descrevê-lo.
O exemplo mostra uma entrada visual sendo identificada e descrita.
Modelos de visão são treinados com grandes conjuntos de imagens para aprender padrões visuais. A tarefa desejada determina o tipo de anotação e o formato da saída.
Quatro tipos de modelo de visão computacional.
Tarefa
Resultado
Classificação de imagens
Prevê o rótulo mais adequado para o assunto principal de uma imagem não rotulada.
Detecção de objetos
Identifica objetos específicos e suas posições na imagem.
Segmentação semântica
Classifica os pixels que pertencem a cada objeto, em vez de apenas desenhar caixas.
Modelos multimodais
Combinam características visuais e descrições textuais para interpretar e descrever imagens com mais contexto.
Cada tarefa responde a uma pergunta diferente sobre o conteúdo visual.
Agentes capazes de interpretar imagens.
Legendas e etiquetas automáticas para fotografias.
Pesquisa visual.
Controle de estoque e identificação de itens no varejo.
Monitoramento de vídeo para segurança.
Autenticação por reconhecimento facial.
Robótica e veículos autônomos.
7. Extração de informações
A IA pode localizar dados e revelar insights em fontes não estruturadas, incluindo documentos digitalizados, formulários, imagens e gravações de áudio ou vídeo. No exemplo, números de série extraídos de fotos de componentes ajudam a descobrir a qual computador eles pertencem.
A aplicação combina visão e interpretação de texto para identificar o componente.
O reconhecimento óptico de caracteres, ou OCR, encontra a posição do texto em uma imagem. Um modelo analítico pode então interpretar os valores e associá-los a campos específicos, como fornecedor, data, valor e imposto de um recibo enviado para reembolso.
Modelos tradicionais se concentravam em formulários textuais, mas soluções recentes também extraem conteúdo de imagens, gravações de áudio e vídeo. O objetivo é converter material heterogêneo em dados estruturados que possam ser pesquisados ou usados em processos.
OCR e modelos analíticos transformam conteúdo não estruturado em campos, pesquisa e automação.
Processamento automático de formulários em fluxos de negócio, como solicitações de reembolso.
Digitalização em grande escala de registros em papel, como documentos de censo.
Indexação de documentos para pesquisa.
Identificação de pontos importantes e ações de acompanhamento em reuniões gravadas ou transcritas.
8. Princípios de IA responsável
IA responsável reúne práticas e salvaguardas para reduzir o risco de conteúdo ou ações prejudiciais, ilegais ou ofensivas. Filtros de conteúdo ajudam, mas não bastam: os princípios precisam orientar concepção, projeto, implementação e operação da solução.
O exemplo mostra uma salvaguarda impedindo conteúdo que poderia incentivar uma atividade prejudicial.
Seis princípios de IA responsável.
Princípio
Aplicação prática
Equidade
Dados escolhidos por pessoas podem incorporar vieses. É necessário reduzir distorções no treinamento e testar resultados para evitar discriminação.
Confiabilidade e segurança
Modelos probabilísticos podem errar. A aplicação deve reconhecer incerteza, estabelecer limites e mitigar riscos.
Privacidade e segurança
Dados de treinamento podem conter informações pessoais ou organizacionais; dados e modelos precisam ser protegidos contra exposição.
Inclusão
O benefício da IA deve ser acessível e a solução não pode excluir grupos de usuários.
Transparência
Usuários devem saber que interagem com IA, compreender de modo apropriado como ela funciona e conhecer suas limitações.
Responsabilidade
Pessoas e organizações continuam responsáveis pelas soluções que criam e distribuem; uma estrutura de governança deve orientar decisões e controles.
Equidade, confiabilidade e segurança, privacidade e segurança, inclusão, transparência e responsabilidade devem atuar em conjunto.
9. Como aplicar IA responsável em cenários reais
Admissão universitária: validar se critérios acadêmicos relevantes são aplicados de maneira justa, sem discriminação apoiada em fatores demográficos irrelevantes.
Robótica com visão: usar a confiança da identificação e impedir ação física quando a probabilidade ficar abaixo do limite seguro.
Identificação facial em área segura: apagar imagens temporárias quando não forem mais necessárias e limitar o acesso a quem realmente precisa delas.
Agente por fala: fornecer legendas textuais para que pessoas com deficiência auditiva não sejam excluídas.
Aprovação bancária de crédito: informar que há uso de IA e explicar características relevantes dos dados de treinamento sem revelar informações confidenciais.
10. Exploração prática e Ask Anton
A atividade prática do módulo permite experimentar as cargas de trabalho no Computing History Agent. O exercício reúne interação textual, geração, fala, visão e extração para que o leitor observe o comportamento dessas capacidades em uma mesma aplicação.
O print original foi mantido porque representa a interface real da atividade.
Antes de executar o exercício, escolha a experiência adequada. A opção baseada no envolve recursos no ; a opção do navegador reduz requisitos e executa modelos localmente. Em ambos os casos, trate a ferramenta como demonstração educacional, não como serviço com suporte.
Use as perguntas a seguir para confirmar a distinção entre os conceitos. As respostas aparecem logo depois para permitir autocorreção.
Qual descrição representa melhor a : uma técnica obsoleta, uma capacidade restrita a cientistas de dados ou o uso de um modelo para criar conteúdo novo a partir de um prompt?
Um agente de IA é o profissional que programa, qualquer pessoa que usa IA ou uma aplicação capaz de realizar tarefas em nome de um usuário?
Quando uma aplicação lê uma mensagem de e-mail em voz alta, ela usa reconhecimento de fala, síntese de fala ou análise de sentimento?
Respostas comentadas
usa um modelo, frequentemente um modelo de linguagem, para produzir conteúdo original em resposta ao prompt.
Agente é a aplicação que combina modelo, instruções e ferramentas para executar tarefas em benefício do usuário.
Ler texto em voz alta é síntese de fala, pois a entrada textual é convertida em áudio.
12. Resumo do capítulo
cria texto, imagem, vídeo, código e outros formatos; agentes acrescentam instruções, ferramentas e capacidade de ação.
NLP interpreta linguagem e oferece detecção de idioma, classificação, sentimento, entidades, PII e resumo.
Reconhecimento de fala converte áudio em texto; síntese transforma texto em áudio.
computacional abrange classificação, detecção, segmentação e modelos multimodais.
Extração de informações usa OCR e modelos analíticos para estruturar conteúdo de documentos, imagens, áudio e vídeo.
IA responsável depende de equidade, confiabilidade e segurança, privacidade e segurança, inclusão, transparência e responsabilidade.