Introdução à Inteligência Artificial: cargas de trabalho e IA responsável
Voltar para a trilha AI-901
AI-901Capítulo 1

Estudo para a Certificação Microsoft AI-901

Introdução à Inteligência Artificial: cargas de trabalho e IA responsável

IA generativa, agentes, linguagem natural, fala, visão computacional, extração de informações e os seis princípios de IA responsável

Tempo de estudo sugerido: 30 minutos • Nível iniciante • Conteúdo reescrito a partir dos objetivos do Microsoft Learn

Escudo neon Microsoft Certified AI-901 Azure AI Fundamentals cercado por símbolos de IA generativa, visão, fala, nuvem e agentes

1. Introdução às cargas de trabalho de inteligência artificial

Objetivos de aprendizagem

  • Reconhecer as principais capacidades de IA: geração de conteúdo, agentes, linguagem, fala, visão computacional e extração de informações.
  • Diferenciar modelos de linguagem grandes e pequenos, prompts, instruções e ferramentas de agentes.
  • Explicar técnicas de análise de texto, reconhecimento e síntese de fala, tarefas de visão e OCR.
  • Aplicar os seis princípios de IA responsável a cenários reais.

Este capítulo apresenta uma visão conceitual das capacidades centrais da inteligência artificial. O foco é desenvolver intuição sobre o que cada carga de trabalho faz e quando ela é adequada, sem exigir programação nem aprofundamento matemático em modelos de aprendizado de máquina.

O material pode ser estudado em formato textual ou em vídeo no Microsoft Learn. A versão em texto normalmente traz mais detalhes e funciona como complemento para quem prefere a apresentação audiovisual.

O exemplo Ask Anton demonstra como uma aplicação de IA pode responder perguntas sobre o conteúdo. Há uma experiência baseada no , que exige uma assinatura capaz de criar um projeto no e implantar um modelo, e uma opção executada no navegador com modelos locais e pesquisa de documentação. Ask Anton é apenas uma demonstração: não é um produto com suporte da Microsoft, nem parte oficial do Microsoft Learn ou do AI Skills Navigator.

Mapa das cargas de trabalho de inteligência artificial abordadas no capítulo.
A introdução conecta seis famílias de capacidades que frequentemente trabalham em conjunto.

2. e modelos de linguagem

é a área da IA que cria conteúdo novo. A saída pode ser uma conversa em linguagem natural, mas também pode assumir a forma de imagem, vídeo, código ou outro formato. Um site sobre história da computação, por exemplo, pode oferecer um chat que produz respostas próprias para perguntas sobre pessoas, tecnologias e acontecimentos.

Captura de tela original do Computing History Agent respondendo a uma pergunta.
Captura de tela do exemplo original: uma interface conversacional torna o acervo mais interativo.

A geração depende de um modelo de linguagem treinado com grandes volumes de dados, como documentos públicos e materiais disponíveis na Internet. O usuário fornece um prompt - uma pergunta ou instrução em linguagem natural - e o modelo usa as relações semânticas aprendidas entre elementos da linguagem para construir uma sequência coerente.

Modelos de linguagem grandes, ou LLMs, possuem muitos parâmetros e costumam generalizar bem para tarefas variadas, mas seu treinamento e uso podem exigir mais recursos. Modelos de linguagem pequenos, ou SLMs, podem ser mais apropriados para domínios específicos, aplicações locais e agentes executados em dispositivos, nos quais implantação e custo precisam ser menores.

Fluxo entre prompt, modelo de linguagem, resposta e os componentes de um agente.
A geração transforma um prompt em uma nova resposta; um agente acrescenta instruções e ferramentas ao modelo.

3. Agentes de IA

Um agente é uma aplicação baseada em capaz de interpretar e produzir linguagem, raciocinar sobre uma solicitação, usar ferramentas para automatizar tarefas e reagir às condições do contexto antes de executar uma ação.

Elementos fundamentais de um agente de IA.
ElementoFunção
Modelo de linguagemAtua como o mecanismo de compreensão e raciocínio do agente.
InstruçõesUm prompt de sistema define papel, comportamento, limites e modo de trabalho.
FerramentasConectam o agente ao mundo: fontes de conhecimento, como pesquisa e bancos de dados, e ações, como enviar mensagens, atualizar calendários ou controlar dispositivos.

Com essa combinação, agentes podem funcionar como assistentes digitais que colaboram com pessoas e automatizam etapas de trabalho. Eles não se limitam a conversar: podem consultar informações, decidir qual ferramenta usar e agir dentro das permissões concedidas.

  • Chatbots que respondem perguntas ou mantêm uma conversa.
  • Assistentes que automatizam tarefas em apoio a usuários humanos.
  • Criação de rascunhos de documentos e outros conteúdos para refinamento posterior.
  • automática entre idiomas.
  • Resumo e explicação de documentos complexos.

4. Texto e processamento de linguagem natural

Processamento de linguagem natural, ou NLP, reúne modelos e técnicas usados para interpretar linguagem humana. Esses fundamentos sustentam os LLMs de e também soluções especializadas de análise textual, que priorizam resultados previsíveis ou regras personalizadas.

Captura de tela original do agente extraindo pessoas, locais e datas de um texto.
O exemplo combina resumo com extração de entidades em um artigo histórico.
Técnicas comuns de análise de texto.
TécnicaO que produz
Detecção de idiomaIdentifica o idioma ou os idiomas de um documento e costuma iniciar fluxos com várias etapas.
Classificação e análise de sentimentoAtribui uma categoria e pode estimar se o texto expressa opinião positiva, negativa ou neutra.
Extração de termos e entidadesLocaliza palavras importantes e referências a pessoas, lugares e organizações. Uma variante detecta e oculta PII, como nomes, endereços e telefones.
ResumoReduz o volume do texto preservando seus pontos essenciais.
Pipeline de linguagem natural da entrada ao resultado.
Um fluxo pode detectar idioma, classificar, extrair entidades e PII e então resumir ou acionar outra etapa.
  • Examinar documentos e transcrições de chamadas ou reuniões para descobrir assuntos e menções específicas.
  • Avaliar sentimento e opinião em redes sociais, análises de produtos e artigos.
  • Criar bots de perguntas frequentes ou diálogos previsíveis que não precisam da complexidade de .
  • Remover PII antes de compartilhar ou analisar dados para atender políticas de privacidade e legislação.

5. Reconhecimento e síntese de fala

Recursos de fala permitem que aplicações e agentes interajam por linguagem oral. No exemplo histórico, um botão de microfone recebe perguntas faladas e o sistema pode devolver uma resposta sintetizada em áudio.

Captura de tela original do agente recebendo uma pergunta por áudio.
A interface de exemplo demonstra uma experiência conversacional habilitada para fala.

Reconhecimento de fala converte o sinal de áudio em texto para que a aplicação possa interpretar as palavras. Síntese de fala realiza o caminho inverso: transforma texto em um sinal audível. As duas capacidades podem formar uma conversa por voz completa.

A tecnologia continua evoluindo para separar voz e ruído de fundo, reconhecer interrupções e produzir vozes mais expressivas e naturais.

Fluxos de fala para texto e de texto para fala.
Reconhecimento transcreve áudio; síntese vocaliza o conteúdo textual.
  • Agentes que entendem comandos falados, realizam tarefas e respondem por voz.
  • Transcrição automática de reuniões e chamadas.
  • Geração automática de descrições em áudio para vídeos ou textos.
  • automática de fala entre idiomas.

6. computacional

computacional trata da análise de entradas visuais, como fotografias, vídeos e transmissões ao vivo de câmeras. Um site de história da computação poderia receber a foto de um computador antigo e então identificá-lo e descrevê-lo.

Captura de tela original do agente analisando a imagem de um computador antigo.
O exemplo mostra uma entrada visual sendo identificada e descrita.

Modelos de visão são treinados com grandes conjuntos de imagens para aprender padrões visuais. A tarefa desejada determina o tipo de anotação e o formato da saída.

Quatro tipos de modelo de visão computacional.
TarefaResultado
Classificação de imagensPrevê o rótulo mais adequado para o assunto principal de uma imagem não rotulada.
Detecção de objetosIdentifica objetos específicos e suas posições na imagem.
Segmentação semânticaClassifica os pixels que pertencem a cada objeto, em vez de apenas desenhar caixas.
Modelos multimodaisCombinam características visuais e descrições textuais para interpretar e descrever imagens com mais contexto.
Comparação entre classificação, detecção, segmentação e modelos multimodais.
Cada tarefa responde a uma pergunta diferente sobre o conteúdo visual.
  • Agentes capazes de interpretar imagens.
  • Legendas e etiquetas automáticas para fotografias.
  • Pesquisa visual.
  • Controle de estoque e identificação de itens no varejo.
  • Monitoramento de vídeo para segurança.
  • Autenticação por reconhecimento facial.
  • Robótica e veículos autônomos.

7. Extração de informações

A IA pode localizar dados e revelar insights em fontes não estruturadas, incluindo documentos digitalizados, formulários, imagens e gravações de áudio ou vídeo. No exemplo, números de série extraídos de fotos de componentes ajudam a descobrir a qual computador eles pertencem.

Captura de tela original do agente lendo um número de série em uma imagem.
A aplicação combina visão e interpretação de texto para identificar o componente.

O reconhecimento óptico de caracteres, ou OCR, encontra a posição do texto em uma imagem. Um modelo analítico pode então interpretar os valores e associá-los a campos específicos, como fornecedor, data, valor e imposto de um recibo enviado para reembolso.

Modelos tradicionais se concentravam em formulários textuais, mas soluções recentes também extraem conteúdo de imagens, gravações de áudio e vídeo. O objetivo é converter material heterogêneo em dados estruturados que possam ser pesquisados ou usados em processos.

Pipeline de extração com documentos, imagens, áudio e vídeo.
OCR e modelos analíticos transformam conteúdo não estruturado em campos, pesquisa e automação.
  • Processamento automático de formulários em fluxos de negócio, como solicitações de reembolso.
  • Digitalização em grande escala de registros em papel, como documentos de censo.
  • Indexação de documentos para pesquisa.
  • Identificação de pontos importantes e ações de acompanhamento em reuniões gravadas ou transcritas.

8. Princípios de IA responsável

IA responsável reúne práticas e salvaguardas para reduzir o risco de conteúdo ou ações prejudiciais, ilegais ou ofensivas. Filtros de conteúdo ajudam, mas não bastam: os princípios precisam orientar concepção, projeto, implementação e operação da solução.

Captura de tela original de uma resposta recusada por motivos de segurança.
O exemplo mostra uma salvaguarda impedindo conteúdo que poderia incentivar uma atividade prejudicial.
Seis princípios de IA responsável.
PrincípioAplicação prática
EquidadeDados escolhidos por pessoas podem incorporar vieses. É necessário reduzir distorções no treinamento e testar resultados para evitar discriminação.
Confiabilidade e segurançaModelos probabilísticos podem errar. A aplicação deve reconhecer incerteza, estabelecer limites e mitigar riscos.
Privacidade e segurançaDados de treinamento podem conter informações pessoais ou organizacionais; dados e modelos precisam ser protegidos contra exposição.
InclusãoO benefício da IA deve ser acessível e a solução não pode excluir grupos de usuários.
TransparênciaUsuários devem saber que interagem com IA, compreender de modo apropriado como ela funciona e conhecer suas limitações.
ResponsabilidadePessoas e organizações continuam responsáveis pelas soluções que criam e distribuem; uma estrutura de governança deve orientar decisões e controles.
Os seis princípios de IA responsável.
Equidade, confiabilidade e segurança, privacidade e segurança, inclusão, transparência e responsabilidade devem atuar em conjunto.

9. Como aplicar IA responsável em cenários reais

  • Admissão universitária: validar se critérios acadêmicos relevantes são aplicados de maneira justa, sem discriminação apoiada em fatores demográficos irrelevantes.
  • Robótica com visão: usar a confiança da identificação e impedir ação física quando a probabilidade ficar abaixo do limite seguro.
  • Identificação facial em área segura: apagar imagens temporárias quando não forem mais necessárias e limitar o acesso a quem realmente precisa delas.
  • Agente por fala: fornecer legendas textuais para que pessoas com deficiência auditiva não sejam excluídas.
  • Aprovação bancária de crédito: informar que há uso de IA e explicar características relevantes dos dados de treinamento sem revelar informações confidenciais.

10. Exploração prática e Ask Anton

A atividade prática do módulo permite experimentar as cargas de trabalho no Computing History Agent. O exercício reúne interação textual, geração, fala, visão e extração para que o leitor observe o comportamento dessas capacidades em uma mesma aplicação.

Captura de tela original da página inicial do exercício Computing History Agent.
O print original foi mantido porque representa a interface real da atividade.

Antes de executar o exercício, escolha a experiência adequada. A opção baseada no envolve recursos no ; a opção do navegador reduz requisitos e executa modelos localmente. Em ambos os casos, trate a ferramenta como demonstração educacional, não como serviço com suporte.

11. Verificação de conhecimento

Use as perguntas a seguir para confirmar a distinção entre os conceitos. As respostas aparecem logo depois para permitir autocorreção.

  1. Qual descrição representa melhor a : uma técnica obsoleta, uma capacidade restrita a cientistas de dados ou o uso de um modelo para criar conteúdo novo a partir de um prompt?
  2. Um agente de IA é o profissional que programa, qualquer pessoa que usa IA ou uma aplicação capaz de realizar tarefas em nome de um usuário?
  3. Quando uma aplicação lê uma mensagem de e-mail em voz alta, ela usa reconhecimento de fala, síntese de fala ou análise de sentimento?

Respostas comentadas

  • usa um modelo, frequentemente um modelo de linguagem, para produzir conteúdo original em resposta ao prompt.
  • Agente é a aplicação que combina modelo, instruções e ferramentas para executar tarefas em benefício do usuário.
  • Ler texto em voz alta é síntese de fala, pois a entrada textual é convertida em áudio.

12. Resumo do capítulo

  • cria texto, imagem, vídeo, código e outros formatos; agentes acrescentam instruções, ferramentas e capacidade de ação.
  • NLP interpreta linguagem e oferece detecção de idioma, classificação, sentimento, entidades, PII e resumo.
  • Reconhecimento de fala converte áudio em texto; síntese transforma texto em áudio.
  • computacional abrange classificação, detecção, segmentação e modelos multimodais.
  • Extração de informações usa OCR e modelos analíticos para estruturar conteúdo de documentos, imagens, áudio e vídeo.
  • IA responsável depende de equidade, confiabilidade e segurança, privacidade e segurança, inclusão, transparência e responsabilidade.