Olá! Sejam bem-vindas e bem-vindos a mais uma aula do AI Product Builder (Construtor de Produtos de IA) da Alura.
Eu sou o seu instrutor, Diego Rosales, e hoje nós vamos falar sobre evals (avaliações), observabilidade e conformidade.
Antes de começarmos, vou me apresentar. Primeiro, minha audiodescrição.
Audiodescrição: Sou um homem branco, alto e careca. Tenho barba preta que cobre parte do rosto, junto com o bigode. Estou usando óculos de armação azul e grossa. Visto roupas escuras: uma blusa por cima de uma camiseta preta.
Eu tenho mais de oito anos de experiência no mercado digital, tendo passado por diversas áreas. Atualmente, eu trabalho como Group Product Manager (gerente de grupo de produtos), o que significa que eu gerencio equipes multidisciplinares — Product Managers (gerentes de produto), Product Owners (responsáveis pelo produto) e Designers (profissionais de design) —, todas as pessoas envolvidas nessa transição do mercado, entendendo como nós utilizamos a AI (inteligência artificial) para transformar a forma como trabalhamos e entregamos produtos para o mercado.
Eu também atuo como mentor, palestrante e docente. Já passei por Itaú, Thomson Reuters, Simpla e Ticket. Também sou professor na PM3, Alura e Educa.seo.
Meus contatos estão disponíveis; basta enviar uma mensagem. Ficarei muito feliz em conversar por lá. Vamos nessa?
Imaginamos que você chegou até aqui e já fez o lançamento do seu produto, esteja com 2, 3, 5 ou até uma centena de pessoas usuárias. E, se você ainda não lançou, não há problema: continue aqui conosco, pois há bastante aprendizado. A Alura é self-paced (no próprio ritmo), e você vai conseguir tirar diversas ideias boas desta conversa conosco.
Para quem já lançou, a notícia é: lançar é apenas o começo. Imaginamos que quem lançou já esteja sentindo as dificuldades de continuar gerenciando e evoluindo o produto, participando ativamente do seu ciclo de vida com frequência, para que ele continue gerando valor. Muitas pessoas já têm um produto que realiza uma transação com a pessoa usuária: você resolve uma dor, executa uma tarefa para essa pessoa, um job (tarefa), um job to be done (tarefa a ser realizada), na linguagem de produto. E, de certa forma, você pode cobrar por isso por meio de uma mensalidade, de créditos ou de tokens (fichas digitais); há diferentes maneiras de realizar essa transação. Assim, a partir do momento em que você lança e recebe as primeiras pessoas usuárias, a responsabilidade aumenta — lançar é apenas o começo.
Queremos contar sobre o produto que lançamos recentemente. Ele foi construído para esta aula, mas já estava em mente há muito tempo. Vamos trazer a visão do nosso produto para que entendam por que construímos o Musa Balance.
Eu cuido das refeições da minha casa. Eu sou casado, tenho uma esposa, estamos juntos há 10 anos e temos um filho que fará 5 anos em breve. De certa forma, tenho muita dificuldade em manter um gerenciamento sustentável, ou seja, manter nossa dieta funcionando o tempo todo. “Musa” porque eu adoro cozinhar para minha esposa; nós trocamos ideias e receitas, às vezes nos vemos no YouTube assistindo a receitas e dizendo: “vamos colocar isso no ‘kanban de receitas’”, entre aspas, porque não existe nenhuma estrutura. “Balance” porque tenho dificuldade em manter tudo sustentável no sentido de, algumas vezes, acabar jogando comida fresca fora — vegetais que não chegaram nem a ser preparados — ou até comida pronta fora, o que me incomoda muito. Muitas vezes chegamos ao dia 15 do mês e já gastamos todo o nosso saldo de refeição que recebemos do trabalho, nós dois. E, quando deixamos de fazer uma refeição adequada — o que não é um problema, podemos sair da dieta de vez em quando, conforme nossa nutricionista orienta —, acabamos gastando dinheiro em fast food (comida rápida), seja pedindo ou indo até o local. Quando consideramos esses fatores em conjunto, isso nos desgasta: é cansativo pensar, planejar, gastar dinheiro e jogar comida fora, sabendo que ontem nos permitimos comer uma pizza deliciosa enquanto havia comida indo para o lixo.
Para construir o Musa Balance, pensamos: é necessário um processo de gestão robusto no qual a minha musa esteja no centro; ela é a pessoa usuária inicial. Gostaríamos de ter uma interface com ela na qual pudéssemos trocar mais ideias, nos planejar melhor e sermos mais sustentáveis com dinheiro, dieta e calorias, entre outras ideias que contemplamos em conjunto.
Há uma frase do Reid Hoffman que diz: “Se você não se envergonha da primeira versão do seu produto, você lançou tarde demais.” Este é um disclaimer (aviso) que trazemos aqui, porque nosso produto ainda não está muito bonito. E tudo bem: vamos falar de MVP (produto mínimo viável) em seguida, e faz parte lançar uma primeira versão, iterar e então continuar a evoluir.
Vamos à demonstração prática agora. Vamos pressionar Alt+Tab e mostrar o que foi desenvolvido. Esta é a versão desktop (computador), mas já a concebemos como um produto mobile (dispositivos móveis); queremos utilizá-la com toda a facilidade do celular. E o Musa Balance é um suporte para a pessoa cozinheira doméstica, ajudando no dia a dia.
O sistema apresenta, no topo, as funções mais importantes para nós: as porções vivas, ou seja, o que já temos de comida pronta na geladeira, porcionado. Nós costumamos guardar tudo porcionado.
Em “Vencimento”, há um prazo definido; nós vamos explicar. Também configuramos os tetos da semana. Sejam bem-vindos. Vamos ver nossa geladeira; estamos nos sentindo até Ana Maria Braga.
O que há aqui dentro? Temos cebola-roxa. O sistema já consolida nosso estoque. Como está funcionando: quando criamos uma receita, esperamos que ele faça o débito de todos os itens utilizados. Quando adicionamos uma nota fiscal — fluxo que vamos executar aqui —, esperamos que ele adicione esses itens para nós.
Há uma sugestão de carbonara; o sistema está sugerindo peito de peru defumado e bacon de peru. Não gostamos das sugestões; vamos trabalhar nisso. Também há a opção de importar a nota fiscal.
Outra funcionalidade que utilizamos bastante é o feed (feed). Nós conversamos por meio de um chat (conversa) no Telegram. Optamos pelo Telegram porque é mais fácil integrar um bot (robô) por meio da API (interface de programação de aplicações) do que no WhatsApp. Não há outro motivo além da agilidade.
Conseguimos ver o que minha esposa trouxe; ela normalmente traz as ideias. Não gostaríamos que isso acontecesse aqui, mas o filtro apresentou falha. Vamos aplicar o filtro “todos”. Aqui conseguimos ver a conversa do feed (feed) de todas as pessoas.
Houve uma passada rápida no mercado; a nota fiscal está abaixo. Veio uma nota no dia 21, dia anterior à gravação que estamos fazendo hoje. Minha esposa avisou que queria um carbonara. Ela também registrou o que comeu: frango, arroz, batata palha e limonada. Ela insere aqui os desejos; no caso, um risoto de camarão no sábado. Colocamos alguns lembretes: nós ainda temos comida na geladeira — provavelmente mencionado na conversa.
O que o bot (robô) capturou de nós foi o seguinte: ela sugeriu irmos ao McDonald’s, o que é uma sugestão recorrente. Informamos que ainda há lasanha, uma preparação feita em casa, portanto mais saudável. É bastante calórica, mas é preparada em casa e está dentro da nossa sustentabilidade. Essa é a visão do produto.
Aqui conseguimos falar como se fôssemos “Diego” ou “esposa”. Vamos inserir uma frase: “Vamos sair para comer pizza napoletana sábado à noite, dia 22/08, para ser mais exato”. Não é exatamente como minha esposa fala, mas estamos forçando a formulação para que o bot (robô) registre de forma clara e possamos observar os evals (avaliações).
O sistema já capturou a sugestão de sair para comer pizza napoletana. Ao clicarmos em “mediar com a casa”, ele começa a realizar algumas ações. Essas ações ainda não aparecem no produto como um todo; gostaríamos disso, e isso deve surgir ao longo do desenvolvimento. À medida que formos construindo juntos e aprendendo com os evals (avaliações), vamos adicionando novas funcionalidades, e fará sentido essa mediação aparecer.
Em background (processo em segundo plano), o que acontece? Nosso agente de geração — atualmente utilizamos o SONET — avalia todas as opções existentes dentro do produto: banco de dados, restrições e regras de negócio, e traz novas ideias.
O mediador respondeu em aproximadamente 15 a 20 segundos. A resposta foi: “Consultei estoque, validade, preferências e o orçamento antes de comentar. Aqui está o que encontrei: pizza napoletana fora sábado à noite. Orçamento semanal sem teto configurado; consultar orçamento retornou teto calórico nulo, teto financeiro nulo, só um relato contabilizado até agora. Isso significa que não dá para mostrar um saldo real para essa decisão. Não vou estimar de cabeça nem inventar dados. Se vocês querem que eu meça um impacto certo para comer fora de verdade, sugiro configurar um teto semanal.”
Ele já indicou que precisamos ajustar configurações e outras preferências da casa. Atenção: a casa tem restrição de evitar carne de porco; a pizza napoletana clássica utiliza molho de tomate e muçarela de búfala. Falta pontuação nesse trecho; será interessante quando formos analisar esses traces (rastros de execução).
Estamos avançando muito no produto porque realmente nos empolgamos. Por enquanto, nós paramos por aqui. Voltamos para nossa aula e começamos a olhar para os pilares da operação. Na sequência, em breve, voltamos a falar de produto.
Agora que vocês viram o nosso produto, vamos pensar em como utilizar boas práticas para compreendê-lo e torná-lo melhor. A melhor citação que encontramos aqui — incrivelmente de 2023; na data em que estamos gravando esta aula, já se passaram quase três anos desde sua publicação — é de Greg Brockman, um dos cofundadores da OpenAI: as evals (avaliações) são, surpreendentemente, o que precisamos na maioria das vezes. Isso é algo notável, porque, conforme fomos estudando e utilizando mais produtos de AI (Inteligência Artificial) e mergulhando nesse campo para criar esta aula, concordamos amplamente. Temos três pilares que vamos abordar, e as evals (avaliações) realmente nos permitem aprender em outra velocidade e continuar transformando nosso produto em algo cada vez mais personalizado, com uma experiência melhor para a pessoa usuária.
Trazemos também uma reflexão nossa: o momento é paradoxal. De um lado, estamos cuidando de um produto que torna a vida das pessoas mais fácil por meio de AI (Inteligência Artificial); de outro, o mundo fica mais complexo porque precisamos lidar com a complexidade desse produto de AI. Pensemos: as pessoas que construíram o ChatGPT cuidam de toda a complexidade matemática para fazê-lo funcionar, assim como da infraestrutura de cloud (computação em nuvem), com cada vez mais funcionalidades. Elas cuidam de um produto que, quando chega a nós por meio da interface, é muito simples. A aula anterior, sobre construção do produto, torna nossa vida mais simples. Os conceitos que vamos trabalhar e estudar hoje poderiam ser complexos, mas a vida se torna mais simples por conta da AI (Inteligência Artificial). Isso é, de certa forma, transferido a nós, com responsabilidade. Nosso produto é entregue à pessoa cliente para facilitar sua vida; porém, nos bastidores, estamos operando (run [operação]), cuidando e gerenciando o produto, o que envolve certa complexidade. Portanto, vemos este momento da AI (Inteligência Artificial) como bastante paradoxal.
Sobre build (construção) e run (operação), refletimos bastante sobre esses dois termos. Apreciamos a fase de build (construção), na qual podemos idealizar, e temos experiência pregressa com equipes pequenas e grandes de pessoas desenvolvedoras. Gostamos da parte de build (construção) porque nos aproximamos da realidade. O run (operação) indica o momento em que o produto ganha vida, vai ao mercado e precisamos gerenciá-lo. Já passamos pelo build (construção) em aulas anteriores, então daremos foco ao run (operação).
Gostamos de operar sob a premissa de perguntas norteadoras. Fazemos perguntas constantemente até chegarmos a respostas satisfatórias. A primeira, nesta trilha da aula de AI Product Builder (construção de produto de IA), é: como saber se estamos fazendo uma boa gestão, se nosso run (operação) está sendo eficaz? Trazemos três perguntas que ajudam a expandir a maneira como interagimos com este momento e com esta trilha:
Ao olharmos para a primeira pergunta, pensamos em resolver um job (tarefa) de determinada forma. Prestamos um serviço, por meio de nossa aplicação, para um número de pessoas usuárias. A solução está fazendo o que esperávamos, ou está se afastando demais da expectativa?
Quanto ao que acontece quando a solução encontra pessoas usuárias reais, ela sai do nosso mundo restrito — nossa garagem, nosso workshop (oficina). Agora está sendo utilizada por outras pessoas, em estados mentais e cognitivos distintos, e em dispositivos diferentes.
O que acontece quando a IA sai de um contexto fechado para um contexto de pessoa usuária? Podemos operar a solução dessa forma? Como hoje temos uma possibilidade muito ampla de personalizar e nos conectar com a pessoa usuária, precisamos pensar em como tratamos informações sensíveis.
Por isso, vamos apresentar os três pilares de operação que dão o título à nossa aula. São três lentes complementares que garantem que qualidade, confiabilidade e responsabilidade estejam presentes em nosso produto de IA quando entra em produção.
A primeira é Evals (avaliações): verificamos se os enunciados e as respostas evoluem como esperado e se a IA faz o que deveria. As Evals nos ajudam a avaliar a qualidade das respostas e o comportamento da IA. Quando testamos no nosso cenário de construção de produto, costumamos usar o nosso VS (editor) e formular perguntas que talvez não variem tanto. Por um lado, isso é útil para as Evals, pois entendemos qual é o padrão ouro de perguntas que esperamos que a IA responda. Por outro, precisamos entender o que ocorre quando a IA deixa de funcionar como esperado. Alguns fatores contribuem para isso: mudanças de prompt (instrução) — mesmo pequenas —, ou a troca do modelo por outro que, embora mais barato, se comporta de outra forma. Assim, geramos economia no run (execução) do nosso produto, mas alteramos a expectativa sobre o que ele fazia anteriormente. Portanto, é fundamental que as Evals estejam em operação e que monitoremos os traces (rastros) da interação humano-IA para focar, como indicado na parte inferior do slide, em qualidade, precisão, segurança e aderência ao esperado.
O segundo pilar é a Observabilidade: o que está acontecendo com o nosso produto? A pergunta do slide anterior ganha destaque aqui. Precisamos ver como o sistema funciona em tempo real, como as pessoas usuárias estão utilizando, se conseguem explorar alguma brecha maliciosa ou fraudulenta, ou se a maneira como pensamos que funcionaria não está funcionando na prática. Em observabilidade, um ponto central é o tempo de latência; é nosso principal foco nesta lista de prioridades. Podemos ter um prompt (instrução) excelente e resolver um problema extenso, mas, sob a perspectiva da pessoa cliente e de sua expectativa, ela pode entender que o sistema parou de funcionar e talvez nunca veja o fim desse job (tarefa) se houver demora. Embora pareça pouco, 20 segundos, em uma economia em que a atenção é tão concorrida, podem ser suficientes para perder a pessoa cliente, mesmo que o produto esteja realizando um trabalho excepcional. Precisamos refletir sobre isso e como contornar esse cenário.
Por fim, o pilar da Conformidade nos leva a perguntar se estamos fazendo do jeito certo e responsável. A LGPD é a primeira consideração: tratamento de dados conta com uma área inteira dedicada ao tema; vamos abordar alguns pontos para quem não conhece. Precisamos considerar que o nível de personalização promovido pelos agentes de interação atuais — as LLMs (Modelos de Linguagem de Grande Porte) —, quando colocados diante da pessoa usuária, cria um vínculo muito mais forte com a pessoa cliente e nos dá acesso a informações sensíveis que não eram acessadas quando a interação se dava por meio de formulário. Devemos, portanto, ter muito cuidado para verificar se estamos cumprindo os requisitos de conformidade do nosso produto.
Esses são os três pilares que dão nome à nossa aula.
O curso Produtos com IA: Evals, observabilidade e conformidade possui 254 minutos de vídeos, em um total de 49 atividades. Gostou? Conheça nossos outros cursos de IA para Produto & Negócio em Inteligência Artificial, ou leia nossos artigos de Inteligência Artificial.
Matricule-se e comece a estudar com a gente hoje! Conheça outros tópicos abordados durante o curso:
O Plano Plus evoluiu: agora com Luri para impulsionar sua carreira com os melhores cursos e acesso à maior comunidade tech.
2 anos de Alura
Matricule-se no plano PLUS 24 e garanta:
Jornada de estudos progressiva que te guia desde os fundamentos até a atuação prática. Você acompanha sua evolução, entende os próximos passos e se aprofunda nos conteúdos com quem é referência no mercado.
Back-end, Dados, Front-end, DevOps, Mobile, Gestão & Negócios, UX & Design, Cibersegurança, Cloud, Inteligência Artificial
Formações com mais de 1500 cursos atualizados e novos lançamentos semanais, em Programação, Inteligência Artificial, Front-end, UX & Design, Data Science, Mobile, DevOps e Inovação & Gestão.
A cada curso ou formação concluído, um novo certificado para turbinar seu currículo e LinkedIn.
Acesso à inteligência artificial da Alura.
No Discord, você participa de eventos exclusivos, pode tirar dúvidas em estudos colaborativos e ainda conta com mentorias em grupo com especialistas de diversas áreas.
Catálogo de tecnologia para quem é da área de Marketing
Faça parte da maior comunidade Dev do país e crie conexões com mais de 120 mil pessoas no Discord.
Acesso ilimitado ao catálogo de Imersões da Alura para praticar conhecimentos em diferentes áreas.
Explore um universo de possibilidades na palma da sua mão. Baixe as aulas para assistir offline, onde e quando quiser.
20% de desconto na Pós Tech
Luri Vision chegou no Plano Pro: a IA da Alura que enxerga suas dúvidas, acelera seu aprendizado e conta também com o Alura Língua que prepara você para competir no mercado internacional.
2 anos de Alura
Todos os benefícios do PLUS 24 e mais vantagens exclusivas:
Acesso ao catálogo da Casa do Código e leitura dentro da plataforma
Modo entrevista - Pratique situações reais e evolua com feedback personalizado
Envie imagens para a Luri e ela te ajuda a solucionar problemas, identificar erros, esclarecer gráficos, analisar design e muito mais.
Aprenda um novo idioma e expanda seus horizontes profissionais. Cursos de Inglês, Espanhol e Inglês para Devs, 100% focado em tecnologia.
Para quem quer atingir seus objetivos mais rápido: Luri Vision ilimitado, vagas de emprego exclusivas e mentorias para acelerar cada etapa da jornada.
2 anos de Alura
Todos os benefícios do PRO 24 e mais vantagens exclusivas:
Envie imagens para a Luri e ela te ajuda a solucionar problemas, identificar erros, esclarecer gráficos, analisar design e muito mais de forma ilimitada.
Lives CareerUp: eventos exclusivos com foco em empregabilidade e carreira
Mentorias de carreira: 2 encontros individuais com mentores do Talent Lab
Conecte-se ao mercado com mentoria individual personalizada, vagas exclusivas e networking estratégico que impulsionam sua carreira tech para o próximo nível.