<style> @import url('https://fonts.googleapis.com/css2?family=DM+Sans:wght@400;500;600;700&family=Source+Serif+4:wght@500;600;700&display=swap'); :root { --navy:#102A43; --teal:#087E83; --mint:#DDF3EF; --gold:#E5A93D; --ink:#243B53; --muted:#627D98; --paper:#FFFFFF; --mist:#F2F6F8; --line:#D9E2EC; } * { box-sizing:border-box; } .remark-slide-content { font-family:'DM Sans',Arial,sans-serif; color:var(--ink); background:linear-gradient(145deg,#fff 0%,#f7fafb 100%); border-top:6px solid var(--teal); padding:1.05em 1.65em 1em; font-size:20px; line-height:1.32; } .remark-slide-content h1,.remark-slide-content h2,.remark-slide-content h3 { font-family:'Source Serif 4',Georgia,serif; color:var(--navy); letter-spacing:-.025em; } .remark-slide-content h1 { font-size:1.62em; margin:0 0 .38em; line-height:1.08; } .remark-slide-content h2 { font-size:1.08em; margin:.3em 0 .2em; color:var(--teal); } .remark-slide-content h3 { font-size:.9em; margin:.25em 0; } .remark-slide-content p { margin:.32em 0; } .remark-slide-content ul,.remark-slide-content ol { margin:.28em 0 .2em; padding-left:1.2em; } .remark-slide-content li { margin:.2em 0; } .remark-slide-content strong { color:var(--navy); } .remark-slide-content table { width:100%; border-collapse:collapse; font-size:.76em; margin:.55em 0; box-shadow:0 5px 18px rgba(16,42,67,.07); } .remark-slide-content th { background:var(--navy); color:#fff; font-weight:600; text-align:left; } .remark-slide-content td,.remark-slide-content th { border:1px solid var(--line); padding:.42em .55em; vertical-align:top; } .remark-slide-content tr:nth-child(even) td { background:var(--mist); } .remark-slide-number { color:var(--muted); font-size:12px; opacity:.85; } .inverse { background:radial-gradient(ellipse at 82% 12%,#176b70 0%,#123e59 38%,#102A43 100%); border-top:0; color:#fff; text-shadow:none; } .inverse h1,.inverse h2,.inverse strong { color:#fff; } .inverse h2 { color:#75D5C7; } .inverse .card { background:rgba(255,255,255,.08); border-color:rgba(255,255,255,.18); color:#fff; } .inverse .card b { color:#75D5C7; } .kicker { color:var(--teal); text-transform:uppercase; letter-spacing:.12em; font-size:.62em; font-weight:700; margin-bottom:.55em; } .inverse .kicker { color:#75D5C7; } .small { font-size:.74em; color:var(--muted); } .question { display:block; border-left:4px solid var(--gold); padding:.48em .75em; background:#FFF8E8; color:var(--navy); font-weight:600; margin:.6em 0; font-size:.88em; } .caution { display:block; border-left:4px solid var(--gold); padding:.45em .7em; background:#FFF8E8; color:#75430F; font-weight:600; margin:.5em 0; font-size:.86em; } .cardrow { display:flex; gap:14px; margin:.65em 0; align-items:stretch; } .card { flex:1; background:var(--mist); border:1px solid var(--line); border-top:4px solid var(--teal); border-radius:10px; padding:.62em .72em; font-size:.8em; box-shadow:0 5px 16px rgba(16,42,67,.06); } .card b { color:var(--navy); } .chain { display:flex; gap:8px; align-items:stretch; margin:.85em 0; } .step { flex:1; text-align:center; background:var(--mist); border:1px solid var(--line); border-radius:9px; padding:.62em .42em; font-size:.76em; } .arrow { align-self:center; color:var(--gold); font-size:1.3em; font-weight:700; } .modelhead { color:var(--teal); font-size:.78em; font-weight:700; text-transform:uppercase; letter-spacing:.08em; } .modelbox { background:var(--mist); border-left:4px solid var(--teal); padding:.48em .72em; margin:.42em 0; border-radius:0 7px 7px 0; font-size:.82em; } .title-mark { width:62px; height:5px; background:#75D5C7; margin:.3em auto 1em; border-radius:4px; } .ref { font-size:.66em; line-height:1.25; } /* A capa usa estilos por posição para evitar que a diretiva de classe apareça como texto. */ .remark-slide-container:first-child .remark-slide-content { display:flex; flex-direction:column; justify-content:center; align-items:center; text-align:center; color:#fff; background:radial-gradient(ellipse at 82% 12%,#176b70 0%,#123e59 38%,#102A43 100%); border-top:0; text-shadow:none; } .remark-slide-container:first-child .remark-slide-content h1, .remark-slide-container:first-child .remark-slide-content h2, .remark-slide-container:first-child .remark-slide-content strong { color:#fff; } .remark-slide-container:first-child .remark-slide-content h1 { max-width:900px; font-size:1.8em; } .remark-slide-container:first-child .remark-slide-content h2 { color:#B9F2E9; } .remark-slide-container:first-child .remark-slide-content .kicker { color:#B9F2E9; } .cover-subtitle { display:inline-block; max-width:850px; margin:.8em auto .45em; padding:.55em .9em; color:#fff !important; background:rgba(3,25,53,.78); border:1px solid rgba(255,255,255,.35); border-radius:10px; font-size:.86em; font-weight:700; line-height:1.35; text-shadow:none; } .cover-event { margin:.2em 0 .55em; color:#D9E2EC; font-size:.78em; font-weight:600; letter-spacing:.04em; } .cover-details { display:flex; justify-content:center; flex-wrap:wrap; gap:9px; max-width:950px; margin:.35em auto; } .cover-detail { padding:.4em .72em; background:rgba(255,255,255,.10); border:1px solid rgba(255,255,255,.25); border-radius:8px; color:#fff; font-size:.72em; } .cover-instructor { margin:.4em 0 0; color:#fff; font-size:.78em; font-weight:700; } @media (max-width:800px) { .cardrow,.chain { gap:7px; } .card { padding:.48em; } } .roadmap .card { font-size:.76em; line-height:1.28; } .roadmap .card li { margin:.16em 0; } </style> <div class="kicker">Minicurso · Tópicos de Estatística para IA</div> # Probabilidade: a linguagem de fundo da IA <div class="title-mark"></div> ## O que os modelos aprendem quando aprendem com dados? <div class="cover-subtitle">Da evidência incompleta à previsão — e da previsão à decisão responsável.</div> <div class="cover-event">CONECTech · Conferência de Tecnologia do ICET</div> <div class="cover-details"><span class="cover-detail">28 e 30/09 · 14h</span><span class="cover-detail">Laboratório 309 · Bloco D</span></div> <div class="cover-instructor">Instrutor: Prof. Dr. Hidelbrando Ferreira Rodrigues</div> **Pergunta de partida:** como um sistema transforma evidências incompletas em previsões ou decisões? --- # Roteiro do minicurso — duas aulas, uma investigação Vamos acompanhar um problema de monitoramento de software: **como avaliar um alerta e usar dados para antecipar o comportamento de um serviço?** <div class="cardrow roadmap"> <div class="card"><b>Aula 01 · Da incerteza à decisão</b><ul><li>Experimentos aleatórios, espaço amostral e eventos;</li><li>Probabilidades clássica e frequentista;</li><li>Probabilidades marginais, conjuntas e condicionais;</li><li>Independência, probabilidade total e Teorema de Bayes;</li><li>Matriz de confusão: comparar alertas com falhas observadas.</li></ul><b>Questão-guia:</b> dado um alerta, qual é a chance de falha — e que decisão os dados sustentam?</div> <div class="card"><b>Aula 02 · Modelos para contar, medir e prever</b><ul><li>Variáveis discretas e contínuas;</li><li>Binomial, Poisson, Binomial Negativa, Exponencial, Normal e Normal Padrão;</li><li>Regressão linear simples e múltipla;</li><li>Séries temporais: tendências, padrões e previsão no tempo;</li><li>Hipóteses, avaliação e limites dos modelos.</li></ul><b>Questão-guia:</b> como modelar contagens e medidas, relacionar fatores e antecipar mudanças no serviço?</div> </div> <div class="question">Fio condutor: partir de um problema realista, escolher conceitos e modelos adequados e justificar uma decisão sem esconder a incerteza.</div> --- # De onde vem a Inteligência Artificial? A IA não surgiu isolada: seus modelos dialogam com perguntas anteriores sobre incerteza, dados, linguagem, decisão e aprendizagem. <div class="question">Quando uma máquina parece “aprender”, o que exatamente está aprendendo?</div> --- # Antes dos algoritmos: o que é aprender? Uma IA aprende como uma pessoa aprende, ou encontra regularidades em exemplos? - Se um sistema reconhece spam, ele compreende uma mensagem ou estima padrões associados a spam? - Se recomenda um filme, sabe que você vai gostar ou calcula uma preferência provável? - Se prevê uma falha, conhece o futuro ou combina sinais incompletos? <div class="question">Que diferença há entre reconhecer um padrão, explicar uma causa e compreender um fenômeno?</div> --- # A IA surgiu sem matemática anterior? Modelos de IA não apareceram do nada: herdaram perguntas e ferramentas de áreas que estudavam **incerteza, dados, linguagem, decisão e aprendizagem**. <div class="cardrow"> <div class="card"><b>Probabilidade</b><br>Como representar eventos incertos e atualizar crenças diante de evidências?</div> <div class="card"><b>Estatística</b><br>Como aprender sobre uma população a partir de observações limitadas?</div> <div class="card"><b>Otimização e informação</b><br>Como ajustar um modelo e medir o que os dados revelam?</div> </div> **Pense:** qual dessas perguntas parece mais próxima de um sistema de recomendação? E de um detector de fraude? --- # Perguntas antigas, sistemas contemporâneos - **Como atualizar uma crença com evidências?** Uma pergunta associada ao trabalho de Bayes e Laplace. - **Como descrever sequências aleatórias?** Uma questão estudada por Markov e desenvolvida em modelos de estados. - **Como estimar relações entre variáveis?** Uma tradição da Estatística que inclui regressões e modelos de classificação. - **Como escolher uma ação diante de resultados incertos?** Uma ponte entre probabilidade, teoria da decisão e aprendizagem por reforço. As ideias mudaram e foram combinadas com computação, grandes bases de dados e novos métodos. **A história não é uma linha única nem uma origem exclusiva.** --- # Como investigar a origem de um modelo? Ao conhecer um algoritmo, não basta perguntar “para que serve?”. Investigue quatro aspectos: <div class="cardrow"> <div class="card"><b>1. Tarefa</b><br>Que problema tenta resolver?</div> <div class="card"><b>2. Evidência</b><br>Que dados observa e que incerteza permanece?</div> <div class="card"><b>3. Fundamento</b><br>Que ideia estatística, probabilística ou computacional utiliza?</div> <div class="card"><b>4. Limite</b><br>Que pressuposto pode falhar no contexto real?</div> </div> **Exemplo:** para recomendar documentação, identifique a tarefa, observe interações, descubra como o modelo representa preferências e verifique se as sugestões ajudam de fato. <div class="question">Em que etapa a probabilidade participa deste modelo — e que tipo de resposta ele realmente produz?</div> --- # 1. Naive Bayes: aprender com evidências <div class="modelbox"><span class="modelhead">O que faz</span><br>Classifica um caso combinando a frequência das classes com a evidência observada.</div> <div class="modelbox"><span class="modelhead">Ligação com Probabilidade</span><br>Usa o Teorema de Bayes: atualiza a probabilidade de uma classe à luz de características observadas. A versão “naive” simplifica o cálculo assumindo independência condicional entre características.</div> <div class="modelbox"><span class="modelhead">Exemplo em software</span><br>Classificar um chamado de suporte como “falha de autenticação”, “problema de rede” ou “dúvida de uso” a partir dos termos da descrição.</div> <div class="caution">Limite para discutir:</div> as palavras não são realmente independentes; por que o método ainda pode ser útil? --- # 2. Redes Bayesianas: representar dependências <div class="modelbox"><span class="modelhead">O que fazem</span><br>Representam variáveis e suas dependências por um grafo direcionado, com distribuições condicionais nos nós.</div> <div class="modelbox"><span class="modelhead">Ligação com Probabilidade</span><br>Permitem calcular como evidências alteram probabilidades de hipóteses, respeitando a estrutura de dependências especificada.</div> <div class="modelbox"><span class="modelhead">Exemplo em sistemas</span><br>Relacionar aumento de latência, saturação de memória e falhas de conexão para estimar hipóteses sobre a degradação de um serviço.</div> <div class="caution">Limite para discutir:</div> uma seta no grafo prova causalidade, ou codifica uma hipótese que precisa ser justificada? --- # 3. Regressão logística: estimar chance de uma classe <div class="modelbox"><span class="modelhead">O que faz</span><br>Estima a probabilidade condicional de um resultado categórico, como fraude/não fraude ou falha/não falha.</div> <div class="modelbox"><span class="modelhead">Ligação com Estatística</span><br>Relaciona variáveis explicativas à chance do resultado por meio da função logística; seus parâmetros são estimados a partir de dados.</div> <div class="modelbox"><span class="modelhead">Exemplo em software</span><br>Usar volume de requisições, taxa de erros e uso de memória para estimar o risco de um incidente nas próximas horas.</div> <div class="question">Se o modelo prevê 0,8, isso significa que oito em cada dez casos comparáveis devem ocorrer? Que condições precisam valer?</div> --- # 4. Árvores de decisão: dividir casos por evidência <div class="modelbox"><span class="modelhead">O que fazem</span><br>Aplicam uma sequência de regras para separar os casos e produzir uma classe ou estimativa.</div> <div class="modelbox"><span class="modelhead">Ligação estatística</span><br>Critérios como entropia e índice de Gini medem a mistura das classes em cada divisão. A árvore, por si só, não é necessariamente um modelo probabilístico.</div> <div class="modelbox"><span class="modelhead">Exemplo em software</span><br>Priorizar um chamado: se o serviço é crítico e há muitos usuários afetados, encaminhar para atendimento urgente.</div> <div class="question">Uma regra fácil de explicar é sempre uma regra correta? O que acontece se os dados de treinamento forem enviesados?</div> --- # 5. Random Forest: combinar muitas árvores <div class="modelbox"><span class="modelhead">O que faz</span><br>Combina previsões de várias árvores treinadas com amostras e subconjuntos de variáveis selecionados aleatoriamente.</div> <div class="modelbox"><span class="modelhead">Ligação estatística</span><br>Usa amostragem, aleatoriedade e agregação para reduzir a instabilidade de uma árvore isolada. A fração de votos pode ser tratada como escore ou estimativa, mas não garante calibração.</div> <div class="modelbox"><span class="modelhead">Exemplo em software</span><br>Identificar quais implantações têm maior risco de gerar incidentes, considerando histórico de mudanças, testes e componentes afetados.</div> <div class="caution">Distinção importante:</div> muitas árvores concordarem não significa automaticamente que a confiança esteja bem calibrada. --- # 6. Máquinas de Vetores de Suporte: separar com margem <div class="modelbox"><span class="modelhead">O que fazem</span><br>Aprendem uma fronteira que separa classes, buscando uma margem ampla entre os casos.</div> <div class="modelbox"><span class="modelhead">Ligação com aprendizagem estatística</span><br>O vínculo central está na generalização, na regularização e na teoria da aprendizagem. Uma SVM padrão produz uma decisão ou escore, não necessariamente uma probabilidade.</div> <div class="modelbox"><span class="modelhead">Exemplo em software</span><br>Separar tráfego potencialmente malicioso de tráfego usual com base em características de conexões.</div> <div class="question">Por que um escore positivo não é o mesmo que “90% de chance”? Como poderíamos calibrar ou avaliar a saída?</div> --- # 7. Redes neurais: ajustar parâmetros a partir de dados <div class="modelbox"><span class="modelhead">O que fazem</span><br>Aprendem representações e relações complexas por meio de camadas de operações e ajuste iterativo de parâmetros.</div> <div class="modelbox"><span class="modelhead">Ligação com Estatística e Probabilidade</span><br>Aprendizagem baseada em dados, otimização e funções de perda. Em classificação, saídas como softmax são interpretadas como distribuições, mas podem estar mal calibradas.</div> <div class="modelbox"><span class="modelhead">Exemplo em software</span><br>Detectar padrões em imagens de interfaces, logs ou sequências de eventos para classificar defeitos.</div> <div class="caution">Limite para discutir:</div> por que uma rede pode parecer muito confiante e ainda assim errar? --- # 8. Modelos de linguagem: prever o próximo elemento <div class="modelbox"><span class="modelhead">O que fazem</span><br>Estimam distribuições sobre o próximo token — uma unidade de texto — condicionado ao contexto anterior, e repetem esse processo para gerar sequências.</div> <div class="modelbox"><span class="modelhead">Ligação com Probabilidade</span><br>O treinamento ajusta parâmetros para atribuir maior probabilidade aos textos observados. A geração envolve escolhas entre tokens plausíveis segundo a distribuição aprendida.</div> <div class="modelbox"><span class="modelhead">Exemplo em Engenharia de Software</span><br>Resumir documentação, sugerir uma explicação para um erro ou rascunhar testes a partir de uma especificação.</div> <div class="caution">Distinção essencial:</div> uma sequência provável e fluente não é necessariamente verdadeira, atual ou adequada. --- # 9. K-means: encontrar grupos por proximidade <div class="modelbox"><span class="modelhead">O que faz</span><br>Agrupa observações em torno de centros, minimizando as distâncias internas aos grupos.</div> <div class="modelbox"><span class="modelhead">Ligação com Estatística</span><br>É principalmente um método geométrico de otimização, não um modelo probabilístico. Sob pressupostos específicos, sua função objetivo se relaciona a casos particulares de misturas Gaussianas.</div> <div class="modelbox"><span class="modelhead">Exemplo em sistemas</span><br>Agrupar sessões de usuários por padrões de uso para explorar perfis de interação, sem conhecer previamente os rótulos.</div> <div class="question">Os grupos encontrados são categorias naturais do mundo, ou dependem das variáveis, da escala e do número de grupos escolhidos?</div> --- # 10. Misturas Gaussianas: grupos com incerteza <div class="modelbox"><span class="modelhead">O que fazem</span><br>Representam os dados como combinação de distribuições, permitindo que cada observação pertença a grupos com diferentes graus de probabilidade.</div> <div class="modelbox"><span class="modelhead">Ligação com Probabilidade</span><br>Modelam densidades e estimam parâmetros; o algoritmo EM alterna estimativas de pertencimento aos grupos e atualização dos parâmetros.</div> <div class="modelbox"><span class="modelhead">Exemplo em sistemas</span><br>Descobrir perfis de carga de uma aplicação quando os padrões se sobrepõem, em vez de forçar cada período a um grupo rígido.</div> <div class="question">Quando é mais honesto dizer “este caso pode pertencer a dois perfis” do que atribuí-lo a um único grupo?</div> --- # 11. Modelos de Markov ocultos: inferir estados em sequências <div class="modelbox"><span class="modelhead">O que fazem</span><br>Representam sequências com estados que não observamos diretamente e eventos que são observados.</div> <div class="modelbox"><span class="modelhead">Ligação com Probabilidade</span><br>Usam probabilidades de transição entre estados e probabilidades de emissão das observações em cada estado.</div> <div class="modelbox"><span class="modelhead">Exemplo em software</span><br>Inferir se um serviço está “normal”, “degradado” ou “em recuperação” a partir de uma sequência de métricas e alertas.</div> <div class="question">Como a ordem dos eventos muda a interpretação, mesmo quando o conjunto de alertas é o mesmo?</div> --- # 12. Aprendizagem por reforço: agir e aprender com consequências <div class="modelbox"><span class="modelhead">O que faz</span><br>Aprende uma política de ações por meio de recompensas ou custos recebidos ao interagir com um ambiente.</div> <div class="modelbox"><span class="modelhead">Ligação com Probabilidade</span><br>Transições, recompensas e resultados futuros podem ser incertos; métodos comparam retornos esperados e exploram a incerteza.</div> <div class="modelbox"><span class="modelhead">Exemplo em sistemas</span><br>Decidir como distribuir recursos de computação entre serviços sob demanda variável, respeitando latência e custo.</div> <div class="caution">Questão ética e técnica:</div> como aprender sem que a exploração cause danos reais aos usuários? --- # O que os modelos têm em comum — e o que não têm? <div class="cardrow"> <div class="card"><b>Probabilidade explícita</b><br>Naive Bayes, redes Bayesianas, regressão logística, HMM e modelos de linguagem representam distribuições ou probabilidades.</div> <div class="card"><b>Aprendizagem estatística</b><br>Árvores, Random Forest, SVM e redes neurais aprendem padrões e parâmetros; a saída não é sempre uma probabilidade.</div> <div class="card"><b>Decisão ou estrutura</b><br>K-means organiza observações por distância; reforço escolhe ações considerando consequências e incerteza.</div> </div> **Ideia central:** os modelos não têm uma única origem. Eles combinam, em proporções distintas, probabilidade, Estatística, otimização, informação e computação. --- # Grafo-síntese: um percurso que dá para ler <div class="chain"> <div class="step"><b>Problema</b><br>classificar<br>prever<br>agrupar<br>decidir</div><div class="arrow">→</div> <div class="step"><b>Fundamento</b><br>Bayes<br>estimação<br>entropia<br>retorno esperado</div><div class="arrow">→</div> <div class="step"><b>Famílias de modelos</b><br>Bayes e regressão<br>árvores e SVM<br>redes neurais e linguagem<br>grupos e reforço</div><div class="arrow">→</div> <div class="step"><b>Saída</b><br>classe<br>escore ou probabilidade<br>valor<br>grupo ou ação</div><div class="arrow">→</div> <div class="step"><b>Verificação</b><br>erro<br>calibração<br>utilidade<br>mudança dos dados</div> </div> **Leia da esquerda para a direita:** escolhemos um modelo pelo problema e pelos dados; depois verificamos que tipo de resposta ele produz e se ela é confiável para o uso pretendido. --- # Problema-mote do curso: o serviço vai falhar? Uma plataforma recebe **1.000 implantações**. Nos dados históricos, **40** foram seguidas por uma falha grave em 24 horas. Um alerta automático detecta **80%** das falhas, mas também dispara em **10%** das implantações que não falham. | Situação histórica | Alerta dispara | Alerta não dispara | Total | |---|---:|---:|---:| | Falha em 24 horas | 32 | 8 | 40 | | Sem falha em 24 horas | 96 | 864 | 960 | | **Total** | **128** | **872** | **1.000** | O alerta disparou para uma nova implantação. **O serviço vai falhar?** --- # Perguntas para levar ao longo do curso 1. Se o alerta disparou, qual é a probabilidade de falha — e por que ela não é automaticamente 80%? 2. Como a baixa frequência de falhas muda o significado de um alerta aparentemente preciso? 3. Que evidência adicional alteraria nossa estimativa: memória, latência, histórico de mudanças ou dependências externas? 4. Qual custo é maior: investigar um falso alarme ou deixar passar uma falha grave? 5. Em que limiar devemos agir — e quem assume as consequências dessa escolha? 6. O modelo continuará confiável quando a aplicação, os usuários ou o padrão de tráfego mudarem? **Mote:** ao longo do curso, usaremos Probabilidade e Estatística para passar de “o modelo avisou” a uma decisão justificada, mensurável e revisável. --- # Referências essenciais - Bayes, T. (1763). An essay towards solving a problem in the doctrine of chances. *Philosophical Transactions of the Royal Society of London*, 53, 370–418. - Bishop, C. M. (2006). *Pattern Recognition and Machine Learning*. Springer. - Breiman, L. (2001). Random forests. *Machine Learning*, 45, 5–32. - Goodfellow, I., Bengio, Y., & Courville, A. (2016). *Deep Learning*. MIT Press. - Hastie, T., Tibshirani, R., & Friedman, J. (2009). *The Elements of Statistical Learning* (2nd ed.). Springer. - Murphy, K. P. (2022). *Probabilistic Machine Learning: An Introduction*. MIT Press. - Sutton, R. S., & Barto, A. G. (2018). *Reinforcement Learning: An Introduction* (2nd ed.). MIT Press. --- # Nota de condução didática A sequência começa pela curiosidade epistemológica — **o que significa uma máquina aprender?** — e só depois apresenta os modelos. Em cada slide, convide a turma a distinguir a tarefa, o fundamento matemático, o tipo de saída e os limites do método. O problema final pode ser retomado ao estudar frequência relativa, probabilidade condicional, Teorema de Bayes, valor preditivo, decisão sob custos e calibração. Não antecipe uma interpretação sem discutir a taxa-base: entre os 128 alertas históricos, 32 foram seguidos por falha.