1/164
Looks like no tags are added yet.
Name | Mastery | Learn | Test | Matching | Spaced | Call with Kai | Chat |
|---|
No analytics yet
Send a link to your students to track their progress
O que é a Matriz de Confusão?
Instrumento que relaciona as previsões do modelo com os valores reais do conjunto de testes, exibindo acertos e erros organizados em uma tabela.
O que significa VP (Verdadeiro Positivo)?
O modelo previu como positivo e o valor real também era positivo. É um acerto na classe positiva.
O que significa FN (Falso Negativo)?
O modelo previu como negativo, mas o valor real era positivo. Falha crítica em sistemas de detecção de fraudes ou diagnósticos médicos.
O que significa FP (Falso Positivo)?
O modelo previu como positivo, mas o valor real era negativo. Ex: classificar uma transação legítima como fraude.
Qual a fórmula da Acurácia?
(VP + VN) / (VP + VN + FP + FN) — mede o total de instâncias classificadas corretamente em relação ao total do conjunto de testes.
Qual a fórmula da Precisão?
VP / (VP + FP) — mede a proporção de instâncias classificadas como positivas que realmente são positivas.
Quando a Precisão é máxima (= 1)?
Quando não há nenhum Falso Positivo (FP = 0). Quanto maior o número de FP, menor a precisão.
Qual a soma de todos os elementos de uma matriz de confusão multiclasse?
É igual a n — o número total de objetos do conjunto de testes (amostras testadas). Item I de concursos.
Como calcular a Acurácia numa matriz de confusão multiclasse?
Soma dos elementos da diagonal principal (acertos de cada classe) dividida pela soma de todos os elementos da matriz (= n).
Exemplo prático: VP=80, VN=90, FP=20, FN=10. Qual a Acurácia?
(80 + 90) / (80 + 90 + 20 + 10) = 170 / 200 = 0,85 = 85%
Exemplo prático com Precisão: VP=80, FP=20. Qual a Precisão?
80 / (80 + 20) = 80 / 100 = 0,80 = 80%
Por que o FN é o erro mais crítico em certos contextos?
Porque representa casos reais positivos que o modelo errou como negativos. Ex: deixar passar uma fraude ou não diagnosticar uma doença.
O que a Acurácia NÃO é?
Não é a taxa de acertos apenas das previsões positivas. Ela considera TODAS as previsões corretas (VP + VN) sobre o total de previsões realizadas.
Concurso: a soma de todos os elementos de uma matriz multiclasse é igual a n. Isso é verdadeiro ou falso?
VERDADEIRO. A soma de todos os elementos da matriz de confusão é sempre igual a n (total de objetos testados). Item I é CORRETO.
Concurso: a taxa de acerto do classificador é dada pela razão entre a soma da diagonal principal e a soma de todos os elementos. Verdadeiro ou falso?
VERDADEIRO. Essa é exatamente a fórmula da Acurácia na matriz de confusão multiclasse. Item II é CORRETO.
O que é uma Árvore de Decisão?
Algoritmo de aprendizado de máquina supervisionado que constrói uma estrutura em forma de árvore para tomar decisões. Identifica os atributos que melhor separam os dados em classes, aprendendo a prever y a partir dos atributos x.
O que é o Nó Raiz (Root) em uma árvore de decisão?
É o primeiro nó da árvore (nível 0). Representa a primeira e mais importante decisão — o atributo que melhor separa os dados do conjunto completo. É escolhido pelo maior ganho de informação ou menor índice Gini.
O que são as Folhas (Leaves) em uma árvore de decisão?
São os nós terminais da árvore — não há mais divisões. Contêm a classe predominante (em classificação) ou o valor médio (em regressão). Representam a decisão final do modelo.
O que é Entropia no contexto de árvore de decisão?
Medida de desordem ou incerteza de um conjunto de dados. Quanto mais classes misturadas, maior a entropia. Entropia = 0 quando todos os exemplos são da mesma classe (nó puro). Entropia máxima quando as classes estão equilibradas (ex.: 50/50).
O que é Ganho de Informação?
Métrica que mede o quanto a entropia diminui ao dividir o dataset por um determinado atributo. Representa o ganho de pureza após a divisão. Quanto maior o ganho de informação, melhor é o atributo para a divisão. Usado pelo algoritmo ID3.
O que é o Índice de Gini (Grau de Impureza)?
Métrica que mede a probabilidade de erro ao classificar aleatoriamente um item de um nó. Gini = 0 significa nó puro (todos da mesma classe). Gini alto indica nó misto (impuro). O melhor atributo é o que apresenta menor índice de Gini. Usado pelo algoritmo CART.
O que é Overfitting em árvores de decisão e como ele ocorre?
É a especialização excessiva no conjunto de treinamento. Ocorre quando a árvore possui muitos níveis, separando perfeitamente os dados de treinamento — inclusive dados incorretos. Resultado: ótimo desempenho no treino, péssimo em dados novos.
O que é Poda (Pruning) em árvores de decisão?
Técnica para combater o overfitting. Consiste em remover parte da árvore (sub-árvores), substituindo-as por folhas. Aumenta o erro no treinamento, mas melhora a generalização para dados novos. Tipos: poda pré (durante a construção) e poda pós (após a conclusão da árvore).
Qual a diferença entre Poda Pré e Poda Pós?
Poda Pré (pre-pruning): ocorre durante a construção da árvore, realizando cortes enquanto ela ainda está sendo formada. Poda Pós (post-pruning): ocorre após a árvore estar completamente construída, removendo sub-árvores e substituindo-as por folhas.
Qual a principal limitação do algoritmo ID3?
Trabalha apenas com variáveis categóricas — não aceita variáveis numéricas. Não trata valores ausentes: se o dataset tiver valores faltantes, o ID3 não executa. Também não implementa poda (pruning).
Quais são as principais diferenças entre C4.5 e ID3?
O C4.5 é a evolução do ID3 e adiciona: suporte a variáveis numéricas, tratamento de valores ausentes (por ponderação), uso do ganho de informação normalizado (razão de ganho) em vez do ganho simples. Também implementa poda pós-criação.
O que é exclusivo do algoritmo CART em relação ao ID3 e C4.5?
É o único que realiza regressão (além de classificação), colocando a média dos valores numéricos nas folhas. Também é o único que faz divisões sempre binárias (dois ramos). Usa o índice Gini para classificação e redução de variância para regressão.
Por que a Árvore de Decisão é considerada um algoritmo interpretável/explicável?
Porque ao receber uma entrada e produzir uma saída, é possível rastrear exatamente quais decisões (atributos e valores) levaram àquele resultado. Em contraste, redes neurais não são explicáveis — os dados passam por centenas de neurônios e a lógica interna não é transparente.
Como a Árvore de Decisão divide o espaço de características geometricamente?
Ela divide o espaço em eixos paralelos retangulares, rotulando cada retângulo com uma classe. Cada decisão (nó) corta o espaço ao longo de um atributo, criando regiões distintas que correspondem a diferentes classes.
O que é Random Forest?
Um ensemble (conjunto) de centenas de árvores de decisão treinadas de forma ligeiramente diferente, com subconjuntos de dados distintos, que combinam suas previsões por votação (classificação) ou média (regressão).
O que é um Ensemble no contexto de Machine Learning?
Técnica em que diversos modelos de IA são utilizados em conjunto para realizar tarefas de classificação ou regressão. A decisão final é tomada pela maioria (votação) ou pela média dos resultados.
Por que as árvores de decisão têm alta variância?
Porque qualquer pequena alteração no conjunto de treinamento pode gerar uma árvore de decisão completamente diferente, tornando-a instável e imprevisível.
Qual a principal justificativa para usar Random Forest em vez de uma única Árvore de Decisão?
A redução do risco de overfitting. Com muitas árvores, mesmo que algumas incorram em overfitting, a maioria não o fará, e o resultado agregado será mais robusto.
O que é Amostragem com Reposição (Bootstrap) no contexto de Random Forest?
Técnica de selecionar subconjuntos aleatórios do conjunto de treinamento para treinar cada árvore. Um mesmo dado pode aparecer em múltiplos subconjuntos (com reposição).
Como a Random Forest faz a predição em tarefas de CLASSIFICAÇÃO?
Por votação majoritária: a classe indicada pelo maior número de árvores vence. Ex: 517 árvores indicam classe A e 316 indicam classe B → classe A é a previsão final.
Como a Random Forest faz a predição em tarefas de REGRESSÃO?
Obtém-se a média de todos os valores produzidos pelas centenas de árvores. Essa média constitui a saída (previsão) final da Random Forest.
Random Forest pode ser usada para regressão?
Sim. A Random Forest pode ser usada tanto para classificação quanto para regressão, pois as árvores de decisão que a compõem são aplicáveis a ambos os propósitos.
Qual é a principal DESVANTAGEM da Random Forest em relação a uma única Árvore de Decisão?
Duas: (1) perde a interpretabilidade — com centenas de árvores, fica inviável explicar individualmente cada decisão; (2) é computacionalmente mais pesada, pois envolve centenas ou milhares de árvores.
O que é Overfitting e como a Random Forest o reduz?
Overfitting: modelo decora os dados de treinamento e performa mal em dados novos. A RF reduz porque, com muitas árvores diversas, mesmo que algumas overfitem, a maioria não o fará, e a decisão agregada é mais robusta.
Qual a diferença de interpretabilidade entre Árvore de Decisão e Random Forest?
Uma única árvore permite explicar claramente a origem de cada decisão (alta interpretabilidade). Com 500+ árvores na RF, torna-se inviável justificar individualmente cada decisão — a Random Forest não é interpretável.
Como funciona a predição de um novo dado após o treinamento da Random Forest?
O novo dado é processado por todas as centenas de árvores, que geram centenas de resultados. Em seguida, realiza-se votação (classificação) ou média (regressão) entre as saídas para produzir a previsão final.
Apesar do nome, a Regressão Logística é usada para resolver que tipo de problema?
Problema de classificação, não de regressão. Ela prevê uma classe (ex: sim/não, 0/1), e não um valor numérico contínuo.
Qual função matemática é utilizada pela Regressão Logística?
A função logística (sigmoide): σ(x) = 1 / (1 + e^−x). Ela recebe qualquer valor de entrada e retorna uma saída entre 0 e 1.
Qual é o formato gráfico da função sigmoide e como ela é chamada informalmente?
Tem formato de "S", conhecido informalmente como "S do Senna". Quanto maior o coeficiente, mais íngreme fica a curva. Se o sinal negativo for retirado, a curva é invertida.
A Regressão Logística é um método paramétrico ou não paramétrico? Por quê?
É paramétrico, pois utiliza uma função matemática previamente conhecida (a função sigmoide/logística) para modelar os dados.
A Regressão Logística pode ser usada para classificação multiclasse? Como?
Sim. Executa-se uma regressão logística separada para cada classe (ex: A, B e C). A classe com o maior valor previsto prevalece.
Qual é a principal diferença entre a Regressão Logística e a Regressão Linear?
Na Regressão Linear, a variável dependente é um número contínuo. Na Regressão Logística, a variável dependente é categórica binária (0 ou 1), pois é um problema de classificação.
A função sigmoide da Regressão Logística é a mesma usada nos neurônios de redes neurais?
Sim. É chamada de função de ativação nos neurônios artificiais. A saída 0 ou 1 indica se o neurônio está ativado ou não.
A Regressão Logística pode sofrer overfitting? Como isso é tratado?
Sim, pode ocorrer overfitting. O comportamento pode ser mitigado por meio de técnicas de regularização, que tornam o modelo mais adequado ao conjunto de dados.
Quais são as variáveis independentes da Regressão Logística — categóricas ou numéricas?
As variáveis independentes são, em essência, numéricas (ou um vetor numérico). A variável dependente (saída) é que é categórica binária.
A Regressão Logística pode prever variáveis dependentes contínuas?
Não. A variável prevista não é contínua; é categórica binária. A regressão logística produz valores entre 0 e 1 que representam probabilidade de pertencer a uma classe.
A Regressão Logística é linear ou não linear?
É não linear. Enquanto a regressão linear é baseada em relação linear entre variáveis, a regressão logística utiliza a função sigmoide, que é não linear, e prevê um valor binário.
Qual é um exemplo clássico de aplicação da Regressão Logística?
Prever se um cliente de seguro de automóvel irá ou não acionar um sinistro, com base em variáveis como idade, tempo de habilitação e local de residência. A decisão é binária: sinistro ou não sinistro.
O que é K-NN e qual é a ideia central?
K-Nearest Neighbors = K Vizinhos Mais Próximos. Um ponto desconhecido é classificado pela classe que aparece mais entre os K vizinhos mais próximos a ele no espaço de dados.
K-NN: supervisionado ou não supervisionado? Paramétrico ou não paramétrico?
Supervisionado (precisa de dados com rótulos/classes) e não paramétrico (não assume nenhuma distribuição estatística, não cria função matemática fixa).
K-NN serve só para classificação ou tambéO que é o parâmetro K e quem o define?m para regressão?
Os dois. Classificação: atribui a classe mais votada pelos K vizinhos. Regressão: calcula a média dos valores numéricos dos K vizinhos.K é o número de vizinhos consultados para decidir a classe. Definido pelo cientista de dados (não é aleatório). Use K ímpar com 2 classes para evitar empate. Impacta diretamente o desempenho do modelo.
Como o K-NN mede proximidade entre pontPor que o K-NN exige normalização dos dados?os?
Pela Distância Euclidiana (linha reta). Fórmula 2D: d = raiz((x2-x1)² + (y2-y1)²). Em N dimensões se expande para todos os atributos. É a métrica mais comum, mas não a única.O K-NN calcula distâncias. Se uma variável vai de 0 a 1 e outra de 0 a 100.000, a segunda domina e distorce o resultado. Normalizar coloca todas na mesma escala. Dados categóricos devem ser convertidos em números antes.
Quais são as etapas do K-NN (passo a passo)?
1. Plota todos os pontos de treino no espaço. 2. Chega ponto novo: calcula distância para todos. 3. Seleciona os K mais próximos. 4. Classificação: classe da maioria. Regressão: média dos valores.
O que acontece em caso de empate entre vizinhos no K-NN?
Usa-se o vizinho mais próximo como critério de desempate. Se o empate persistir totalmente (ex: A, B e C com mesma distância), nenhuma classe é escolhida.
V ou F sobre K-NN: (1) Não pode ser usado em classificação. (2) É sensível à escala e requer normalização. (3) É usado em IA para reconhecimento de padrões.
(1) FALSO — K-NN funciona para classificação E regressão. (2) VERDADEIRO — distância é afetada pela escala. (3) VERDADEIRO — KNN é clássico em reconhecimento de padrões.
Dica de prova: como resolver questão de K-NN sem perder tempo?
Desenhe os pontos no gráfico e identifique os K vizinhos visualmente. Não calcule a distância euclidiana manualmente com 4+ atributos — é uma armadilha de tempo. Com 2 atributos, o gráfico resolve tudo.
V ou F: K deve ser escolhido aleatoriamente e não afeta o desempenho do modelo.
FALSO nas duas partes. K é escolha do cientista de dados (não é aleatório) E afeta diretamente o desempenho do modelo.
O que é o algoritmo Naive Bayes?
Família de algoritmos de aprendizado supervisionado baseados em probabilidade. Também chamado de "Bayes Ingênuo", trabalha exclusivamente com classificação — não realiza regressão ou previsões numéricas.
Quais são as duas suposições ingênuas do Naive Bayes?
1. As características (features) do conjunto de dados são independentes entre si.
2. Cada evento contribui igualmente para classificar o resultado.
Qual é a fórmula central do Naive Bayes?
Fórmula de Bayes: P(A|B) = [P(B|A) × P(A)] / P(B)
Onde:
- P(A|B) = probabilidade de A dado B (a posteriori)
- P(B|A) = probabilidade de B dado A
- P(A) = probabilidade de A ocorrer (a priori)
- P(B) = probabilidade de B ocorrer
O Naive Bayes trabalha com probabilidades a priori ou a posteriori?
A posteriori — calcula a probabilidade de um evento ocorrer dado que outro evento já ocorreu. Ex.: probabilidade de um e-mail ser spam dado que contém a palavra "nigeriano".
Como o Naive Bayes aprende no treinamento?
Constrói uma matriz de probabilidades condicionais a partir do dataset. No caso de e-mails: cada coluna = uma palavra, cada linha = um e-mail (1 = presente, 0 = ausente). Aprende a probabilidade de cada palavra ocorrer em spam vs. normais.
Qual é um exemplo clássico de aplicação do Naive Bayes?
Classificação de e-mails como spam ou normais (ex.: Gmail). O algoritmo calcula a probabilidade de spam com base na presença/ausência de palavras como "nigeriano", "vender" (spam) ou "amor" (normal).
Por que a suposição de independência do Naive Bayes é chamada de "ingênua"?
Porque na prática essa independência nem sempre se mantém. Em e-mails spam, a presença de uma palavra pode aumentar a probabilidade de outra aparecer. Mesmo assim, o algoritmo ainda é eficiente, especialmente na classificação de textos.
Qual a diferença entre Naive Bayes e Regressão Logística?
Naive Bayes: baseado em probabilidade condicional; só faz classificação.
Regressão Logística: usa função logística para modelar relação entre variáveis independentes e uma variável dependente categórica (também classifica, mas por outro mecanismo).
O Naive Bayes é supervisionado ou não supervisionado?
Supervisionado — precisa de dados rotulados no treinamento. Não confundir com algoritmos não supervisionados como DBSCAN ou Camins (clustering sem rótulos).
O Naive Bayes usa redes neurais, força bruta ou média de atributos para classificar?
Nenhum desses. Usa o Teorema de Bayes para calcular probabilidades condicionais (a posteriori). Não usa redes neurais, não calcula média de atributos e não usa força bruta.
O que significa o Naive Bayes construir uma "tabela de probabilidades"?
Para cada classe e cada atributo, o algoritmo armazena a probabilidade condicional de o atributo ocorrer dada a classe. Na classificação, avalia cada atributo e combina essas probabilidades para decidir a classe do novo exemplo.
Qual o papel do PLN no Naive Bayes aplicado a textos?
No pré-processamento, o PLN é usado para descartar palavras irrelevantes (stopwords como "de", "o", "a"), permitindo que o algoritmo aprenda apenas com palavras significativas do corpus de treinamento.
Exemplo numérico: meningite causa torcicolo em 50% dos casos, P(meningite) = 1/50.000 e P(torcicolo) = 1/20. Qual P(meningite|torcicolo)?
P(M|T) = [P(M) x P(T|M)] / P(T) = (1/50.000 x 0,5) / (1/20) = 0,0002 = 0,02%
Mesmo com torcicolo, a prob. de meningite é muito baixa pois a doença é raras. Isso ilustra o impacto da prob. a priori no cálculo de Bayes.
Por que o Naive Bayes é amplamente usado em concursos e na indústria?
Por sua simplicidade e eficácia:
- Fácil de implementar e treinar
- Funciona bem com poucos dados
- Muito eficiente para classificação de textos e NLP
- Baixo custo computacional