Tecnologia da Informação

0.0(0)
Studied by 0 people
call kaiCall Kai
Locked
learnLearn
examPractice Test
spaced repetitionSpaced Repetition
heart puzzleMatch
flashcardsFlashcards
GameKnowt Play
Card Sorting

1/164

encourage image

There's no tags or description

Looks like no tags are added yet.

Last updated 11:25 AM on 7/23/26
Name
Mastery
Learn
Test
Matching
Spaced
Call with Kai
Chat

No analytics yet

Send a link to your students to track their progress

165 Terms

1
New cards

O que é a Matriz de Confusão?

Instrumento que relaciona as previsões do modelo com os valores reais do conjunto de testes, exibindo acertos e erros organizados em uma tabela.

2
New cards

O que significa VP (Verdadeiro Positivo)?

O modelo previu como positivo e o valor real também era positivo. É um acerto na classe positiva.

3
New cards

O que significa FN (Falso Negativo)?

O modelo previu como negativo, mas o valor real era positivo. Falha crítica em sistemas de detecção de fraudes ou diagnósticos médicos.

4
New cards

O que significa FP (Falso Positivo)?

O modelo previu como positivo, mas o valor real era negativo. Ex: classificar uma transação legítima como fraude.

5
New cards

Qual a fórmula da Acurácia?

(VP + VN) / (VP + VN + FP + FN) — mede o total de instâncias classificadas corretamente em relação ao total do conjunto de testes.

6
New cards

Qual a fórmula da Precisão?

VP / (VP + FP) — mede a proporção de instâncias classificadas como positivas que realmente são positivas.

7
New cards

Quando a Precisão é máxima (= 1)?

Quando não há nenhum Falso Positivo (FP = 0). Quanto maior o número de FP, menor a precisão.

8
New cards

Qual a soma de todos os elementos de uma matriz de confusão multiclasse?

É igual a n — o número total de objetos do conjunto de testes (amostras testadas). Item I de concursos.

9
New cards

Como calcular a Acurácia numa matriz de confusão multiclasse?

Soma dos elementos da diagonal principal (acertos de cada classe) dividida pela soma de todos os elementos da matriz (= n).

10
New cards

Exemplo prático: VP=80, VN=90, FP=20, FN=10. Qual a Acurácia?

(80 + 90) / (80 + 90 + 20 + 10) = 170 / 200 = 0,85 = 85%

11
New cards

Exemplo prático com Precisão: VP=80, FP=20. Qual a Precisão?

80 / (80 + 20) = 80 / 100 = 0,80 = 80%

12
New cards

Por que o FN é o erro mais crítico em certos contextos?

Porque representa casos reais positivos que o modelo errou como negativos. Ex: deixar passar uma fraude ou não diagnosticar uma doença.

13
New cards

O que a Acurácia NÃO é?

Não é a taxa de acertos apenas das previsões positivas. Ela considera TODAS as previsões corretas (VP + VN) sobre o total de previsões realizadas.

14
New cards

Concurso: a soma de todos os elementos de uma matriz multiclasse é igual a n. Isso é verdadeiro ou falso?

VERDADEIRO. A soma de todos os elementos da matriz de confusão é sempre igual a n (total de objetos testados). Item I é CORRETO.

15
New cards

Concurso: a taxa de acerto do classificador é dada pela razão entre a soma da diagonal principal e a soma de todos os elementos. Verdadeiro ou falso?

VERDADEIRO. Essa é exatamente a fórmula da Acurácia na matriz de confusão multiclasse. Item II é CORRETO.

16
New cards

O que é uma Árvore de Decisão?

Algoritmo de aprendizado de máquina supervisionado que constrói uma estrutura em forma de árvore para tomar decisões. Identifica os atributos que melhor separam os dados em classes, aprendendo a prever y a partir dos atributos x.

17
New cards

O que é o Nó Raiz (Root) em uma árvore de decisão?

É o primeiro nó da árvore (nível 0). Representa a primeira e mais importante decisão — o atributo que melhor separa os dados do conjunto completo. É escolhido pelo maior ganho de informação ou menor índice Gini.

18
New cards

O que são as Folhas (Leaves) em uma árvore de decisão?

São os nós terminais da árvore — não há mais divisões. Contêm a classe predominante (em classificação) ou o valor médio (em regressão). Representam a decisão final do modelo.

19
New cards

O que é Entropia no contexto de árvore de decisão?

Medida de desordem ou incerteza de um conjunto de dados. Quanto mais classes misturadas, maior a entropia. Entropia = 0 quando todos os exemplos são da mesma classe (nó puro). Entropia máxima quando as classes estão equilibradas (ex.: 50/50).

20
New cards

O que é Ganho de Informação?

Métrica que mede o quanto a entropia diminui ao dividir o dataset por um determinado atributo. Representa o ganho de pureza após a divisão. Quanto maior o ganho de informação, melhor é o atributo para a divisão. Usado pelo algoritmo ID3.

21
New cards

O que é o Índice de Gini (Grau de Impureza)?

Métrica que mede a probabilidade de erro ao classificar aleatoriamente um item de um nó. Gini = 0 significa nó puro (todos da mesma classe). Gini alto indica nó misto (impuro). O melhor atributo é o que apresenta menor índice de Gini. Usado pelo algoritmo CART.

22
New cards

O que é Overfitting em árvores de decisão e como ele ocorre?

É a especialização excessiva no conjunto de treinamento. Ocorre quando a árvore possui muitos níveis, separando perfeitamente os dados de treinamento — inclusive dados incorretos. Resultado: ótimo desempenho no treino, péssimo em dados novos.

23
New cards

O que é Poda (Pruning) em árvores de decisão?

Técnica para combater o overfitting. Consiste em remover parte da árvore (sub-árvores), substituindo-as por folhas. Aumenta o erro no treinamento, mas melhora a generalização para dados novos. Tipos: poda pré (durante a construção) e poda pós (após a conclusão da árvore).

24
New cards

Qual a diferença entre Poda Pré e Poda Pós?

Poda Pré (pre-pruning): ocorre durante a construção da árvore, realizando cortes enquanto ela ainda está sendo formada. Poda Pós (post-pruning): ocorre após a árvore estar completamente construída, removendo sub-árvores e substituindo-as por folhas.

25
New cards

Qual a principal limitação do algoritmo ID3?

Trabalha apenas com variáveis categóricas — não aceita variáveis numéricas. Não trata valores ausentes: se o dataset tiver valores faltantes, o ID3 não executa. Também não implementa poda (pruning).

26
New cards

Quais são as principais diferenças entre C4.5 e ID3?

O C4.5 é a evolução do ID3 e adiciona: suporte a variáveis numéricas, tratamento de valores ausentes (por ponderação), uso do ganho de informação normalizado (razão de ganho) em vez do ganho simples. Também implementa poda pós-criação.

27
New cards

O que é exclusivo do algoritmo CART em relação ao ID3 e C4.5?

É o único que realiza regressão (além de classificação), colocando a média dos valores numéricos nas folhas. Também é o único que faz divisões sempre binárias (dois ramos). Usa o índice Gini para classificação e redução de variância para regressão.

28
New cards

Por que a Árvore de Decisão é considerada um algoritmo interpretável/explicável?

Porque ao receber uma entrada e produzir uma saída, é possível rastrear exatamente quais decisões (atributos e valores) levaram àquele resultado. Em contraste, redes neurais não são explicáveis — os dados passam por centenas de neurônios e a lógica interna não é transparente.

29
New cards

Como a Árvore de Decisão divide o espaço de características geometricamente?

Ela divide o espaço em eixos paralelos retangulares, rotulando cada retângulo com uma classe. Cada decisão (nó) corta o espaço ao longo de um atributo, criando regiões distintas que correspondem a diferentes classes.

30
New cards

O que é Random Forest?

Um ensemble (conjunto) de centenas de árvores de decisão treinadas de forma ligeiramente diferente, com subconjuntos de dados distintos, que combinam suas previsões por votação (classificação) ou média (regressão).

31
New cards

O que é um Ensemble no contexto de Machine Learning?

Técnica em que diversos modelos de IA são utilizados em conjunto para realizar tarefas de classificação ou regressão. A decisão final é tomada pela maioria (votação) ou pela média dos resultados.

32
New cards

Por que as árvores de decisão têm alta variância?

Porque qualquer pequena alteração no conjunto de treinamento pode gerar uma árvore de decisão completamente diferente, tornando-a instável e imprevisível.

33
New cards

Qual a principal justificativa para usar Random Forest em vez de uma única Árvore de Decisão?

A redução do risco de overfitting. Com muitas árvores, mesmo que algumas incorram em overfitting, a maioria não o fará, e o resultado agregado será mais robusto.

34
New cards

O que é Amostragem com Reposição (Bootstrap) no contexto de Random Forest?

Técnica de selecionar subconjuntos aleatórios do conjunto de treinamento para treinar cada árvore. Um mesmo dado pode aparecer em múltiplos subconjuntos (com reposição).

35
New cards

Como a Random Forest faz a predição em tarefas de CLASSIFICAÇÃO?

Por votação majoritária: a classe indicada pelo maior número de árvores vence. Ex: 517 árvores indicam classe A e 316 indicam classe B → classe A é a previsão final.

36
New cards

Como a Random Forest faz a predição em tarefas de REGRESSÃO?

Obtém-se a média de todos os valores produzidos pelas centenas de árvores. Essa média constitui a saída (previsão) final da Random Forest.

37
New cards

Random Forest pode ser usada para regressão?

Sim. A Random Forest pode ser usada tanto para classificação quanto para regressão, pois as árvores de decisão que a compõem são aplicáveis a ambos os propósitos.

38
New cards

Qual é a principal DESVANTAGEM da Random Forest em relação a uma única Árvore de Decisão?

Duas: (1) perde a interpretabilidade — com centenas de árvores, fica inviável explicar individualmente cada decisão; (2) é computacionalmente mais pesada, pois envolve centenas ou milhares de árvores.

39
New cards

O que é Overfitting e como a Random Forest o reduz?

Overfitting: modelo decora os dados de treinamento e performa mal em dados novos. A RF reduz porque, com muitas árvores diversas, mesmo que algumas overfitem, a maioria não o fará, e a decisão agregada é mais robusta.

40
New cards

Qual a diferença de interpretabilidade entre Árvore de Decisão e Random Forest?

Uma única árvore permite explicar claramente a origem de cada decisão (alta interpretabilidade). Com 500+ árvores na RF, torna-se inviável justificar individualmente cada decisão — a Random Forest não é interpretável.

41
New cards

Como funciona a predição de um novo dado após o treinamento da Random Forest?

O novo dado é processado por todas as centenas de árvores, que geram centenas de resultados. Em seguida, realiza-se votação (classificação) ou média (regressão) entre as saídas para produzir a previsão final.

42
New cards

Apesar do nome, a Regressão Logística é usada para resolver que tipo de problema?

Problema de classificação, não de regressão. Ela prevê uma classe (ex: sim/não, 0/1), e não um valor numérico contínuo.

43
New cards

Qual função matemática é utilizada pela Regressão Logística?

A função logística (sigmoide): σ(x) = 1 / (1 + e^−x). Ela recebe qualquer valor de entrada e retorna uma saída entre 0 e 1.

44
New cards

Qual é o formato gráfico da função sigmoide e como ela é chamada informalmente?

Tem formato de "S", conhecido informalmente como "S do Senna". Quanto maior o coeficiente, mais íngreme fica a curva. Se o sinal negativo for retirado, a curva é invertida.

45
New cards

A Regressão Logística é um método paramétrico ou não paramétrico? Por quê?

É paramétrico, pois utiliza uma função matemática previamente conhecida (a função sigmoide/logística) para modelar os dados.

46
New cards

A Regressão Logística pode ser usada para classificação multiclasse? Como?

Sim. Executa-se uma regressão logística separada para cada classe (ex: A, B e C). A classe com o maior valor previsto prevalece.

47
New cards

Qual é a principal diferença entre a Regressão Logística e a Regressão Linear?

Na Regressão Linear, a variável dependente é um número contínuo. Na Regressão Logística, a variável dependente é categórica binária (0 ou 1), pois é um problema de classificação.

48
New cards

A função sigmoide da Regressão Logística é a mesma usada nos neurônios de redes neurais?

Sim. É chamada de função de ativação nos neurônios artificiais. A saída 0 ou 1 indica se o neurônio está ativado ou não.

49
New cards

A Regressão Logística pode sofrer overfitting? Como isso é tratado?

Sim, pode ocorrer overfitting. O comportamento pode ser mitigado por meio de técnicas de regularização, que tornam o modelo mais adequado ao conjunto de dados.

50
New cards

Quais são as variáveis independentes da Regressão Logística — categóricas ou numéricas?

As variáveis independentes são, em essência, numéricas (ou um vetor numérico). A variável dependente (saída) é que é categórica binária.

51
New cards

A Regressão Logística pode prever variáveis dependentes contínuas?

Não. A variável prevista não é contínua; é categórica binária. A regressão logística produz valores entre 0 e 1 que representam probabilidade de pertencer a uma classe.

52
New cards

A Regressão Logística é linear ou não linear?

É não linear. Enquanto a regressão linear é baseada em relação linear entre variáveis, a regressão logística utiliza a função sigmoide, que é não linear, e prevê um valor binário.

53
New cards

Qual é um exemplo clássico de aplicação da Regressão Logística?

Prever se um cliente de seguro de automóvel irá ou não acionar um sinistro, com base em variáveis como idade, tempo de habilitação e local de residência. A decisão é binária: sinistro ou não sinistro.

54
New cards

O que é K-NN e qual é a ideia central?

K-Nearest Neighbors = K Vizinhos Mais Próximos. Um ponto desconhecido é classificado pela classe que aparece mais entre os K vizinhos mais próximos a ele no espaço de dados.

55
New cards

K-NN: supervisionado ou não supervisionado? Paramétrico ou não paramétrico?

Supervisionado (precisa de dados com rótulos/classes) e não paramétrico (não assume nenhuma distribuição estatística, não cria função matemática fixa).

56
New cards

K-NN serve só para classificação ou tambéO que é o parâmetro K e quem o define?m para regressão?

Os dois. Classificação: atribui a classe mais votada pelos K vizinhos. Regressão: calcula a média dos valores numéricos dos K vizinhos.K é o número de vizinhos consultados para decidir a classe. Definido pelo cientista de dados (não é aleatório). Use K ímpar com 2 classes para evitar empate. Impacta diretamente o desempenho do modelo.

57
New cards

Como o K-NN mede proximidade entre pontPor que o K-NN exige normalização dos dados?os?

Pela Distância Euclidiana (linha reta). Fórmula 2D: d = raiz((x2-x1)² + (y2-y1)²). Em N dimensões se expande para todos os atributos. É a métrica mais comum, mas não a única.O K-NN calcula distâncias. Se uma variável vai de 0 a 1 e outra de 0 a 100.000, a segunda domina e distorce o resultado. Normalizar coloca todas na mesma escala. Dados categóricos devem ser convertidos em números antes.

58
New cards

Quais são as etapas do K-NN (passo a passo)?

1. Plota todos os pontos de treino no espaço. 2. Chega ponto novo: calcula distância para todos. 3. Seleciona os K mais próximos. 4. Classificação: classe da maioria. Regressão: média dos valores.

59
New cards

O que acontece em caso de empate entre vizinhos no K-NN?

Usa-se o vizinho mais próximo como critério de desempate. Se o empate persistir totalmente (ex: A, B e C com mesma distância), nenhuma classe é escolhida.

60
New cards

V ou F sobre K-NN: (1) Não pode ser usado em classificação. (2) É sensível à escala e requer normalização. (3) É usado em IA para reconhecimento de padrões.

(1) FALSO — K-NN funciona para classificação E regressão. (2) VERDADEIRO — distância é afetada pela escala. (3) VERDADEIRO — KNN é clássico em reconhecimento de padrões.

61
New cards

Dica de prova: como resolver questão de K-NN sem perder tempo?

Desenhe os pontos no gráfico e identifique os K vizinhos visualmente. Não calcule a distância euclidiana manualmente com 4+ atributos — é uma armadilha de tempo. Com 2 atributos, o gráfico resolve tudo.

62
New cards

V ou F: K deve ser escolhido aleatoriamente e não afeta o desempenho do modelo.

FALSO nas duas partes. K é escolha do cientista de dados (não é aleatório) E afeta diretamente o desempenho do modelo.

63
New cards

O que é o algoritmo Naive Bayes?

Família de algoritmos de aprendizado supervisionado baseados em probabilidade. Também chamado de "Bayes Ingênuo", trabalha exclusivamente com classificação — não realiza regressão ou previsões numéricas.

64
New cards

Quais são as duas suposições ingênuas do Naive Bayes?

1. As características (features) do conjunto de dados são independentes entre si.

2. Cada evento contribui igualmente para classificar o resultado.

65
New cards

Qual é a fórmula central do Naive Bayes?

Fórmula de Bayes: P(A|B) = [P(B|A) × P(A)] / P(B)

Onde:

- P(A|B) = probabilidade de A dado B (a posteriori)

- P(B|A) = probabilidade de B dado A

- P(A) = probabilidade de A ocorrer (a priori)

- P(B) = probabilidade de B ocorrer

66
New cards

O Naive Bayes trabalha com probabilidades a priori ou a posteriori?

A posteriori — calcula a probabilidade de um evento ocorrer dado que outro evento já ocorreu. Ex.: probabilidade de um e-mail ser spam dado que contém a palavra "nigeriano".

67
New cards

Como o Naive Bayes aprende no treinamento?

Constrói uma matriz de probabilidades condicionais a partir do dataset. No caso de e-mails: cada coluna = uma palavra, cada linha = um e-mail (1 = presente, 0 = ausente). Aprende a probabilidade de cada palavra ocorrer em spam vs. normais.

68
New cards

Qual é um exemplo clássico de aplicação do Naive Bayes?

Classificação de e-mails como spam ou normais (ex.: Gmail). O algoritmo calcula a probabilidade de spam com base na presença/ausência de palavras como "nigeriano", "vender" (spam) ou "amor" (normal).

69
New cards

Por que a suposição de independência do Naive Bayes é chamada de "ingênua"?

Porque na prática essa independência nem sempre se mantém. Em e-mails spam, a presença de uma palavra pode aumentar a probabilidade de outra aparecer. Mesmo assim, o algoritmo ainda é eficiente, especialmente na classificação de textos.

70
New cards

Qual a diferença entre Naive Bayes e Regressão Logística?

Naive Bayes: baseado em probabilidade condicional; só faz classificação.

Regressão Logística: usa função logística para modelar relação entre variáveis independentes e uma variável dependente categórica (também classifica, mas por outro mecanismo).

71
New cards

O Naive Bayes é supervisionado ou não supervisionado?

Supervisionado — precisa de dados rotulados no treinamento. Não confundir com algoritmos não supervisionados como DBSCAN ou Camins (clustering sem rótulos).

72
New cards

O Naive Bayes usa redes neurais, força bruta ou média de atributos para classificar?

Nenhum desses. Usa o Teorema de Bayes para calcular probabilidades condicionais (a posteriori). Não usa redes neurais, não calcula média de atributos e não usa força bruta.

73
New cards

O que significa o Naive Bayes construir uma "tabela de probabilidades"?

Para cada classe e cada atributo, o algoritmo armazena a probabilidade condicional de o atributo ocorrer dada a classe. Na classificação, avalia cada atributo e combina essas probabilidades para decidir a classe do novo exemplo.

74
New cards

Qual o papel do PLN no Naive Bayes aplicado a textos?

No pré-processamento, o PLN é usado para descartar palavras irrelevantes (stopwords como "de", "o", "a"), permitindo que o algoritmo aprenda apenas com palavras significativas do corpus de treinamento.

75
New cards

Exemplo numérico: meningite causa torcicolo em 50% dos casos, P(meningite) = 1/50.000 e P(torcicolo) = 1/20. Qual P(meningite|torcicolo)?

P(M|T) = [P(M) x P(T|M)] / P(T) = (1/50.000 x 0,5) / (1/20) = 0,0002 = 0,02%

Mesmo com torcicolo, a prob. de meningite é muito baixa pois a doença é raras. Isso ilustra o impacto da prob. a priori no cálculo de Bayes.

76
New cards

Por que o Naive Bayes é amplamente usado em concursos e na indústria?

Por sua simplicidade e eficácia:

- Fácil de implementar e treinar

- Funciona bem com poucos dados

- Muito eficiente para classificação de textos e NLP

- Baixo custo computacional

77
New cards
O que é SVM?
SVM significa Support Vector Machine, ou Máquina de Vetores de Suporte. É um algoritmo de aprendizado de máquina supervisionado que aprende com exemplos já classificados para separar novos dados em categorias.
78
New cards
O que é hiperplano no SVM?
O hiperplano é a divisão que o SVM cria para separar classes de dados. Em duas dimensões ele parece uma linha reta, mas em dimensões maiores continua sendo a superfície que faz a separação.
79
New cards
O que é hiperplano ótimo?
É o melhor hiperplano possível para separar os dados. Ele é escolhido porque deixa a maior distância possível entre os grupos, tornando a classificação mais segura.
80
New cards
O que são vetores de suporte?
São os pontos mais próximos do hiperplano. Eles são os mais importantes porque ajudam a definir exatamente onde a fronteira de separação será colocada.
81
New cards
O que é margem no SVM?
Margem é a distância entre o hiperplano e os pontos mais próximos de cada classe. O SVM tenta maximizar essa distância para reduzir erros em novos dados.
82
New cards
O que é Kernel Trick?
É uma técnica usada quando os dados não podem ser separados por uma linha reta. Ela transforma o problema em uma dimensão maior para facilitar a separação.
83
New cards
O mapeamento do kernel é explícito ou implícito?
No SVM, o kernel faz um mapeamento implícito. Isso significa que a transformação matemática acontece sem precisar mostrar diretamente os dados na nova dimensão.
84
New cards
O que é Soft Margin?
Soft Margin é uma versão mais flexível do SVM. Ela permite alguns erros na separação dos dados para criar um modelo mais equilibrado e melhor para generalizar.
85
New cards
Qual a ideia da Margem Rígida?
A Margem Rígida tenta separar os dados sem permitir nenhum erro. Ela funciona melhor quando os dados estão perfeitamente separados.
86
New cards
Qual a ideia da Margem Suave?
A Margem Suave aceita que alguns pontos fiquem do lado errado da divisão. Isso ajuda quando os dados têm ruído ou sobreposição.
87
New cards
O SVM é supervisionado ou não supervisionado?
O SVM é um algoritmo supervisionado. Isso significa que ele precisa de exemplos com resposta certa para aprender.
88
New cards
Para que o SVM serve na prática?
O SVM é muito usado para classificar padrões, textos, fraudes, imagens e outros dados em categorias diferentes.
89
New cards
Rede neural artificial
Modelo computacional inspirado nas redes neurais biológicas, composto por camadas de neurônios artificiais conectados por pesos, capaz de aprender padrões a partir de dados
90
New cards
Rede neural natural
Rede formada por neurônios biológicos interligados por sinapses, em que estímulos suficientemente fortes geram impulsos que percorrem dendritos, axônios e camadas até o cérebro
91
New cards
Camada de entrada (rede neural)
Primeira camada da rede neural artificial que recebe o vetor de atributos X do dataset e encaminha os sinais para as camadas seguintes
92
New cards
Camadas escondidas (hidden layers)
Camadas intermediárias de neurônios artificiais que processam os sinais recebidos da camada de entrada e os transformam antes de chegar à camada de saída
93
New cards
Camada de saída (rede neural)
Última camada da rede neural artificial que produz o resultado Y, como uma classificação ou previsão, a partir do processamento das camadas anteriores
94
New cards
Perceptron de McCulloch
Pitts
95
New cards
Peso (weight) em rede neural
Valor numérico associado a cada conexão entre neurônios, responsável por ponderar a importância de cada entrada e permitir o ajuste do modelo durante o treinamento
96
New cards
Bias em neurônio artificial
Termo adicional, geralmente constante, conectado como uma entrada com peso próprio, somado ao somatório ponderado para ajudar a introduzir não linearidade e flexibilidade ao modelo
97
New cards
Função de ativação
Função aplicada ao somatório ponderado das entradas de um neurônio para decidir sua saída, introduzindo não linearidade e determinando se o neurônio ativa ou não
98
New cards
Rede MLP (Multi
Layer Perceptron)
99
New cards
Backpropagation
Algoritmo de treinamento de redes neurais em que, após o cálculo da saída, o erro é propagado de volta pela rede, ajustando os pesos por gradiente descendente para minimizar a função de erro
100
New cards
Taxa de aprendizado (learning rate)
Parâmetro η que controla o tamanho do passo na atualização dos pesos; valores altos aceleram, mas podem causar oscilações, e valores baixos tornam o treinamento lento