Data Sim and Clustering
Data Similarity and Clustering in Data Science (COMP5122M)
Lecturer: Duygu Sarikaya
Course Overview
Topics Covered:
Calculating Data Similarity
Data Distance Metrics
k-Means Clustering
Agglomerative Clustering
Hierarchical Clustering and Dendrograms
Learning Objectives: Gain insights into data similarity, clustering methodologies, and hierarchical clustering.
What is Data Mining?
Definition:
Data mining (or Knowledge Discovery in Data - KDD) is about uncovering patterns and valuable information from large datasets.
Source: IBM (https://www.ibm.com/topics/data-mining)
Data Mining vs. Machine Learning
Data Mining:
Focuses on discovering existing patterns in data.
Machine Learning:
Learns from past data to predict future outcomes.
Source: Simplilearn (https://www.simplilearn.com/data-mining-vs-machine-learning-article)
Learning Types in Machine Learning
Supervised Learning
Types:
Regression (Categorical Response)
Classification (Quantitative Response)
Nearest Neighbors
Logistic Regression
Goal: Creating a mapping function from inputs to outputs using example input/output pairs.
Each pair consists of an input vector and output value (label).
Unsupervised Learning
Types:
Clustering
Dimensionality Reduction
Goal: To identify patterns in unlabeled data (sometimes ignoring labels).
Common Methods:
Principal Component Analysis (PCA)
Overview of Transformation of Dataset
Purpose:
Create simpler representations of data for easier human or algorithm understanding.
Examples:
Dimensionality Reduction (for visualization)
Topic extraction on text collections.
Clustering Techniques
Definition:
Partitioning data into distinct groups of similar items.
Clusters are defined by high similarity within and low similarity between clusters.
Examples of Application:
Organizing pictures by person or location.
Data Similarity
Concept:
Measure the similarity (or distance) between objects represented as feature vectors.
Application in Recommendations:
Used by platforms like Amazon, Netflix, and Spotify to suggest items based on user behavior.
Distance Metrics for Data Similarity
Euclidean Distance
Formula Example:
Distance(A, B) = √[(X_B - X_A)² + (Y_B - Y_A)²]
Dependence on Variables:
Adaptation for multiple variables potentially through extended dimension measures.
Other Distance Metrics
Common Metrics:
Cosine Distance, Hamming, Manhattan, Minkowski, Chebyshev, Jaccard, Haversine, Sorensen-Dice
k-Means Clustering
Overview:
A widely used clustering algorithm to find representative cluster centers.
Process:
Assignment of data points to the nearest cluster center and updating the center positions iteratively.
End Condition:
Stops when point assignments do not change.
Visualization in k-Means Clustering
Cluster Representation:
Triangles for cluster centers, circles for data points, colors for cluster memberships.
Iterative Process Description
Steps in Iteration:
Initialize cluster centers, assign points, and recompute centers until stability.
Example Iterations:
Iterations demonstrate movement towards optimal cluster centers until stabilization.
Challenges in k-Means Clustering
Cluster Shape Assumptions:
Assumes clusters are convex and equally shaped.
Initialization Sensitivity:
Random initialization leads to variable outputs across runs.
Effectiveness:
May fail on datasets with non-spherical shapes or differing cluster densities.
Hierarchical Clustering and Dendrograms
Definition:
Builds a tree of clusters starting with each point as a separate cluster and progressively merging similar clusters.
Visualization:
Dendrograms illustrate the merging process and cluster similarities across iterations.
Limitations:
Ineffective for separating complex shapes under certain conditions.
Teaching References
Books:
Data Science for Business by Foster Provost and Tom Fawcett
Introduction to Machine Learning with Python by Andreas Müller & Sarah Guido
Data Similarity and Clustering in Data Science (COMP5122M)
Lecturer: Duygu Sarikaya
Course Overview
Topics Covered:
Calculating Data Similarity
Data Distance Metrics
k-Means Clustering
Agglomerative Clustering
Hierarchical Clustering and Dendrograms
Learning Objectives: Insights into data similarity, clustering methodologies, hierarchical clustering.
Data Mining
Definition: Uncovering patterns in large datasets.
Difference from Machine Learning:
Data Mining: Discovering existing patterns.
Machine Learning: Predicting future outcomes based on past data.
Learning Types in Machine Learning
Supervised Learning:
Types: Regression, Classification.
Nearest Neighbors
Logistic Regression
Goal: Mapping function from inputs to outputs using example pairs.
Unsupervised Learning:
Types: Clustering, Dimensionality Reduction.
Goal: Identifying patterns in unlabeled data.
Clustering Techniques
Definition: Partitioning data into groups of similar items.
Examples: Organizing pictures.
Data Similarity
Concept: Measure similarity/distance between feature vectors.
Application: Recommendations on platforms like Amazon, Netflix.
Distance Metrics
Euclidean Distance Formula: Distance(A, B) = √[(X_B - X_A)² + (Y_B - Y_A)²].
Other Metrics: Cosine, Hamming, Manhattan, Minkowski, Chebyshev, Jaccard, Haversine, Sorensen-Dice.
k-Means Clustering
Overview: Assigns points to nearest cluster centers; iterates until stable.
Challenges: Assumes convex shapes; sensitive to initialization; may fail with non-spherical shapes.
Hierarchical Clustering
Definition: Builds a tree of clusters; visualized with dendrograms.
Limitations: Complex shapes can be poorly separated.
Teaching References
Books:
Data Science for Business by Foster Provost and Tom Fawcett
Introduction to Machine Learning with Python by Andreas Müller & Sarah Guido