Recommender Systems – Wikipedia Notes

Core Concepts and Vocabulary

  • Collective Intelligence

    • Wisdom that emerges from large groups of users; recommender systems harness this by aggregating many users’ signals to make single-user suggestions.

  • Relevance

    • Central optimisation goal: surface items that are most pertinent to a user’s current intent or long-term interests.

  • Star Ratings

    • Classic explicit-feedback signal (e.g., 1–5 stars) used to infer preferences; often normalised into a common rating scale.

  • Long-Tail Effect

    • Ability of RecSys to expose niche items lying outside the popular “head”; improves catalog utilisation and user satisfaction.

Methods & Classic Challenges

  • Cold-Start

    • Lack of interaction data for new users/items; mitigated via hybrid models, content features, or ϵ\epsilon-greedy / multi-armed-bandit exploration.

  • Scalability

    • Industrial systems must handle O(106!!!109)\text{O}(10^6!!\text{–}!10^9) users/items; addressed with dimensionality reduction, sharding, approximate nearest neighbours (ANN), etc.

  • Sparsity

    • Ratings matrix is overwhelmingly empty; similarity measures and factor models must cope with missing data.

  • Dimensionality Reduction

    • Techniques (e.g.

    • Singular Value Decomposition,

    • Probabilistic Matrix Factorisation,

    • Auto-encoders) compress high-dimensional user–item space into latent factors.

  • Preference Elicitation

    • Methods for gathering initial signals (onboarding quizzes, forced-choice pairs, slider ratings, etc.).

  • Similarity Search

    • k-Nearest Neighbour, cosine similarity, Pearson correlation; critical for memory-based CF and candidate-generation pipelines.

Canonical Implementations

  • Collaborative Search Engine – recommends search results based on aggregated user click patterns.

  • Content Discovery Platform – pushes personalised articles/TV/academic papers to web, mobile, set-top boxes.

  • Decision Support System – assists users in selecting products or actions (e.g., financial advisors).

  • Music Genome Project – 450-attribute ontology powering Pandora’s content-based radio.

  • Product Finder – interactive filters plus RecSys ranking for e-commerce.

Landmark Research Groups & Events

  • GroupLens Research – University of Minnesota; pioneers of MovieLens dataset.

  • MovieLens Dataset – widely used benchmark; millions of explicit ratings.

  • Netflix Prize (2006–2009)

    • $1,000,000\$1{,}000{,}000 competition; target: 10%10\% RMSE improvement.

    • Winning solution: ensemble of 107 algorithms; sparked surge in matrix-factorisation & ensemble methods.

  • ACM RecSys Conference – premier academic venue (est. 2007).

Recommender-System Overview

  • Operate at intersection of information filtering & decision support.

  • Widely deployed: playlists (Spotify/YouTube), product carousels (Amazon), open-web feeds (news/social).

  • Inputs may be unimodal (music) or multimodal (books + search queries + social graph).

  • Domains also include restaurants, dating, expert finding, finance.

Two Classical Paradigms

Collaborative Filtering (CF)
  • Assumption: users with similar histories will prefer similar future items.

  • Memory-Based CF

    • User-based or item-based k-NN; Amazon popularised item-to-item version.

  • Model-Based CF

    • Learns parametric models; e.g., Matrix Factorisation solves
      min<em>P,Q</em>(u,i)K(r<em>u,iP</em>uQ<em>i)2+λ(P</em>u2+Qi2)\min<em>{P,Q} \sum</em>{(u,i)\in K} (r<em>{u,i} - P</em>u^\top Q<em>i)^2 + \lambda (|P</em>u|^2+|Q_i|^2)

  • Explicit vs Implicit Data

    • Explicit: star ratings, rankings, thumbs-up.

    • Implicit: clicks, dwell-time, purchases, social follows.

  • Known Issues: cold-start, scalability, sparsity; bandit exploration addresses the first.

Content-Based Filtering (CBF)
  • Principle: recommend items similar to those the user liked, based on item feature vectors.

  • Item Representation

    • Often tfidftf\text{–}idf bag-of-words:
      tfidf<em>t,d=tf</em>t,d×idfttfidf<em>{t,d}=tf</em>{t,d}\times idf_t

    • Or dense embeddings from CNN/RNN/Transformer for images, audio, text.

  • User Profile

    • Weighted centroid of liked-item vectors; updated via feedback.

  • Machine-Learning Classifiers

    • Naïve Bayes, SVM, decision trees, neural nets estimate P(likefeatures)P(\text{like}\,|\,\text{features}).

  • Strength: handles new items instantly; Weakness: cannot suggest serendipitously dissimilar content.

Hybrid Approaches
  • Weighted – blend CF & CBF scores (e.g., Netflix).

  • Switching – pick algorithm adaptively per context.

  • Mixed – present interleaved lists from multiple engines.

  • Cascade / Meta-Level – stage-wise refinement or one model consumes another’s output.

Advanced & Emerging Technologies

Session-Based RecSys
  • Rely solely on short-term interaction sequence; key for anonymous traffic.

  • Models: RNNs, GRU4Rec, Transformers, XLNet-style self-attention.

Reinforcement-Learning (RL) RecSys
  • Treat user as environment; agent selects item a<em>ta<em>t, receives reward r</em>tr</em>t (click, dwell).

  • Contextual-bandit and policy-gradient methods optimise long-term engagement.

Multi-Criteria RecSys
  • Predict vector ru,i=(r1,r2,,rm)\vec r_{u,i}=(r^1,r^2,\dots,r^m) instead of scalar rating; use MCDM to aggregate.

Risk-Aware RecSys
  • Balance relevance with risk of disturbing user (time-of-day, situation).

  • DRARS: contextual bandit + content model.

Mobile & Location-Based RecSys
  • Leverage GPS, temporal patterns; must handle noisy, heterogeneous, privacy-sensitive data.

  • Example: Uber/Lyft driver pickup-point recommendations via trajectory mining.

Generative Recommenders
  • Frame recommendation as sequence generation; treat every user action as a token.

  • HSTU (Hierarchical Sequential Transduction Units) handles trillion-parameter streams; custom self-attention scalable to long histories.

Algorithmic Building Blocks

  • k-Nearest Neighbour (k-NN) for similarity search; approximated via locality-sensitive hashing (LSH) or FAISS/ScaNN.

  • Pearson Correlation similarity:
    sim(u,v)=<em>i(r</em>u,irˉ<em>u)(r</em>v,irˉ<em>v)</em>i(r<em>u,irˉ</em>u)2<em>i(r</em>v,irˉv)2\text{sim}(u,v)=\frac{\sum<em>i (r</em>{u,i}-\bar r<em>u)(r</em>{v,i}-\bar r<em>v)}{\sqrt{\sum</em>i (r<em>{u,i}-\bar r</em>u)^2}\,\sqrt{\sum<em>i (r</em>{v,i}-\bar r_v)^2}}

  • Embeddings – learn low-dim vectors for users/items via Word2Vec, Doc2Vec, graph neural nets, etc.

Evaluation Methodologies

  • Offline – replay on historical dataset; metrics:

    • MSEMSE / RMSERMSE,

    • Precision@k, Recall@k, nDCGnDCG,

    • Diversity, Novelty, Coverage.

  • User Studies – small panels judge recommendation lists.

  • Online A/B Tests – live traffic; KPIs: click-through rate (CTR), conversion, dwell-time.

  • Known caveats: offline-online mismatch, dataset biases, duplicate data.

Beyond Accuracy – Additional Quality Dimensions

  • Diversity – variety within list; increases satisfaction.

  • Serendipity – surprising yet relevant items.

  • Trust & Explainability – transparency builds acceptance; e.g., “because you watched …”.

  • Privacy – GDPR, anonymisation challenges (Netflix Prize deanonymisation case).

  • Robustness / Shilling Attacks – detect fraudulent profiles.

  • Labelling Effects – “Sponsored” vs “Organic” tags alter CTR.

  • Recommender Persistence – re-showing items can boost engagement.

Reproducibility Concerns

  • Studies show <40 % of neural RecSys papers replicate; calls for shared code, standard splits, robust baselines, framework support (LensKit, RecBole, RecPack, ReChorus, etc.).

AI-Driven Models & Architectures

KNN-Based Collaborative Filters
  • Represent each user as an nn-dimensional vector; compute statistical distance; choose kk nearest neighbours; infer ratings from neighbour aggregate.

Neural Networks
  • ANN / MLP – ingest side features (time, session signals, social trends).

  • Two-Tower Model

    • Separate user-tower f<em>u()f<em>u(\cdot) and item-tower g</em>i()g</em>i(\cdot) producing embeddings u,v\mathbf u, \mathbf v; relevance s=uvs=\mathbf u^\top \mathbf v.

    • Item vectors pre-computed enables fast ANN retrieval, then rerank via deeper model.

Natural Language Processing in RecSys
  • Extract aspects & sentiment from reviews; use LSA, SVD, LDA or Transformers (BERT) to enrich item metadata.

Domain-Specific Applications & Examples

  • Academic Content Discovery – tackle ≈60006000 new papers/day; services augment Google Scholar alarms; challenge for early-career researchers lacking publication history.

  • Decision-Making / Bridging-Based Ranking – tools like Polis, Remesh surface consensus-building content; Twitter & YouTube piloting community-note style ranking.

  • Connected Television – central portal merges linear broadcast + OTT streams; personalised guides differentiate service providers.

Historical Milestones

  • 1979 – Grundy by Elaine Rich: stereotype-based book advisor.

  • 1990 – Digital Bookshelf (Karlgren et al.).

  • 1994–1995 – GroupLens, Bellcore, MIT agents: foundational collaborative filtering papers.

  • 2010 – ACM Software Systems Award to GroupLens.

  • Numerous patents (Amazon item-to-item, etc.) and >50 open-source libraries now available.

Ethical, Legal & Practical Implications

  • Supreme-court debate (Gonzalez v. Google) on whether search vs recommendation are distinct technologies.

  • Patent landscape influences innovation & licensing.

  • Privacy lawsuits (Doe v. Netflix) halted second Netflix Prize.

  • Trade-off between personalisation and data protection leading to federated-learning & on-device inference research.

Key Mathematical & Statistical References

  • RMSE: RMSE=1K<em>(u,i)K(r^</em>u,iru,i)2RMSE = \sqrt{\frac{1}{|K|}\sum<em>{(u,i)\in K} (\hat r</em>{u,i} - r_{u,i})^2}

  • Discounted Cumulative Gain:
    DCG@k=<em>i=1k2rel</em>i1log2(i+1)DCG@k = \sum<em>{i=1}^k \frac{2^{rel</em>i}-1}{\log_2(i+1)}

  • Multi-Armed Bandit Exploration: Upper-Confidence-Bound (UCB1)
    UCB<em>i=xˉ</em>i+2lnnniUCB<em>i = \bar x</em>i + \sqrt{\frac{2\ln n}{n_i}}

  • Transformer Self-Attention simplified:
    Attention(Q,K,V)=softmax(QKd)V\text{Attention}(Q,K,V)=\text{softmax}\left(\frac{QK^\top}{\sqrt d}\right)V


These bullet-point notes capture every notable definition, example, algorithm, challenge, evaluation nuance, historical fact, ethical concern, and advanced technique discussed across all transcript pages, providing a comprehensive stand-alone study guide for recommender-system theory and practice.