• ↑↓ pour naviguer
  • pour ouvrir
  • pour sélectionner
  • ⌘ ⌥ ↵ pour ouvrir dans un panneau
  • ←→ pour naviguer
  • esc pour rejeter
⌘ '
raccourcis clavier

The Problem

We need to predict which category or class an observation belongs to (spam/not-spam, cat/dog, disease/no-disease).

Core Idea

Supervised learning task where the goal is to predict a discrete categorical label from input features.

How It Works

  1. Collect labeled data: features X and categorical labels y (e.g., 0/1, cat/dog)
  2. Choose classifier: logistic regression, decision trees, SVM, neural networks, etc.
  3. Define loss function: log loss, hinge loss, or misclassification rate
  4. Train: find model parameters that minimize classification error
  5. Predict: for new inputs, output class label or probability distribution

Visual Explanation

G Features (X) Features (X) Classifier Classifier Features (X)->Classifier Features (X)->Classifier Class Prediction (ŷ) Class Prediction (ŷ) Classifier->Class Prediction (ŷ) Class Probabilities (p) Class Probabilities (p) Classifier->Class Probabilities (p) Labels (y) Labels (y) Loss (Log Loss) Loss (Log Loss) Labels (y)->Loss (Log Loss) Optimize Optimize Loss (Log Loss)->Optimize

Key Properties

  • Discrete output: predicts categories or class membership probabilities
  • Probabilistic or deterministic: can output “most likely class” or full probability distribution
  • Imbalanced: rare classes are harder to learn (may need special techniques)
  • Metrics: accuracy, precision, recall, F1-score, AUC-ROC (not just “error rate”)

Connections

Edge Cases & Gotchas

  • Class imbalance: accuracy is misleading when 95% of examples are one class
  • Threshold choice: default 0.5 may not be optimal for asymmetric costs
  • Multiclass vs multilabel: one example can belong to multiple categories (different problem)
  • Calibration: predicted probabilities may not match true probabilities