Raw data is messy, incomplete, and unstructured — unusable for analysis or modeling without significant preprocessing.
The process of cleaning, structuring, and enriching raw data into a usable format for analysis and modeling.
- Data collection from disparate sources (CSV, APIs, databases)
- Cleaning: handling missing values, removing duplicates, fixing types
- Structuring: reshaping data into tidy format (rows=observations, columns=variables)
- Enriching: joining datasets, creating derived features
- Validating: ensuring data integrity before analysis
- Time-consuming: often 60-80% of data science work
- Iterative: multiple passes may be needed
- Source-dependent: each data source has unique quality issues
- Foundation: poor wrangling corrupts all downstream analysis
- Built from: Data Science — core component of the field
- Builds into: EDA — clean data enables exploration
- Related: Data Cleaning — subset focused on fixing errors
- Related: Data Transformation — reshaping and converting data
- Over-cleaning can remove meaningful outliers
- Inconsistent cleaning across train/test sets causes leakage
- Assuming data types without validation (e.g., numeric IDs as integers)
- Not documenting wrangling steps for reproducibility