Data mining
Undergraduate · Math
Syllabus focus
Topics typically covered
Click a topic for the full text and related unit practice.
Undergraduate Data mining — outline derived from course README sections and typical US statistics syllabi (OpenIntro / standard OER where applicable).
Data preparation
- Train/validation/test splits — Train/validation/test splits
- Feature engineering and encoding — Feature engineering and encoding
- Handling missing values — Handling missing values
- Outliers — Outliers
- Dimensionality reduction: PCA for mining — Dimensionality reduction: PCA for mining
- Class imbalance strategies — Class imbalance strategies
Supervised learning
- Classification and regression trees — Classification and regression trees
- Ensemble methods: bagging — Ensemble methods: bagging
- Random forests — Random forests
- Boosting (AdaBoost, gradient boosting intro) — Boosting (AdaBoost, gradient boosting intro)
- k-nearest neighbors and naive Bayes — k-nearest neighbors and naive Bayes
- Model evaluation: ROC and AUC — Model evaluation: ROC and AUC
- Confusion matrices — Confusion matrices
Unsupervised learning
- Cluster analysis for market segmentation — Cluster analysis for market segmentation
- Association rules — Association rules
- Market basket analysis — Market basket analysis
- Anomaly detection (introduction) — Anomaly detection (introduction)
- Text mining basics (optional) — Text mining basics (optional)
Study units
Each unit includes a study guide, worksheets, review, practice test, and answer key. One unit is free; subscribe for the full class.
- Data preparation
Train/validation/test splits
Coming soon - Supervised learning
Classification and regression trees
Coming soon - Unsupervised learning
Cluster analysis for market segmentation
Coming soon
Notes
Undergraduate Data mining — outline derived from course README sections and typical US statistics syllabi (OpenIntro / standard OER where applicable). Topic outline: `content/topics/undergraduate/data_mining.json`.