Standard syllabus
Data mining · Undergraduate · Math
Learning objectives from the Data mining syllabus, grouped by unit. Click an objective for study materials.
Topics typically covered
Click a topic for the full text and related unit practice.
Undergraduate Data mining — outline derived from course README sections and typical US statistics syllabi (OpenIntro / standard OER where applicable).
Data preparation
- Train/validation/test splits — Train/validation/test splits
- Feature engineering and encoding — Feature engineering and encoding
- Handling missing values — Handling missing values
- Outliers — Outliers
- Dimensionality reduction: PCA for mining — Dimensionality reduction: PCA for mining
- Class imbalance strategies — Class imbalance strategies
Supervised learning
- Classification and regression trees — Classification and regression trees
- Ensemble methods: bagging — Ensemble methods: bagging
- Random forests — Random forests
- Boosting (AdaBoost, gradient boosting intro) — Boosting (AdaBoost, gradient boosting intro)
- k-nearest neighbors and naive Bayes — k-nearest neighbors and naive Bayes
- Model evaluation: ROC and AUC — Model evaluation: ROC and AUC
- Confusion matrices — Confusion matrices
Unsupervised learning
- Cluster analysis for market segmentation — Cluster analysis for market segmentation
- Association rules — Association rules
- Market basket analysis — Market basket analysis
- Anomaly detection (introduction) — Anomaly detection (introduction)
- Text mining basics (optional) — Text mining basics (optional)
Learning objectives
Click an objective for study materials.
Data preparation
- Train/validation/test splits — Train/validation/test splits
- Feature engineering and encoding — Feature engineering and encoding
- Handling missing values — Handling missing values
- Outliers — Outliers
- Dimensionality reduction: PCA for mining — Dimensionality reduction: PCA for mining
- Class imbalance strategies — Class imbalance strategies
Supervised learning
- Classification and regression trees — Classification and regression trees
- Ensemble methods: bagging — Ensemble methods: bagging
- Random forests — Random forests
- Boosting (AdaBoost, gradient boosting intro) — Boosting (AdaBoost, gradient boosting intro)
- k-nearest neighbors and naive Bayes — k-nearest neighbors and naive Bayes
- Model evaluation: ROC and AUC — Model evaluation: ROC and AUC
- Confusion matrices — Confusion matrices
Unsupervised learning
- Cluster analysis for market segmentation — Cluster analysis for market segmentation
- Association rules — Association rules
- Market basket analysis — Market basket analysis
- Anomaly detection (introduction) — Anomaly detection (introduction)
- Text mining basics (optional) — Text mining basics (optional)
Multi-Unit Problems
Course-level sets that combine skills across study units (coming soon).
Browse Multi-Unit ProblemsWhat each unit includes
Open a unit below for full materials. Typical resources:
- Study guide
- Exam Strategy
- Common Mistakes
- Worksheets
- Word problems
- Mixed Practice
- Multi-Unit Problems
- Review
- Practice test
- Answer key
Study units
Each unit includes a study guide, worksheets, review, practice test, and answer key. One unit is free; subscribe for the full class.
- Data preparation
Train/validation/test splits
Coming soon - Supervised learning
Classification and regression trees
Coming soon - Unsupervised learning
Cluster analysis for market segmentation
Coming soon
Pricing calculator
Choose materials, tutoring, or both — or book a single session as needed. Customize your plan on the subscribe page.
$1,162 · Data mining · 18 tutoring hrs
Study guides, worksheets, reviews, practice tests, and answer keys for 1 class. 18 tutoring hours (1 hr / week · semester). Bundle discount applied vs buying separately. Pay in full via Zelle.