π
Data Science with Python
L3PROΒ· 104 lessonspandas, polars, real datasets, dashboards
πcert_available_label
Certificate in Applied Data Science with Python
0 / 40 cert_lessons_toward
104 lessons across 6 modules: pandas + numpy for data work, cleaning & feature engineering, modeling & evaluation, A/B testing & causal inference, production ML pipelines, and deep-learning foundations (backprop, transformers, fine-tuning, MLOps registry + drift).
β
Before you start
- Β·Python Foundations done β you can write loops, list comprehensions, and functions
- Β·High-school statistics: mean, median, variance. We re-teach the rest as needed
- Β·Comfortable with the idea of a DataFrame: rows + columns. We deep-dive pandas
πSelecting columns and rows
πFiltering with boolean masks
πMissing data (NaN, fillna, dropna)
πapply() β custom per-row logic
πTime series: dates and resampling
πPolars: when pandas is too slow
πCapstone: end-to-end sales analysis
πDataFrame.melt β wide to long
πType optimization for memory
πPolars vs pandas: syntax differences
ππ― Review: Data Science module 1 recap
πSQL from pandas: read_sql
πscikit-learn intro: a 5-line model
πpandas MultiIndex (hierarchical indexing)
πWindow functions: .rolling and .expanding
πCategorical data deep-dive
πpd.cut and pd.qcut for binning
πTime-series resampling tricks
πpandas-on-Spark (pyspark.pandas)
πDuckDB on Parquet β analytics without a DB
πPlotly Express for interactive charts
πseaborn for statistical viz
πPlotnine (ggplot in Python)
πStreamlit dashboards: first app in 50 lines
πStreamlit caching + state
πOutlier detection (IQR, Z-score, Isolation Forest)
πFeature engineering for tabular ML
πStratified train/test/val splits
ππ― Review: Data Science module 2 recap
πCross-validation strategies
πsklearn Pipeline + ColumnTransformer
πCapstone: end-to-end ML pipeline
πRolling, expanding, and EWM windows
πPivot tables and multi-index basics
πmerge_asof for backward-join on time
πqcut for quantile-based bucketing
πTarget encoding (and leakage caveat)
πTime-series lag features via shift()
πARIMA, seasonal decomposition, Prophet
πRolling std as a volatility feature
πTime-series CV vs random K-fold
πPredict: ROC AUC for perfect ranking
πClass imbalance: weights vs SMOTE
πFix the leakage: scale-before-split
πGridSearchCV vs RandomizedSearchCV vs Optuna
πSHAP β local feature attribution
πPCA explained-variance calculation
ππ― Review: Data Science module 3 recap
πK-Means: silhouette score from scratch
πOutlier detection: IQR rule
πA/B test sample size calculator
πMulti-armed bandits: epsilon-greedy
πCapstone: production-grade pipeline + calibration
πStreaming z-score outlier detector
πStratified train/test split
πConfusion-matrix metrics from scratch
πROC AUC by Mann-Whitney equivalence
πClass imbalance: SMOTE-lite oversampling
πMin-max & standard scaling
πK-fold cross-validation harness
πOne-hot vs target encoding
πTrain/test data leakage β find the bug
πCohen's d β effect size
πBootstrap confidence interval
πSliding-window time-series feature
πGradient descent on linear regression
πPCA β top component by power iteration
ππ Capstone: end-to-end Kaggle-style pipeline
ππ― Review: Data Science module 5 recap
πNeuron: weights, bias, activation
πBackpropagation: chain rule applied
πOptimizers: SGD vs Adam vs AdamW
πEmbeddings: cosine vs Euclidean
πTokenization: BPE / WordPiece / SentencePiece
πTransformer: attention in one paragraph
πFine-tuning: full vs LoRA
πEvaluation: BLEU / ROUGE / LLM-as-judge
πClass imbalance: production fix
πFeature stores: why they exist
πDrift detection: data vs concept
πMLOps: model registry + versioning
πCausal inference: correlation β causation
πA/B test: minimum detectable effect
πRecommenders: collaborative vs content-based
πTime series: stationarity check
πPandas: vectorized vs apply vs iterrows
πPolars / DuckDB for big DataFrames
ππ Final capstone: ML production blueprint
Tip: click any lesson to revisit it. After your first attempt, the βShow exampleβ button reveals the full solution.