Astra Trainer

Coming soon

Data Science & Analytics

Find the answer in messy data, and prove it.

The complete course

modules
71
topics
818
min lessons
15

#1

Employers rank AI and big data the fastest-growing skill to 2030.

WEF Future of Jobs Report 2025

Seven stages.One steady climb.

From a messy table to a recommendation someone signs off on.

Hours and months are estimates: one 15-minute lesson per topic, every day.

Every module.Every topic.

Stages

Stage 1

Foundations & Data Wrangling

Messy data, made trustworthy

15 modules · 175 topics

  1. 1Foundations of Data Science and Analytics10 topics
    • Data Science, Analytics, and Business Intelligence
    • Descriptive, Diagnostic, Predictive, and Prescriptive Questions
    • Statistical Inference and Causal Inference
    • Data as Evidence About a Larger Process
    • From Raw Observations to Decisions
    • The Analytical Project Lifecycle
    • Domain Knowledge and Analytical Judgment
    • Roles of Analysts, Data Scientists, and Data Engineers
    • Reproducibility, Transparency, and Responsible Interpretation
    • Recognizing What Available Data Cannot Answer
  2. 2Analytical Problem Framing11 topics
    • Translating a Business Question into an Analytical Question
    • Defining the Decision an Analysis Will Inform
    • Units of Observation and Units of Analysis
    • Target Populations and Relevant Time Horizons
    • Outcomes, Exposures, Treatments, and Covariates
    • Estimands and Precisely Defined Quantities of Interest
    • Hypotheses, Assumptions, and Competing Explanations
    • Baselines, Comparators, and Success Criteria
    • Data Availability and Feasibility Assessment
    • Stakeholder Alignment and Scope Boundaries
    • Choosing an Analytical Deliverable for the Decision
  3. 3Measurement and Data-Generating Processes12 topics
    • How Data Are Created, Recorded, and Selected
    • Constructs, Proxies, and Operational Definitions
    • Nominal, Ordinal, Interval, and Ratio Scales
    • Continuous, Discrete, Binary, and Count Variables
    • Measurement Validity and Reliability
    • Measurement Error and Instrument Limitations
    • Observation Windows and Exposure Time
    • Units, Denominators, and Population at Risk
    • Selection Mechanisms and Unobserved Cases
    • Administrative Data and Designed Research Data
    • Changes in Measurement Across Time and Groups
    • Distinguishing Real-World Change from Recording Change
  4. 4Quantitative Foundations for Data Analysis12 topics
    • Ratios, Rates, Proportions, and Percentages
    • Percentage Change and Percentage-Point Change
    • Weighted Averages and Aggregation Rules
    • Logarithms, Exponentials, and Growth Rates
    • Functions and Transformations of Variables
    • Vectors, Matrices, and Tabular Representations
    • Dot Products and Linear Combinations
    • Derivatives as Rates of Change
    • Optimization Objectives and Loss Functions
    • Numerical Precision and Rounding Effects
    • Dimensional Consistency and Unit Conversion
    • Order-of-Magnitude Checks and Plausibility Tests
  5. 5Spreadsheet Analytics and Analytical Prototyping12 topics
    • Structured Tables and Consistent Column Types
    • Relative, Absolute, and Structured References
    • Conditional Aggregation and Lookup Functions
    • Pivot Tables and Grouped Summaries
    • Array Calculations and Reusable Formulas
    • Dates, Number Formats, and Hidden Type Errors
    • Formula Auditing and Error Propagation
    • Data Validation and Protected Input Areas
    • Scenario Tables and What-If Models
    • Reconciling Spreadsheet Totals with Source Records
    • Documenting Manual Steps and Workbook Assumptions
    • Choosing Between Spreadsheet, SQL, and Code-Based Workflows
  6. 6Analytical Programming with Python and R13 topics
    • Notebooks, Scripts, and Interactive Analysis
    • Variables, Data Types, and Collections
    • Arrays, Series, Data Frames, and Tables
    • NumPy, pandas, and R Data Analysis Workflows
    • Indexing, Filtering, and Boolean Logic
    • Vectorized Operations and Elementwise Calculations
    • Functions for Reusable Analytical Steps
    • Iteration and Simulation Workflows
    • Dates, Strings, and Categorical Data
    • Missing Values and Type Conversion
    • Reading Errors and Debugging Analytical Code
    • Assertions and Checks on Intermediate Results
    • Choosing and Documenting an Analysis Environment
  7. 7Tabular Data Transformation12 topics
    • Tidy Data and Consistent Table Structure
    • Selecting, Renaming, and Reordering Columns
    • Filtering Records and Deriving Variables
    • Grouping and Aggregating Observations
    • Reshaping Between Wide and Long Formats
    • Joining Tables and Matching Keys
    • Join Cardinality and Row Multiplication
    • Concatenation, Unions, and Schema Alignment
    • Sorting, Ranking, and Within-Group Operations
    • Text Parsing and Structured Field Extraction
    • Time-Based and Nearest-Match Joins
    • Validating Transformations with Reconciliation Checks
  8. 8SQL Foundations for Analytics11 topics
    • Tables, Rows, Columns, and Relational Keys
    • SELECT, WHERE, and ORDER BY
    • Expressions, CASE Statements, and Derived Fields
    • NULL Values and Three-Valued Logic
    • COUNT, SUM, AVG, and Other Aggregations
    • GROUP BY and HAVING
    • Inner, Left, Full, and Cross Joins
    • Subqueries and Common Table Expressions
    • DISTINCT, Duplicates, and Counting Units
    • Date, Time, and Interval Calculations
    • Translating an Analytical Question into a Query
  9. 9Advanced Analytical SQL14 topics
    • Window Functions and Partitioned Calculations
    • ROW_NUMBER, RANK, and Dense Ranking
    • LAG, LEAD, and Event Sequences
    • Running Totals and Rolling Windows
    • Window Frames and Boundary Semantics
    • Conditional Aggregation and Pivoted Summaries
    • Querying Nested and Semistructured Data
    • Recursive Queries for Hierarchical Relationships
    • Sessionization and Time-Gap Logic
    • Cohort Tables and Retention Queries
    • Funnel Steps and Ordered Event Matching
    • As-Of Logic and Historical State Reconstruction
    • Query Plans and Expensive Join Patterns
    • Verifying Complex Queries Against Small Known Examples
  10. 10Data Acquisition and Integration12 topics
    • Files, Databases, APIs, and Event Streams as Data Sources
    • CSV, Spreadsheet, JSON, and Columnar Data Formats
    • Encodings, Delimiters, and Schema Detection
    • API Pagination, Rate Limits, and Incremental Retrieval
    • Public Data Portals and Source Documentation
    • Permission, Licensing, and Appropriate Data Reuse
    • Identifiers and Cross-Source Record Matching
    • Entity Resolution and Ambiguous Matches
    • Timestamp Alignment and Timezone Conversion
    • Source Reconciliation and Conflicting Values
    • Preserving Raw Inputs and Acquisition Metadata
    • Assessing Coverage Before Combining Datasets
  11. 11Analytical Data Modeling11 topics
    • Transactional and Analytical Data Structures
    • Table Grain and the Meaning of One Row
    • Fact Tables and Dimension Tables
    • Star Schemas and Analytical Relationships
    • Event Facts, Snapshots, and Accumulating Records
    • Slowly Changing Dimensions and Historical Attributes
    • Additive, Semiadditive, and Nonadditive Measures
    • Many-to-Many Relationships and Bridge Tables
    • Semantic Layers and Shared Metric Definitions
    • Derived Tables and Reusable Analytical Datasets
    • Preventing Double Counting Across Data Models
  12. 12Data Cleaning and Standardization11 topics
    • Profiling Types, Ranges, and Value Frequencies
    • Parsing Numbers, Dates, and Structured Strings
    • Standardizing Units, Categories, and Labels
    • Duplicate Records and Duplicate Entities
    • Impossible Values and Logical Contradictions
    • Outliers, Rare Events, and Data Entry Errors
    • Text Normalization and Identifier Cleanup
    • Resolving Conflicting Records
    • Handling Truncated, Rounded, and Censored Measurements
    • Documenting Cleaning Decisions and Their Consequences
    • Comparing Results Before and After Cleaning
  13. 13Missing Data and Measurement Error11 topics
    • Missing Completely at Random, at Random, and Not at Random
    • Missingness Patterns and Plausible Mechanisms
    • Complete-Case Analysis and Its Assumptions
    • Simple Imputation and Distorted Uncertainty
    • Multiple Imputation Principles
    • Missingness Indicators and Their Interpretation
    • Attrition, Dropout, and Lost Follow-Up
    • Measurement Error in Outcomes and Predictors
    • Misclassification of Categorical Variables
    • Sensitivity Analysis for Unobserved Values
    • Distinguishing Absence of an Event from Absence of a Record
  14. 14Data Quality and Lineage11 topics
    • Accuracy, Completeness, Consistency, and Timeliness
    • Uniqueness, Validity, and Referential Integrity
    • Data Contracts and Expected Schemas
    • Field-Level and Dataset-Level Quality Checks
    • Freshness, Volume, and Distribution Monitoring
    • Reconciliation with Source Systems
    • Lineage from Raw Data to Published Metrics
    • Quality Ownership and Issue Escalation
    • Schema Changes and Broken Assumptions
    • Quantifying the Analytical Impact of Quality Problems
    • Recording Known Limitations in Dataset Documentation
  15. 15Reproducible Analytical Workflows12 topics
    • Organizing Data, Code, Outputs, and Documentation
    • Separating Raw, Intermediate, and Final Datasets
    • Version Control for Analytical Work
    • Environment and Dependency Reproducibility
    • Random Seeds and Sources of Nondeterminism
    • Parameterized Analyses and Repeatable Reports
    • Executable Notebooks and Hidden State
    • Lightweight Tests for Analytical Assumptions
    • Peer Review of Queries, Code, and Conclusions
    • Verifying AI-Assisted Code and Statistical Suggestions
    • Recording Decisions, Exclusions, and Deviations
    • Reproducing an Analysis from Its Documented Inputs

Stage 2

Statistics & Inference

What the numbers can and can't say

13 modules · 151 topics

  1. 16Descriptive Statistics12 topics
    • Counts, Frequencies, and Relative Frequencies
    • Means, Medians, Modes, and Trimmed Means
    • Variance, Standard Deviation, and Interquartile Range
    • Quantiles, Percentiles, and Distribution Tails
    • Skewness, Heavy Tails, and Multimodality
    • Weighted Descriptive Statistics
    • Rates with Unequal Exposure or Population Size
    • Covariance and Correlation
    • Cross-Tabulations and Conditional Summaries
    • Aggregation Bias and Simpson's Paradox
    • Robust Summaries for Skewed and Contaminated Data
    • Choosing Summaries That Match the Analytical Question
  2. 17Exploratory Data Analysis11 topics
    • Establishing Dataset Structure and Coverage
    • Exploring Individual Variable Distributions
    • Examining Relationships Between Variables
    • Comparing Groups and Subpopulations
    • Detecting Anomalies and Unexpected Patterns
    • Investigating Temporal and Spatial Variation
    • Exploring Missingness and Data Collection Artifacts
    • Testing Initial Explanations Against Alternative Views
    • Separating Exploration from Confirmation
    • Recording Hypotheses Generated During Exploration
    • Identifying the Next Data or Analysis Needed
  3. 18Data Visualization Principles12 topics
    • Matching Chart Types to Analytical Tasks
    • Visual Encodings and Perceptual Accuracy
    • Distributions, Comparisons, Relationships, and Trends
    • Scales, Axes, Baselines, and Transformations
    • Small Multiples and Consistent Comparisons
    • Visualizing Uncertainty and Sample Size
    • Overplotting, Binning, and Density Displays
    • Color, Contrast, and Accessible Design
    • Annotations and Contextual Reference Lines
    • Interactive Filtering and Linked Views
    • Recognizing Misleading and Overdecorated Charts
    • Choosing Tables When Exact Values Matter
  4. 19Probability and Conditional Reasoning11 topics
    • Events, Sample Spaces, and Probability Rules
    • Conditional Probability and Independence
    • Joint and Marginal Probabilities
    • Bayes' Theorem and Updating Beliefs
    • Base Rates and Inverse Probability Errors
    • Independence and Conditional Independence
    • Counting Rules and Combinatorial Reasoning
    • Expected Value and Long-Run Averages
    • Law of Total Probability and Total Expectation
    • Translating Verbal Uncertainty into Probability Models
    • Simulating Probability Problems to Check Intuition
  5. 20Random Variables and Probability Models12 topics
    • Discrete and Continuous Random Variables
    • Probability Mass, Density, and Cumulative Distribution Functions
    • Expectation, Variance, and Covariance
    • Bernoulli and Binomial Models
    • Poisson and Count Models
    • Normal and Lognormal Models
    • Exponential and Waiting-Time Models
    • Heavy-Tailed and Mixture Distributions
    • Joint Distributions and Dependence
    • Transformations of Random Variables
    • Laws of Large Numbers and the Central Limit Theorem
    • Matching Distributional Assumptions to Observed Data
  6. 21Sampling and Study Design12 topics
    • Populations, Sampling Frames, and Samples
    • Probability and Nonprobability Sampling
    • Simple Random and Systematic Sampling
    • Stratified and Cluster Sampling
    • Multistage Sampling Designs
    • Convenience Samples and Coverage Bias
    • Selection Bias and Survivorship Bias
    • Cross-Sectional, Longitudinal, and Repeated Cross-Sectional Studies
    • Independent Observations and Clustered Observations
    • Sampling Error and Nonsampling Error
    • Generalizability and Target Population Alignment
    • Designing Data Collection Around the Intended Inference
  7. 22Survey Analytics and Weighting11 topics
    • Questionnaire Design and Measurement Consistency
    • Question Wording, Ordering, and Response Options
    • Response Bias and Social Desirability
    • Unit Nonresponse and Item Nonresponse
    • Sampling Weights and Unequal Selection Probabilities
    • Nonresponse Adjustments and Calibration
    • Poststratification and Raking
    • Design Effects and Effective Sample Size
    • Weighted Estimation and Uncertainty
    • Comparing Survey Responses with Behavioral Records
    • Reporting Representation and Remaining Bias
  8. 23Estimation and Uncertainty11 topics
    • Parameters, Estimators, and Estimates
    • Bias, Variance, and Mean Squared Error
    • Sampling Distributions and Standard Errors
    • Point Estimates and Interval Estimates
    • Confidence Intervals and Their Interpretation
    • Estimation for Means, Proportions, Rates, and Differences
    • Maximum Likelihood as an Estimation Framework
    • Uncertainty in Ratios and Nonlinear Quantities
    • Prediction Intervals and Confidence Intervals
    • Finite-Sample and Asymptotic Reasoning
    • Communicating Uncertainty Without Hiding the Main Result
  9. 24Resampling and Computational Inference11 topics
    • Simulation as a Tool for Statistical Reasoning
    • Bootstrap Resampling and Sampling Variability
    • Bootstrap Confidence Intervals
    • Permutation Tests and Exchangeability
    • Randomization Tests and Assignment Mechanisms
    • Resampling Paired and Clustered Observations
    • Block Resampling for Dependent Temporal Data
    • Monte Carlo Error and Simulation Precision
    • Parametric and Nonparametric Resampling
    • Situations Where Naive Resampling Fails
    • Checking Analytical Results with Computational Experiments
  10. 25Hypothesis Testing14 topics
    • Null and Alternative Hypotheses
    • Test Statistics and Reference Distributions
    • P-Values and Their Interpretation Limits
    • Type I and Type II Errors
    • One-Sided and Two-Sided Tests
    • Tests for Means, Proportions, and Group Differences
    • Paired and Independent-Sample Comparisons
    • Analysis of Variance and Planned Contrasts
    • Contingency Tables and Categorical Association Tests
    • Small-Sample and Exact Tests
    • Rank-Based and Distribution-Free Methods
    • Statistical Significance and Practical Importance
    • Equivalence and Noninferiority Questions
    • Reporting Effect Sizes Alongside Test Results
  11. 26Statistical Power and Sample Size Planning10 topics
    • Power as a Property of a Specified Study Design
    • Minimum Detectable Effects and Decision-Relevant Effects
    • Baseline Rates and Outcome Variability
    • Sample Size for Means, Proportions, and Differences
    • Allocation Ratios and Unequal Group Sizes
    • Clustering and Repeated Measurements in Power Calculations
    • Attrition and Incomplete Outcome Observation
    • Duration Planning for Seasonal or Delayed Outcomes
    • Simulation-Based Power Analysis
    • Interpreting Inconclusive Results Without Post Hoc Power Claims
  12. 27Multiple Testing and Reliable Statistical Evidence12 topics
    • Families of Hypotheses and Multiplicity
    • Family-Wise Error and False Discovery Rate
    • Adjustment Methods and Their Assumptions
    • Exploratory and Confirmatory Analysis Plans
    • Selective Reporting and Researcher Degrees of Freedom
    • P-Hacking and Repeated Unplanned Analyses
    • Winner's Curse and Effect Size Inflation
    • Replication and Independent Confirmation
    • Sensitivity to Analytical Choices
    • Multiverse and Specification-Curve Reasoning
    • Preregistration and Transparent Deviations
    • Evaluating Evidence Beyond a Significance Threshold
  13. 28Bayesian Analysis12 topics
    • Prior, Likelihood, and Posterior Distributions
    • Bayesian Updating for Simple Data Models
    • Weakly Informative and Domain-Informed Priors
    • Prior Predictive Checks
    • Posterior Summaries and Credible Intervals
    • Posterior Predictive Distributions
    • Bayesian Estimation of Rates and Group Differences
    • Hierarchical Priors and Shrinkage
    • Computational Posterior Approximation
    • Convergence and Effective Sample Size Concepts
    • Prior Sensitivity and Model Criticism
    • Posterior Probabilities in Decision Contexts

Stage 3

Modeling & Forecasting

Models that explain and predict

10 modules · 118 topics

  1. 29Linear Regression and Explanatory Models12 topics
    • Simple and Multiple Linear Regression
    • Least Squares and Fitted Relationships
    • Coefficient Interpretation and Measurement Units
    • Categorical Predictors and Reference Groups
    • Interactions and Conditional Associations
    • Transformations of Outcomes and Predictors
    • Residual Variation and Explained Variation
    • Standard Errors and Coefficient Intervals
    • Conditional Mean and Exogeneity Assumptions
    • Association, Adjustment, and Causal Interpretation
    • Prediction for New Observations
    • Communicating Regression Results in Practical Terms
  2. 30Generalized Linear Models12 topics
    • Outcome Distributions and Link Functions
    • Logistic Regression for Binary Outcomes
    • Odds, Odds Ratios, and Predicted Probabilities
    • Marginal Effects and Standardized Predictions
    • Multinomial and Ordinal Outcome Models
    • Poisson Regression for Counts
    • Offsets and Unequal Exposure
    • Overdispersion and Negative Binomial Models
    • Positive Skewed Outcomes and Gamma Models
    • Excess Zeros and Two-Part Outcome Processes
    • Likelihood-Based Estimation and Model Comparison
    • Matching the Model to the Data-Generating Process
  3. 31Regression Diagnostics and Robust Analysis12 topics
    • Residual Patterns and Model Misspecification
    • Heteroskedasticity and Robust Standard Errors
    • Multicollinearity and Unstable Coefficients
    • Leverage, Influence, and Unusual Observations
    • Nonlinear Relationships and Flexible Functional Forms
    • Splines and Generalized Additive Model Concepts
    • Robust Regression and Sensitivity to Outliers
    • Quantile Regression and Distributional Effects
    • Regularization as a Tool for Stability
    • Model Selection and Post-Selection Uncertainty
    • Extrapolation and Unsupported Predictions
    • Comparing Conclusions Across Reasonable Model Specifications
  4. 32Hierarchical, Longitudinal, and Panel Data11 topics
    • Repeated Observations and Within-Unit Dependence
    • Nested and Crossed Data Structures
    • Fixed Effects and Unit-Specific Baselines
    • Random Intercepts and Random Slopes
    • Partial Pooling Across Groups
    • Within-Group and Between-Group Associations
    • Cluster-Robust Inference
    • Generalized Estimating Equation Concepts
    • Time-Varying Covariates and Dynamic Outcomes
    • Unequal Follow-Up and Unbalanced Panels
    • Choosing Models for Conditional and Population-Average Questions
  5. 33Predictive Analytics and Model Validation13 topics
    • Prediction Targets and Decision Context
    • Baseline Models and Benchmark Performance
    • Training, Validation, and Test Data Roles
    • Cross-Validation and Appropriate Data Splits
    • Group-Based and Time-Based Validation
    • Target Leakage and Information Available at Prediction Time
    • Regression Error Metrics and Asymmetric Costs
    • Classification Metrics and Class Imbalance
    • Probability Calibration and Decision Thresholds
    • Performance Variation Across Subpopulations
    • Predictive Uncertainty and Distribution Shift
    • Explaining Predictions Without Inferring Causation
    • Comparing Model Utility with a Simple Decision Baseline
  6. 34Multivariate Analysis and Data Segmentation11 topics
    • Correlation Structure Across Multiple Variables
    • Standardization and Scale-Sensitive Comparisons
    • Principal Components as Low-Dimensional Summaries
    • Explained Variance and Component Interpretation
    • Factor Analysis and Latent Construct Assumptions
    • Distances and Similarity Measures
    • Clustering as an Exploratory Summary
    • Choosing and Evaluating Segment Granularity
    • Cluster Stability and Sensitivity to Preprocessing
    • Profiling Segments with Independent Variables
    • Distinguishing Discovered Groups from Natural Categories
  7. 35Time-Series Data and Temporal Structure11 topics
    • Time Indexes, Frequencies, and Observation Intervals
    • Trends, Seasonality, Cycles, and Irregular Variation
    • Calendar Effects and Timezone Boundaries
    • Autocorrelation and Partial Autocorrelation
    • Stationarity and Structural Change
    • Differencing and Seasonal Adjustment
    • Decomposition of Temporal Patterns
    • Lagged Variables and Time Alignment
    • Irregular Sampling and Temporal Aggregation
    • Missing Periods and Revised Observations
    • Distinguishing Leading Indicators from Lagged Correlations
  8. 36Statistical Forecasting12 topics
    • Forecast Horizons and Forecasting Objectives
    • Naive, Seasonal Naive, and Drift Baselines
    • Moving Averages and Exponential Smoothing
    • Trend and Seasonal Exponential Smoothing Models
    • Autoregressive and Moving-Average Components
    • Differencing and ARIMA Models
    • Seasonal ARIMA and Repeated Temporal Patterns
    • Dynamic Regression with External Predictors
    • Predictor Availability at the Forecast Origin
    • Prediction Intervals and Forecast Distributions
    • Combining Forecasts and Incorporating Structured Judgment
    • Handling Structural Breaks and Regime Changes
  9. 37Forecast Evaluation and Demand Planning12 topics
    • Rolling-Origin and Expanding-Window Evaluation
    • Horizon-Specific Forecast Accuracy
    • MAE, RMSE, and Scaled Error Measures
    • Percentage Error Metrics and Zero-Value Problems
    • Forecast Bias and Systematic Underprediction
    • Interval Coverage and Probabilistic Forecast Evaluation
    • Hierarchical and Grouped Forecast Reconciliation
    • Intermittent Demand and Sparse Outcomes
    • Demand Censoring and Stockout Distortion
    • Scenario Forecasts and Conditional Assumptions
    • Forecasts, Targets, and Capacity Constraints
    • Translating Forecast Error into Decision Consequences
  10. 38Survival and Event-History Analysis12 topics
    • Time-to-Event Outcomes and Observation Windows
    • Right, Left, and Interval Censoring
    • Truncation and Delayed Entry
    • Survival, Hazard, and Cumulative Hazard Functions
    • Kaplan-Meier Estimation
    • Comparing Survival Curves
    • Cox Proportional Hazards Models
    • Proportional Hazards Assumptions and Diagnostics
    • Accelerated Failure Time Models
    • Competing Risks and Cumulative Incidence
    • Restricted Mean Survival Time
    • Event Recurrence and Time-Varying Exposures

Stage 4

Causality & Experiments

Cause, not just correlation

7 modules · 82 topics

  1. 39Foundations of Causal Inference12 topics
    • Counterfactual Questions and Potential Outcomes
    • Average and Conditional Treatment Effects
    • Consistency and Well-Defined Interventions
    • Exchangeability and Confounding
    • Positivity and Treatment Overlap
    • Causal Diagrams and Directed Acyclic Graphs
    • Confounders, Mediators, and Colliders
    • Backdoor Paths and Adjustment Sets
    • Selection Bias and Conditioning on Post-Treatment Variables
    • Identification Versus Estimation
    • Interference and Spillover Effects
    • Generalization and Transport to New Populations
  2. 40Causal Inference from Observational Data12 topics
    • Emulating a Target Trial with Observational Records
    • Defining Eligibility, Treatment, Follow-Up, and Outcomes
    • Outcome Regression and Standardization
    • Propensity Scores and Their Interpretation
    • Matching and Covariate Balance
    • Inverse Probability Weighting
    • Extreme Weights and Limited Overlap
    • Doubly Robust Estimation Concepts
    • Time-Varying Treatments and Confounding
    • Negative Controls and Falsification Checks
    • Sensitivity to Unmeasured Confounding
    • Reporting Assumptions That Data Alone Cannot Verify
  3. 41Natural Experiments and Identification Strategies11 topics
    • Natural Experiments and Plausibly Exogenous Variation
    • Instrumental Variables and the Assignment Mechanism
    • Relevance, Independence, and Exclusion Restrictions
    • Local Average Treatment Effects and Monotonicity
    • Weak Instruments and Unstable Estimates
    • Regression Discontinuity Around Assignment Thresholds
    • Sharp and Fuzzy Discontinuity Designs
    • Bandwidth Selection and Local Comparisons
    • Manipulation, Sorting, and Continuity Checks
    • Placebo Thresholds and Alternative Explanations
    • Limits of Generalizing Local Causal Effects
  4. 42Panel Data Methods for Causal Analysis11 topics
    • Before-After Comparisons and Their Limitations
    • Difference-in-Differences Design
    • Parallel Trends and the Untreated Counterfactual
    • Event Studies and Dynamic Treatment Effects
    • Anticipation and Treatment Timing
    • Staggered Adoption and Heterogeneous Effects
    • Serial Correlation and Appropriate Inference
    • Synthetic Control Design and Donor Selection
    • Pre-Treatment Fit and Placebo Comparisons
    • Interrupted Time Series and Concurrent Changes
    • Sensitivity to Comparison Groups and Time Windows
  5. 43Randomized Experimental Design12 topics
    • Random Assignment and Causal Identification
    • Experimental Units and Analysis Units
    • Control Groups and Treatment Conditions
    • Blocking, Stratification, and Matched Designs
    • Allocation Concealment and Blinding Concepts
    • Primary Outcomes and Predefined Analysis Plans
    • Noncompliance and Intention-to-Treat Effects
    • Attrition and Missing Outcomes in Experiments
    • Balance Checks and Interpretation Limits
    • Experiment Duration and Delayed Effects
    • Ethical Constraints and Participant Impacts
    • Connecting Experimental Results to the Target Decision
  6. 44Online Controlled Experiments12 topics
    • A/B Testing in Digital Products
    • Eligibility, Assignment, Exposure, and Analysis Populations
    • Stable Assignment and Cross-Device Identity
    • A/A Tests and Instrumentation Validation
    • Sample Ratio Mismatch and Allocation Failures
    • Primary Metrics, Guardrails, and Diagnostic Metrics
    • Triggered Analyses and Exposure Bias
    • Novelty, Learning, and Carryover Effects
    • Bots, Internal Users, and Invalid Traffic
    • Attribution Windows and Delayed Outcomes
    • Experiment Interactions and Concurrent Changes
    • Interpreting and Communicating a Product Experiment
  7. 45Advanced Experimentation and Treatment Heterogeneity12 topics
    • Factorial Designs and Interaction Effects
    • Multivariant Experiments and Comparison Families
    • Cluster Randomization and Group-Level Outcomes
    • Switchback Designs and Time-Based Assignment
    • Network Effects and Interference-Aware Experiments
    • Sequential Testing and Planned Monitoring
    • Alpha Spending and Repeated-Look Error Control
    • Bayesian Monitoring and Decision Rules
    • CUPED and Pre-Experiment Covariate Adjustment
    • Heterogeneous Treatment Effects and Subgroup Credibility
    • Adaptive Allocation and Inference Tradeoffs
    • Long-Term Holdouts and Persistent Effects

Stage 5

Product & Business Analytics

The numbers a business runs on

11 modules · 128 topics

  1. 46Metric Design and Metric Systems12 topics
    • Business Objectives and Operational Metrics
    • North Star Metrics and Supporting Measures
    • Metric Trees and Driver Decomposition
    • Leading, Lagging, and Guardrail Metrics
    • Numerator, Denominator, and Eligibility Definitions
    • Users, Accounts, Sessions, Events, and Transactions
    • Ratios of Totals and Averages of Ratios
    • Aggregation Windows and Timezone Policies
    • Metric Sensitivity and Responsiveness
    • Goodhart's Law and Metric Gaming
    • Ownership, Versioning, and Metric Change Governance
    • Distinguishing a Useful Proxy from the Desired Outcome
  2. 47Event Instrumentation and Behavioral Data12 topics
    • Tracking Plans and Event Taxonomies
    • Event Names, Properties, and Schema Contracts
    • Client-Side and Server-Side Measurement
    • Event Time, Processing Time, and Late Arrival
    • Identity Resolution and Anonymous-to-Known Transitions
    • Deduplication, Retries, and Idempotent Event Handling
    • Session Boundaries and Activity Windows
    • Consent, Blocking, and Unobserved Behavior
    • Attribution Metadata and Source Context
    • Instrumentation QA and End-to-End Reconciliation
    • Tracking Changes Across Application Releases
    • Identifying Measurement Gaps Before Interpreting Behavior
  3. 48Product and Engagement Analytics11 topics
    • Acquisition, Activation, Engagement, and Value Delivery
    • Defining Meaningful Active Use
    • Feature Adoption and Depth of Use
    • Frequency, Recency, and Engagement Intensity
    • Active User Ratios and Their Limitations
    • User Journeys and Behavioral Sequences
    • Exposure Opportunity and Actual Feature Usage
    • Account-Level and User-Level Product Analysis
    • Segment Mix and Apparent Engagement Changes
    • Diagnosing Product Friction with Behavioral Evidence
    • Linking Product Metrics to User and Business Outcomes
  4. 49Funnel and Conversion Analysis11 topics
    • Funnel Steps and Eligible Starting Populations
    • Open and Closed Funnel Definitions
    • User-Level, Session-Level, and Event-Level Conversion
    • Ordered and Unordered Step Completion
    • Conversion Windows and Delayed Completion
    • Repeated Attempts and Deduplicated Outcomes
    • Step-Level Drop-Off and Time Between Steps
    • Segment Comparisons with Consistent Denominators
    • Cross-Device and Cross-Channel Journey Gaps
    • Separating Traffic Mix Changes from Conversion Changes
    • Testing Explanations for Funnel Bottlenecks
  5. 50Cohort, Retention, and Churn Analysis12 topics
    • Acquisition, Activation, and Behavioral Cohorts
    • Calendar Time and Time Since Cohort Entry
    • Fixed-Period, Rolling, and Return-Window Retention
    • Cohort Maturity and Incomplete Observation
    • Retention Curves and Retention Matrices
    • Churn Definitions and Inactivity Thresholds
    • Reactivation and Resurrected Users
    • Customer Churn and Revenue Churn
    • Survival-Based Interpretation of Retention
    • Comparing Cohorts Under Changing Product and Channel Mix
    • Leading Signals and Causal Claims About Churn
    • Long-Term Retention with Limited Follow-Up
  6. 51Customer, Revenue, and Unit Economics Analytics13 topics
    • Customer, Account, Subscription, and Transaction Units
    • Revenue Definitions and Recognition Timing
    • Bookings, Billings, Cash Receipts, and Reported Revenue
    • Recurring and Nonrecurring Revenue
    • Gross and Net Revenue Retention
    • Revenue per User and Revenue per Paying Customer
    • Discounts, Refunds, and Failed Payments
    • Contribution Margin and Cost Allocation Assumptions
    • Customer Acquisition Cost and Attribution Scope
    • Customer Lifetime Value and Observation Horizon
    • Payback Period and Cohort Economics
    • Discounting, Uncertainty, and Scenario-Based Value Estimates
    • Avoiding Misleading Averages Across Customer Segments
  7. 52Marketing Measurement and Incrementality12 topics
    • Campaign Taxonomies and Acquisition Source Definitions
    • Reach, Frequency, Response, and Conversion Metrics
    • Attribution Windows and Touchpoint Visibility
    • First-Touch, Last-Touch, and Multitouch Attribution
    • Attribution Credit and Incremental Impact
    • Selection Bias in Channel Comparisons
    • Holdout Tests and Conversion Lift Studies
    • Geographic Experiments and Market-Level Comparisons
    • Marketing Mix Modeling and Identification Limits
    • Carryover, Saturation, and Channel Interactions
    • Organic and Paid Activity Overlap
    • Evaluating Measurement Under Incomplete Tracking
  8. 53Operational and Process Analytics11 topics
    • Process Events, Cases, and Activity Sequences
    • Throughput, Cycle Time, and Waiting Time
    • Capacity, Utilization, and Bottlenecks
    • Queueing Concepts and Little's Law
    • Service Levels and Tail Performance
    • Demand Variability and Workload Planning
    • Process Mining and Deviations from Expected Flows
    • Rework, Error Rates, and First-Pass Outcomes
    • Resource Productivity and Case-Mix Adjustment
    • Operational Changes and Causal Evaluation
    • Turning Process Findings into Testable Improvement Proposals
  9. 54Geospatial Analytics11 topics
    • Coordinates, Geometries, and Spatial Data Types
    • Coordinate Reference Systems and Projections
    • Geocoding and Location Uncertainty
    • Spatial Joins and Geographic Aggregation
    • Distances, Areas, and Neighborhood Definitions
    • Spatial Autocorrelation and Dependence
    • Hotspots and Local Concentrations
    • Rates, Population Denominators, and Exposure
    • Modifiable Areal Units and Ecological Fallacies
    • Spatial Sampling and Uneven Data Coverage
    • Communicating Geographic Patterns Without Overclaiming Causes
  10. 55Text and Qualitative Data Analytics12 topics
    • Text as Unstructured Analytical Evidence
    • Document Units and Corpus Construction
    • Text Cleaning and Language Identification
    • Word, Phrase, and Document Frequency Summaries
    • Search Terms, Dictionaries, and Coding Rules
    • Human Coding and Annotation Guidelines
    • Inter-Rater Agreement and Label Quality
    • Sentiment Measures and Contextual Limitations
    • Topic Summaries and Independent Validation
    • Linking Qualitative Themes to Quantitative Records
    • Representative Quotations and Selective Evidence Risk
    • Evaluating Automated Text Outputs Against Human Review
  11. 56Graph and Network Analytics11 topics
    • Nodes, Edges, and Relationship Definitions
    • Directed, Undirected, and Weighted Networks
    • Bipartite and Multilayer Data Structures
    • Degree, Connectivity, and Component Structure
    • Centrality Measures and Their Interpretation
    • Communities and Group Structure
    • Paths, Reachability, and Network Distance
    • Temporal Networks and Relationship Change
    • Sampling Bias and Missing Edges
    • Distinguishing Network Association from Social Influence
    • Visualizing Networks Without Obscuring Their Structure

Stage 6

Decisions & Delivery

From analysis to a decision

10 modules · 112 topics

  1. 57Anomaly, Change, and Metric Monitoring11 topics
    • Baseline Behavior and Expected Variation
    • Point Anomalies and Contextual Anomalies
    • Control Charts and Stable Process Assumptions
    • Seasonality-Aware Monitoring
    • Change Points and Structural Shifts
    • Threshold Selection and Alert Burden
    • Base Rates and False Alarm Interpretation
    • Multiple Metrics and Repeated Monitoring
    • Decomposing an Unexpected Metric Movement
    • Distinguishing Data Failures from Business Changes
    • Confirming a Signal Before Recommending Action
  2. 58Simulation and Scenario Analysis11 topics
    • Defining a System and Its Decision Variables
    • Deterministic and Stochastic Scenarios
    • Monte Carlo Simulation of Uncertain Outcomes
    • Choosing Distributions for Uncertain Inputs
    • Correlated Inputs and Joint Scenarios
    • Discrete-Event Simulation Concepts
    • Queueing and Capacity Simulation
    • Sensitivity Analysis and Dominant Assumptions
    • Stress Scenarios and Tail Outcomes
    • Calibration and Validation Against Observed Behavior
    • Reporting Simulation Uncertainty and Model Limitations
  3. 59Optimization and Prescriptive Analytics11 topics
    • Decision Variables, Objectives, and Constraints
    • Linear Programming Formulations
    • Integer and Mixed-Integer Decision Models
    • Resource Allocation and Scheduling Problems
    • Assignment, Routing, and Network Flow Concepts
    • Constraint Feasibility and Conflicting Requirements
    • Sensitivity, Shadow Prices, and Marginal Value
    • Multiple Objectives and Pareto Tradeoffs
    • Stochastic and Robust Optimization Concepts
    • Validating Optimized Decisions Under Real-World Conditions
    • Recognizing When Model Assumptions Dominate the Recommendation
  4. 60Decision Analysis and Value of Information11 topics
    • Decisions, States of the World, and Consequences
    • Expected Value and Expected Utility
    • Decision Trees and Probabilistic Outcomes
    • Asymmetric Costs and Decision Thresholds
    • Risk Preferences and Downside Constraints
    • Regret and Robust Decision Alternatives
    • Value of Perfect and Partial Information
    • Whether Additional Data Are Worth Collecting
    • Combining Causal Effects with Costs and Constraints
    • Sensitivity of the Preferred Decision to Assumptions
    • Communicating a Recommendation Under Uncertainty
  5. 61Business Intelligence and Dashboard Design12 topics
    • Executive, Analytical, and Operational Dashboards
    • Audience Needs and Decision Frequency
    • Metric Hierarchies and Information Priorities
    • Consistent Definitions Across Reports
    • Filters, Drill-Downs, and Interaction Design
    • Time Comparisons and Reference Periods
    • Alerts, Exceptions, and Actionable Views
    • Displaying Uncertainty and Data Freshness
    • Avoiding Misleading Cross-Filter Calculations
    • Dashboard Performance and Usability
    • Testing Whether a Dashboard Supports Its Intended Decisions
    • Retirement of Unused and Redundant Reports
  6. 62Analytical Communication and Data Storytelling12 topics
    • Leading with the Question and Main Finding
    • Separating Evidence, Interpretation, and Recommendation
    • Structuring an Analytical Narrative
    • Choosing the Right Level of Technical Detail
    • Explaining Effect Sizes in Familiar Units
    • Presenting Uncertainty and Alternative Explanations
    • Communicating Null and Inconclusive Results
    • Avoiding Causal Language for Associational Findings
    • Executive Summaries and Decision Memos
    • Technical Appendices and Reproducible Evidence
    • Responding to Challenges and Revising Conclusions
    • Visual and Verbal Consistency Across Deliverables
  7. 63Efficient Analytics at Scale11 topics
    • Memory, Compute, Storage, and Data Movement Costs
    • Columnar Data and Selective Reading
    • Partitioning and Predicate Pushdown
    • Query Optimization for Analytical Workloads
    • Join Strategy, Data Skew, and Intermediate Result Size
    • Chunked and Out-of-Core Processing
    • Vectorization and Avoiding Unnecessary Recalculation
    • Sampling and Approximate Aggregation
    • Accuracy-Cost Tradeoffs in Approximate Results
    • Distributed Processing Semantics Relevant to Analysts
    • Validating That Faster Computation Preserves the Intended Result
  8. 64Data Governance and Responsible Access11 topics
    • Data Ownership, Stewardship, and Accountability
    • Catalogs, Dictionaries, and Business Definitions
    • Data Provenance, Licensing, and Reuse Conditions
    • Access According to Analytical Need
    • Sensitive Attributes and Data Minimization
    • Pseudonymization and Reidentification Risk
    • Privacy-Preserving Aggregation and Disclosure Risk
    • Retention, Deletion, and Reproducibility Tensions
    • Sharing Data, Code, and Results Responsibly
    • Documenting Approved Uses and Known Limitations
    • Coordinating Analysis with Privacy and Security Requirements
  9. 65Fairness, Ethics, and Societal Impact11 topics
    • Representation and Historical Bias in Data
    • Measurement Bias and Unequal Error
    • Proxy Variables and Sensitive Characteristics
    • Subgroup Evaluation and Small-Sample Uncertainty
    • Competing Fairness Definitions and Decision Context
    • Feedback Loops Created by Analytical Decisions
    • Who Benefits and Who Bears the Costs
    • Consent, Expectations, and Appropriate Data Use
    • Human Oversight and Contestability
    • Ethical Review of High-Impact Analyses
    • Communicating Limitations Without Overstating Objectivity
  10. 66Analytics Delivery, Monitoring, and Maintenance11 topics
    • Delivering Reusable Datasets, Reports, and Analytical Models
    • Ownership and Handoff Documentation
    • Scheduled Refreshes and Data Dependency Management
    • Versioned Logic and Historical Result Reproducibility
    • Acceptance Checks Before Publishing Results
    • Monitoring Freshness, Completeness, and Metric Behavior
    • Investigating Failed Refreshes and Inconsistent Outputs
    • Upstream Changes and Analytical Drift
    • Revising Models and Metrics with Controlled Comparisons
    • Communicating Corrections to Published Findings
    • Retiring Analyses That No Longer Support Valid Decisions

Stage 7

Practicum & Capstone

One decision, argued with data

5 modules · 52 topics

  1. 67Data Preparation and SQL Practicum10 topics
    • Turning an Ambiguous Request into a Dataset Specification
    • Profiling and Cleaning a Messy Multisource Dataset
    • Resolving Identifier and Join Cardinality Problems
    • Building an Analytical Table at the Correct Grain
    • Implementing Event Windows and Historical State Logic
    • Creating Cohort, Funnel, and Retention Queries
    • Reconciling Metrics Across Independent Calculations
    • Investigating Missing Data and Measurement Gaps
    • Documenting Data Lineage and Quality Limitations
    • Delivering a Reproducible Preparation Workflow
  2. 68Statistical Inference and Modeling Practicum10 topics
    • Describing a Distribution Without Hiding Important Variation
    • Designing a Sample and Assessing Representation
    • Estimating an Effect with Appropriate Uncertainty
    • Comparing Parametric and Resampling-Based Results
    • Interpreting Multiple Tests Without Selective Reporting
    • Fitting and Critiquing a Regression Model
    • Analyzing a Binary or Count Outcome
    • Evaluating Repeated or Clustered Observations
    • Comparing Predictive Performance on Appropriate Held-Out Data
    • Writing a Statistical Findings Memo with Explicit Assumptions
  3. 69Experimentation and Causal Analysis Practicum10 topics
    • Defining a Causal Question and Drawing Its Assumptions
    • Planning an Experiment with Decision-Relevant Power
    • Auditing Assignment, Exposure, and Outcome Measurement
    • Diagnosing Sample Ratio Mismatch and Attrition
    • Analyzing an A/B Test with Primary and Guardrail Metrics
    • Evaluating the Credibility of a Subgroup Effect
    • Assessing Covariate Balance in an Observational Study
    • Critiquing a Difference-in-Differences or Discontinuity Design
    • Conducting Sensitivity Analysis for a Causal Claim
    • Preparing an Experiment Readout and Decision Recommendation
  4. 70Forecasting and Decision Analytics Practicum10 topics
    • Preparing a Time Series with Calendar and Missing-Period Checks
    • Establishing Naive and Seasonal Forecast Baselines
    • Comparing Forecasts Through Rolling-Origin Evaluation
    • Assessing Prediction Intervals and Tail Risk
    • Reconciling Forecasts Across Related Business Units
    • Diagnosing Retention and Revenue Changes by Cohort
    • Simulating an Operational Decision Under Uncertainty
    • Formulating a Constrained Resource Allocation Problem
    • Evaluating Whether More Information Would Change the Decision
    • Presenting a Recommendation with Sensitivity to Key Assumptions
  5. 71Integrated Data Science and Analytics Capstone12 topics
    • Selecting a Decision and Defining an Answerable Question
    • Specifying the Population, Unit, Time Horizon, and Estimand
    • Auditing Data Sources and Measurement Processes
    • Building and Validating an Analytical Dataset
    • Exploring Patterns and Recording Competing Explanations
    • Choosing Methods Appropriate to the Question and Data
    • Quantifying Uncertainty and Testing Robustness
    • Distinguishing Descriptive, Predictive, and Causal Conclusions
    • Evaluating Practical Value, Fairness, and Decision Consequences
    • Delivering a Clear Report or Decision-Support Dashboard
    • Providing Reproducible Code, Documentation, and Review Evidence
    • Defining Follow-Up Measurement and Maintenance Needs

Fifteen minutes.Every day.

  1. 1

    A lesson fits a lunch break

    One idea at a time, in short slides. A whole lesson takes about fifteen minutes.

  2. 2

    Practice with instant feedback

    Questions sit inside the lesson. Answer one and see right away whether you got it.

  3. 3

    A streak that brings you back

    A lesson a day keeps the streak alive. Small, steady sessions carry you through.

For anyone who owns a number.

Where this course leads.

The job this course is built around, and how people get into it.

Data Analyst

Turns a company's data into answers people can act on, and grows into building models.

All future careers

On the job

  • Write the query that answers this week's question
  • Build a dashboard leadership actually reads
  • Design an experiment and read its result correctly

How people get in

Many start as analysts with SQL, spreadsheets and a statistics basis; data scientist roles usually ask for a quantitative degree.

Be first in line.

Early access for individuals, pilots for teams. Tell us who's learning.

enterprise@astratrainer.com