Astra Trainer

Bientôt disponible

Data Science & Analytics

Trouvez la réponse dans des données désordonnées, et prouvez-la.

Le cours complet

modules
71
thèmes
818
min par leçon
15

#1

Les employeurs classent l'IA et le big data en tête des compétences à la croissance la plus rapide d'ici 2030.

WEF Future of Jobs Report 2025

Chaque module.Chaque thème.

Les titres des modules et des thèmes restent en anglais, la langue du secteur.

Étapes

Étape 1

Foundations & Data Wrangling

Des données désordonnées, rendues fiables

15 modules · 175 thèmes

  1. 1Foundations of Data Science and Analytics10 thèmes
    • Data Science, Analytics, and Business Intelligence
    • Descriptive, Diagnostic, Predictive, and Prescriptive Questions
    • Statistical Inference and Causal Inference
    • Data as Evidence About a Larger Process
    • From Raw Observations to Decisions
    • The Analytical Project Lifecycle
    • Domain Knowledge and Analytical Judgment
    • Roles of Analysts, Data Scientists, and Data Engineers
    • Reproducibility, Transparency, and Responsible Interpretation
    • Recognizing What Available Data Cannot Answer
  2. 2Analytical Problem Framing11 thèmes
    • Translating a Business Question into an Analytical Question
    • Defining the Decision an Analysis Will Inform
    • Units of Observation and Units of Analysis
    • Target Populations and Relevant Time Horizons
    • Outcomes, Exposures, Treatments, and Covariates
    • Estimands and Precisely Defined Quantities of Interest
    • Hypotheses, Assumptions, and Competing Explanations
    • Baselines, Comparators, and Success Criteria
    • Data Availability and Feasibility Assessment
    • Stakeholder Alignment and Scope Boundaries
    • Choosing an Analytical Deliverable for the Decision
  3. 3Measurement and Data-Generating Processes12 thèmes
    • How Data Are Created, Recorded, and Selected
    • Constructs, Proxies, and Operational Definitions
    • Nominal, Ordinal, Interval, and Ratio Scales
    • Continuous, Discrete, Binary, and Count Variables
    • Measurement Validity and Reliability
    • Measurement Error and Instrument Limitations
    • Observation Windows and Exposure Time
    • Units, Denominators, and Population at Risk
    • Selection Mechanisms and Unobserved Cases
    • Administrative Data and Designed Research Data
    • Changes in Measurement Across Time and Groups
    • Distinguishing Real-World Change from Recording Change
  4. 4Quantitative Foundations for Data Analysis12 thèmes
    • Ratios, Rates, Proportions, and Percentages
    • Percentage Change and Percentage-Point Change
    • Weighted Averages and Aggregation Rules
    • Logarithms, Exponentials, and Growth Rates
    • Functions and Transformations of Variables
    • Vectors, Matrices, and Tabular Representations
    • Dot Products and Linear Combinations
    • Derivatives as Rates of Change
    • Optimization Objectives and Loss Functions
    • Numerical Precision and Rounding Effects
    • Dimensional Consistency and Unit Conversion
    • Order-of-Magnitude Checks and Plausibility Tests
  5. 5Spreadsheet Analytics and Analytical Prototyping12 thèmes
    • Structured Tables and Consistent Column Types
    • Relative, Absolute, and Structured References
    • Conditional Aggregation and Lookup Functions
    • Pivot Tables and Grouped Summaries
    • Array Calculations and Reusable Formulas
    • Dates, Number Formats, and Hidden Type Errors
    • Formula Auditing and Error Propagation
    • Data Validation and Protected Input Areas
    • Scenario Tables and What-If Models
    • Reconciling Spreadsheet Totals with Source Records
    • Documenting Manual Steps and Workbook Assumptions
    • Choosing Between Spreadsheet, SQL, and Code-Based Workflows
  6. 6Analytical Programming with Python and R13 thèmes
    • Notebooks, Scripts, and Interactive Analysis
    • Variables, Data Types, and Collections
    • Arrays, Series, Data Frames, and Tables
    • NumPy, pandas, and R Data Analysis Workflows
    • Indexing, Filtering, and Boolean Logic
    • Vectorized Operations and Elementwise Calculations
    • Functions for Reusable Analytical Steps
    • Iteration and Simulation Workflows
    • Dates, Strings, and Categorical Data
    • Missing Values and Type Conversion
    • Reading Errors and Debugging Analytical Code
    • Assertions and Checks on Intermediate Results
    • Choosing and Documenting an Analysis Environment
  7. 7Tabular Data Transformation12 thèmes
    • Tidy Data and Consistent Table Structure
    • Selecting, Renaming, and Reordering Columns
    • Filtering Records and Deriving Variables
    • Grouping and Aggregating Observations
    • Reshaping Between Wide and Long Formats
    • Joining Tables and Matching Keys
    • Join Cardinality and Row Multiplication
    • Concatenation, Unions, and Schema Alignment
    • Sorting, Ranking, and Within-Group Operations
    • Text Parsing and Structured Field Extraction
    • Time-Based and Nearest-Match Joins
    • Validating Transformations with Reconciliation Checks
  8. 8SQL Foundations for Analytics11 thèmes
    • Tables, Rows, Columns, and Relational Keys
    • SELECT, WHERE, and ORDER BY
    • Expressions, CASE Statements, and Derived Fields
    • NULL Values and Three-Valued Logic
    • COUNT, SUM, AVG, and Other Aggregations
    • GROUP BY and HAVING
    • Inner, Left, Full, and Cross Joins
    • Subqueries and Common Table Expressions
    • DISTINCT, Duplicates, and Counting Units
    • Date, Time, and Interval Calculations
    • Translating an Analytical Question into a Query
  9. 9Advanced Analytical SQL14 thèmes
    • Window Functions and Partitioned Calculations
    • ROW_NUMBER, RANK, and Dense Ranking
    • LAG, LEAD, and Event Sequences
    • Running Totals and Rolling Windows
    • Window Frames and Boundary Semantics
    • Conditional Aggregation and Pivoted Summaries
    • Querying Nested and Semistructured Data
    • Recursive Queries for Hierarchical Relationships
    • Sessionization and Time-Gap Logic
    • Cohort Tables and Retention Queries
    • Funnel Steps and Ordered Event Matching
    • As-Of Logic and Historical State Reconstruction
    • Query Plans and Expensive Join Patterns
    • Verifying Complex Queries Against Small Known Examples
  10. 10Data Acquisition and Integration12 thèmes
    • Files, Databases, APIs, and Event Streams as Data Sources
    • CSV, Spreadsheet, JSON, and Columnar Data Formats
    • Encodings, Delimiters, and Schema Detection
    • API Pagination, Rate Limits, and Incremental Retrieval
    • Public Data Portals and Source Documentation
    • Permission, Licensing, and Appropriate Data Reuse
    • Identifiers and Cross-Source Record Matching
    • Entity Resolution and Ambiguous Matches
    • Timestamp Alignment and Timezone Conversion
    • Source Reconciliation and Conflicting Values
    • Preserving Raw Inputs and Acquisition Metadata
    • Assessing Coverage Before Combining Datasets
  11. 11Analytical Data Modeling11 thèmes
    • Transactional and Analytical Data Structures
    • Table Grain and the Meaning of One Row
    • Fact Tables and Dimension Tables
    • Star Schemas and Analytical Relationships
    • Event Facts, Snapshots, and Accumulating Records
    • Slowly Changing Dimensions and Historical Attributes
    • Additive, Semiadditive, and Nonadditive Measures
    • Many-to-Many Relationships and Bridge Tables
    • Semantic Layers and Shared Metric Definitions
    • Derived Tables and Reusable Analytical Datasets
    • Preventing Double Counting Across Data Models
  12. 12Data Cleaning and Standardization11 thèmes
    • Profiling Types, Ranges, and Value Frequencies
    • Parsing Numbers, Dates, and Structured Strings
    • Standardizing Units, Categories, and Labels
    • Duplicate Records and Duplicate Entities
    • Impossible Values and Logical Contradictions
    • Outliers, Rare Events, and Data Entry Errors
    • Text Normalization and Identifier Cleanup
    • Resolving Conflicting Records
    • Handling Truncated, Rounded, and Censored Measurements
    • Documenting Cleaning Decisions and Their Consequences
    • Comparing Results Before and After Cleaning
  13. 13Missing Data and Measurement Error11 thèmes
    • Missing Completely at Random, at Random, and Not at Random
    • Missingness Patterns and Plausible Mechanisms
    • Complete-Case Analysis and Its Assumptions
    • Simple Imputation and Distorted Uncertainty
    • Multiple Imputation Principles
    • Missingness Indicators and Their Interpretation
    • Attrition, Dropout, and Lost Follow-Up
    • Measurement Error in Outcomes and Predictors
    • Misclassification of Categorical Variables
    • Sensitivity Analysis for Unobserved Values
    • Distinguishing Absence of an Event from Absence of a Record
  14. 14Data Quality and Lineage11 thèmes
    • Accuracy, Completeness, Consistency, and Timeliness
    • Uniqueness, Validity, and Referential Integrity
    • Data Contracts and Expected Schemas
    • Field-Level and Dataset-Level Quality Checks
    • Freshness, Volume, and Distribution Monitoring
    • Reconciliation with Source Systems
    • Lineage from Raw Data to Published Metrics
    • Quality Ownership and Issue Escalation
    • Schema Changes and Broken Assumptions
    • Quantifying the Analytical Impact of Quality Problems
    • Recording Known Limitations in Dataset Documentation
  15. 15Reproducible Analytical Workflows12 thèmes
    • Organizing Data, Code, Outputs, and Documentation
    • Separating Raw, Intermediate, and Final Datasets
    • Version Control for Analytical Work
    • Environment and Dependency Reproducibility
    • Random Seeds and Sources of Nondeterminism
    • Parameterized Analyses and Repeatable Reports
    • Executable Notebooks and Hidden State
    • Lightweight Tests for Analytical Assumptions
    • Peer Review of Queries, Code, and Conclusions
    • Verifying AI-Assisted Code and Statistical Suggestions
    • Recording Decisions, Exclusions, and Deviations
    • Reproducing an Analysis from Its Documented Inputs

Étape 2

Statistics & Inference

Ce que les chiffres peuvent dire, et ne peuvent pas

13 modules · 151 thèmes

  1. 16Descriptive Statistics12 thèmes
    • Counts, Frequencies, and Relative Frequencies
    • Means, Medians, Modes, and Trimmed Means
    • Variance, Standard Deviation, and Interquartile Range
    • Quantiles, Percentiles, and Distribution Tails
    • Skewness, Heavy Tails, and Multimodality
    • Weighted Descriptive Statistics
    • Rates with Unequal Exposure or Population Size
    • Covariance and Correlation
    • Cross-Tabulations and Conditional Summaries
    • Aggregation Bias and Simpson's Paradox
    • Robust Summaries for Skewed and Contaminated Data
    • Choosing Summaries That Match the Analytical Question
  2. 17Exploratory Data Analysis11 thèmes
    • Establishing Dataset Structure and Coverage
    • Exploring Individual Variable Distributions
    • Examining Relationships Between Variables
    • Comparing Groups and Subpopulations
    • Detecting Anomalies and Unexpected Patterns
    • Investigating Temporal and Spatial Variation
    • Exploring Missingness and Data Collection Artifacts
    • Testing Initial Explanations Against Alternative Views
    • Separating Exploration from Confirmation
    • Recording Hypotheses Generated During Exploration
    • Identifying the Next Data or Analysis Needed
  3. 18Data Visualization Principles12 thèmes
    • Matching Chart Types to Analytical Tasks
    • Visual Encodings and Perceptual Accuracy
    • Distributions, Comparisons, Relationships, and Trends
    • Scales, Axes, Baselines, and Transformations
    • Small Multiples and Consistent Comparisons
    • Visualizing Uncertainty and Sample Size
    • Overplotting, Binning, and Density Displays
    • Color, Contrast, and Accessible Design
    • Annotations and Contextual Reference Lines
    • Interactive Filtering and Linked Views
    • Recognizing Misleading and Overdecorated Charts
    • Choosing Tables When Exact Values Matter
  4. 19Probability and Conditional Reasoning11 thèmes
    • Events, Sample Spaces, and Probability Rules
    • Conditional Probability and Independence
    • Joint and Marginal Probabilities
    • Bayes' Theorem and Updating Beliefs
    • Base Rates and Inverse Probability Errors
    • Independence and Conditional Independence
    • Counting Rules and Combinatorial Reasoning
    • Expected Value and Long-Run Averages
    • Law of Total Probability and Total Expectation
    • Translating Verbal Uncertainty into Probability Models
    • Simulating Probability Problems to Check Intuition
  5. 20Random Variables and Probability Models12 thèmes
    • Discrete and Continuous Random Variables
    • Probability Mass, Density, and Cumulative Distribution Functions
    • Expectation, Variance, and Covariance
    • Bernoulli and Binomial Models
    • Poisson and Count Models
    • Normal and Lognormal Models
    • Exponential and Waiting-Time Models
    • Heavy-Tailed and Mixture Distributions
    • Joint Distributions and Dependence
    • Transformations of Random Variables
    • Laws of Large Numbers and the Central Limit Theorem
    • Matching Distributional Assumptions to Observed Data
  6. 21Sampling and Study Design12 thèmes
    • Populations, Sampling Frames, and Samples
    • Probability and Nonprobability Sampling
    • Simple Random and Systematic Sampling
    • Stratified and Cluster Sampling
    • Multistage Sampling Designs
    • Convenience Samples and Coverage Bias
    • Selection Bias and Survivorship Bias
    • Cross-Sectional, Longitudinal, and Repeated Cross-Sectional Studies
    • Independent Observations and Clustered Observations
    • Sampling Error and Nonsampling Error
    • Generalizability and Target Population Alignment
    • Designing Data Collection Around the Intended Inference
  7. 22Survey Analytics and Weighting11 thèmes
    • Questionnaire Design and Measurement Consistency
    • Question Wording, Ordering, and Response Options
    • Response Bias and Social Desirability
    • Unit Nonresponse and Item Nonresponse
    • Sampling Weights and Unequal Selection Probabilities
    • Nonresponse Adjustments and Calibration
    • Poststratification and Raking
    • Design Effects and Effective Sample Size
    • Weighted Estimation and Uncertainty
    • Comparing Survey Responses with Behavioral Records
    • Reporting Representation and Remaining Bias
  8. 23Estimation and Uncertainty11 thèmes
    • Parameters, Estimators, and Estimates
    • Bias, Variance, and Mean Squared Error
    • Sampling Distributions and Standard Errors
    • Point Estimates and Interval Estimates
    • Confidence Intervals and Their Interpretation
    • Estimation for Means, Proportions, Rates, and Differences
    • Maximum Likelihood as an Estimation Framework
    • Uncertainty in Ratios and Nonlinear Quantities
    • Prediction Intervals and Confidence Intervals
    • Finite-Sample and Asymptotic Reasoning
    • Communicating Uncertainty Without Hiding the Main Result
  9. 24Resampling and Computational Inference11 thèmes
    • Simulation as a Tool for Statistical Reasoning
    • Bootstrap Resampling and Sampling Variability
    • Bootstrap Confidence Intervals
    • Permutation Tests and Exchangeability
    • Randomization Tests and Assignment Mechanisms
    • Resampling Paired and Clustered Observations
    • Block Resampling for Dependent Temporal Data
    • Monte Carlo Error and Simulation Precision
    • Parametric and Nonparametric Resampling
    • Situations Where Naive Resampling Fails
    • Checking Analytical Results with Computational Experiments
  10. 25Hypothesis Testing14 thèmes
    • Null and Alternative Hypotheses
    • Test Statistics and Reference Distributions
    • P-Values and Their Interpretation Limits
    • Type I and Type II Errors
    • One-Sided and Two-Sided Tests
    • Tests for Means, Proportions, and Group Differences
    • Paired and Independent-Sample Comparisons
    • Analysis of Variance and Planned Contrasts
    • Contingency Tables and Categorical Association Tests
    • Small-Sample and Exact Tests
    • Rank-Based and Distribution-Free Methods
    • Statistical Significance and Practical Importance
    • Equivalence and Noninferiority Questions
    • Reporting Effect Sizes Alongside Test Results
  11. 26Statistical Power and Sample Size Planning10 thèmes
    • Power as a Property of a Specified Study Design
    • Minimum Detectable Effects and Decision-Relevant Effects
    • Baseline Rates and Outcome Variability
    • Sample Size for Means, Proportions, and Differences
    • Allocation Ratios and Unequal Group Sizes
    • Clustering and Repeated Measurements in Power Calculations
    • Attrition and Incomplete Outcome Observation
    • Duration Planning for Seasonal or Delayed Outcomes
    • Simulation-Based Power Analysis
    • Interpreting Inconclusive Results Without Post Hoc Power Claims
  12. 27Multiple Testing and Reliable Statistical Evidence12 thèmes
    • Families of Hypotheses and Multiplicity
    • Family-Wise Error and False Discovery Rate
    • Adjustment Methods and Their Assumptions
    • Exploratory and Confirmatory Analysis Plans
    • Selective Reporting and Researcher Degrees of Freedom
    • P-Hacking and Repeated Unplanned Analyses
    • Winner's Curse and Effect Size Inflation
    • Replication and Independent Confirmation
    • Sensitivity to Analytical Choices
    • Multiverse and Specification-Curve Reasoning
    • Preregistration and Transparent Deviations
    • Evaluating Evidence Beyond a Significance Threshold
  13. 28Bayesian Analysis12 thèmes
    • Prior, Likelihood, and Posterior Distributions
    • Bayesian Updating for Simple Data Models
    • Weakly Informative and Domain-Informed Priors
    • Prior Predictive Checks
    • Posterior Summaries and Credible Intervals
    • Posterior Predictive Distributions
    • Bayesian Estimation of Rates and Group Differences
    • Hierarchical Priors and Shrinkage
    • Computational Posterior Approximation
    • Convergence and Effective Sample Size Concepts
    • Prior Sensitivity and Model Criticism
    • Posterior Probabilities in Decision Contexts

Étape 3

Modeling & Forecasting

Des modèles qui expliquent et prédisent

10 modules · 118 thèmes

  1. 29Linear Regression and Explanatory Models12 thèmes
    • Simple and Multiple Linear Regression
    • Least Squares and Fitted Relationships
    • Coefficient Interpretation and Measurement Units
    • Categorical Predictors and Reference Groups
    • Interactions and Conditional Associations
    • Transformations of Outcomes and Predictors
    • Residual Variation and Explained Variation
    • Standard Errors and Coefficient Intervals
    • Conditional Mean and Exogeneity Assumptions
    • Association, Adjustment, and Causal Interpretation
    • Prediction for New Observations
    • Communicating Regression Results in Practical Terms
  2. 30Generalized Linear Models12 thèmes
    • Outcome Distributions and Link Functions
    • Logistic Regression for Binary Outcomes
    • Odds, Odds Ratios, and Predicted Probabilities
    • Marginal Effects and Standardized Predictions
    • Multinomial and Ordinal Outcome Models
    • Poisson Regression for Counts
    • Offsets and Unequal Exposure
    • Overdispersion and Negative Binomial Models
    • Positive Skewed Outcomes and Gamma Models
    • Excess Zeros and Two-Part Outcome Processes
    • Likelihood-Based Estimation and Model Comparison
    • Matching the Model to the Data-Generating Process
  3. 31Regression Diagnostics and Robust Analysis12 thèmes
    • Residual Patterns and Model Misspecification
    • Heteroskedasticity and Robust Standard Errors
    • Multicollinearity and Unstable Coefficients
    • Leverage, Influence, and Unusual Observations
    • Nonlinear Relationships and Flexible Functional Forms
    • Splines and Generalized Additive Model Concepts
    • Robust Regression and Sensitivity to Outliers
    • Quantile Regression and Distributional Effects
    • Regularization as a Tool for Stability
    • Model Selection and Post-Selection Uncertainty
    • Extrapolation and Unsupported Predictions
    • Comparing Conclusions Across Reasonable Model Specifications
  4. 32Hierarchical, Longitudinal, and Panel Data11 thèmes
    • Repeated Observations and Within-Unit Dependence
    • Nested and Crossed Data Structures
    • Fixed Effects and Unit-Specific Baselines
    • Random Intercepts and Random Slopes
    • Partial Pooling Across Groups
    • Within-Group and Between-Group Associations
    • Cluster-Robust Inference
    • Generalized Estimating Equation Concepts
    • Time-Varying Covariates and Dynamic Outcomes
    • Unequal Follow-Up and Unbalanced Panels
    • Choosing Models for Conditional and Population-Average Questions
  5. 33Predictive Analytics and Model Validation13 thèmes
    • Prediction Targets and Decision Context
    • Baseline Models and Benchmark Performance
    • Training, Validation, and Test Data Roles
    • Cross-Validation and Appropriate Data Splits
    • Group-Based and Time-Based Validation
    • Target Leakage and Information Available at Prediction Time
    • Regression Error Metrics and Asymmetric Costs
    • Classification Metrics and Class Imbalance
    • Probability Calibration and Decision Thresholds
    • Performance Variation Across Subpopulations
    • Predictive Uncertainty and Distribution Shift
    • Explaining Predictions Without Inferring Causation
    • Comparing Model Utility with a Simple Decision Baseline
  6. 34Multivariate Analysis and Data Segmentation11 thèmes
    • Correlation Structure Across Multiple Variables
    • Standardization and Scale-Sensitive Comparisons
    • Principal Components as Low-Dimensional Summaries
    • Explained Variance and Component Interpretation
    • Factor Analysis and Latent Construct Assumptions
    • Distances and Similarity Measures
    • Clustering as an Exploratory Summary
    • Choosing and Evaluating Segment Granularity
    • Cluster Stability and Sensitivity to Preprocessing
    • Profiling Segments with Independent Variables
    • Distinguishing Discovered Groups from Natural Categories
  7. 35Time-Series Data and Temporal Structure11 thèmes
    • Time Indexes, Frequencies, and Observation Intervals
    • Trends, Seasonality, Cycles, and Irregular Variation
    • Calendar Effects and Timezone Boundaries
    • Autocorrelation and Partial Autocorrelation
    • Stationarity and Structural Change
    • Differencing and Seasonal Adjustment
    • Decomposition of Temporal Patterns
    • Lagged Variables and Time Alignment
    • Irregular Sampling and Temporal Aggregation
    • Missing Periods and Revised Observations
    • Distinguishing Leading Indicators from Lagged Correlations
  8. 36Statistical Forecasting12 thèmes
    • Forecast Horizons and Forecasting Objectives
    • Naive, Seasonal Naive, and Drift Baselines
    • Moving Averages and Exponential Smoothing
    • Trend and Seasonal Exponential Smoothing Models
    • Autoregressive and Moving-Average Components
    • Differencing and ARIMA Models
    • Seasonal ARIMA and Repeated Temporal Patterns
    • Dynamic Regression with External Predictors
    • Predictor Availability at the Forecast Origin
    • Prediction Intervals and Forecast Distributions
    • Combining Forecasts and Incorporating Structured Judgment
    • Handling Structural Breaks and Regime Changes
  9. 37Forecast Evaluation and Demand Planning12 thèmes
    • Rolling-Origin and Expanding-Window Evaluation
    • Horizon-Specific Forecast Accuracy
    • MAE, RMSE, and Scaled Error Measures
    • Percentage Error Metrics and Zero-Value Problems
    • Forecast Bias and Systematic Underprediction
    • Interval Coverage and Probabilistic Forecast Evaluation
    • Hierarchical and Grouped Forecast Reconciliation
    • Intermittent Demand and Sparse Outcomes
    • Demand Censoring and Stockout Distortion
    • Scenario Forecasts and Conditional Assumptions
    • Forecasts, Targets, and Capacity Constraints
    • Translating Forecast Error into Decision Consequences
  10. 38Survival and Event-History Analysis12 thèmes
    • Time-to-Event Outcomes and Observation Windows
    • Right, Left, and Interval Censoring
    • Truncation and Delayed Entry
    • Survival, Hazard, and Cumulative Hazard Functions
    • Kaplan-Meier Estimation
    • Comparing Survival Curves
    • Cox Proportional Hazards Models
    • Proportional Hazards Assumptions and Diagnostics
    • Accelerated Failure Time Models
    • Competing Risks and Cumulative Incidence
    • Restricted Mean Survival Time
    • Event Recurrence and Time-Varying Exposures

Étape 4

Causality & Experiments

La cause, pas seulement la corrélation

7 modules · 82 thèmes

  1. 39Foundations of Causal Inference12 thèmes
    • Counterfactual Questions and Potential Outcomes
    • Average and Conditional Treatment Effects
    • Consistency and Well-Defined Interventions
    • Exchangeability and Confounding
    • Positivity and Treatment Overlap
    • Causal Diagrams and Directed Acyclic Graphs
    • Confounders, Mediators, and Colliders
    • Backdoor Paths and Adjustment Sets
    • Selection Bias and Conditioning on Post-Treatment Variables
    • Identification Versus Estimation
    • Interference and Spillover Effects
    • Generalization and Transport to New Populations
  2. 40Causal Inference from Observational Data12 thèmes
    • Emulating a Target Trial with Observational Records
    • Defining Eligibility, Treatment, Follow-Up, and Outcomes
    • Outcome Regression and Standardization
    • Propensity Scores and Their Interpretation
    • Matching and Covariate Balance
    • Inverse Probability Weighting
    • Extreme Weights and Limited Overlap
    • Doubly Robust Estimation Concepts
    • Time-Varying Treatments and Confounding
    • Negative Controls and Falsification Checks
    • Sensitivity to Unmeasured Confounding
    • Reporting Assumptions That Data Alone Cannot Verify
  3. 41Natural Experiments and Identification Strategies11 thèmes
    • Natural Experiments and Plausibly Exogenous Variation
    • Instrumental Variables and the Assignment Mechanism
    • Relevance, Independence, and Exclusion Restrictions
    • Local Average Treatment Effects and Monotonicity
    • Weak Instruments and Unstable Estimates
    • Regression Discontinuity Around Assignment Thresholds
    • Sharp and Fuzzy Discontinuity Designs
    • Bandwidth Selection and Local Comparisons
    • Manipulation, Sorting, and Continuity Checks
    • Placebo Thresholds and Alternative Explanations
    • Limits of Generalizing Local Causal Effects
  4. 42Panel Data Methods for Causal Analysis11 thèmes
    • Before-After Comparisons and Their Limitations
    • Difference-in-Differences Design
    • Parallel Trends and the Untreated Counterfactual
    • Event Studies and Dynamic Treatment Effects
    • Anticipation and Treatment Timing
    • Staggered Adoption and Heterogeneous Effects
    • Serial Correlation and Appropriate Inference
    • Synthetic Control Design and Donor Selection
    • Pre-Treatment Fit and Placebo Comparisons
    • Interrupted Time Series and Concurrent Changes
    • Sensitivity to Comparison Groups and Time Windows
  5. 43Randomized Experimental Design12 thèmes
    • Random Assignment and Causal Identification
    • Experimental Units and Analysis Units
    • Control Groups and Treatment Conditions
    • Blocking, Stratification, and Matched Designs
    • Allocation Concealment and Blinding Concepts
    • Primary Outcomes and Predefined Analysis Plans
    • Noncompliance and Intention-to-Treat Effects
    • Attrition and Missing Outcomes in Experiments
    • Balance Checks and Interpretation Limits
    • Experiment Duration and Delayed Effects
    • Ethical Constraints and Participant Impacts
    • Connecting Experimental Results to the Target Decision
  6. 44Online Controlled Experiments12 thèmes
    • A/B Testing in Digital Products
    • Eligibility, Assignment, Exposure, and Analysis Populations
    • Stable Assignment and Cross-Device Identity
    • A/A Tests and Instrumentation Validation
    • Sample Ratio Mismatch and Allocation Failures
    • Primary Metrics, Guardrails, and Diagnostic Metrics
    • Triggered Analyses and Exposure Bias
    • Novelty, Learning, and Carryover Effects
    • Bots, Internal Users, and Invalid Traffic
    • Attribution Windows and Delayed Outcomes
    • Experiment Interactions and Concurrent Changes
    • Interpreting and Communicating a Product Experiment
  7. 45Advanced Experimentation and Treatment Heterogeneity12 thèmes
    • Factorial Designs and Interaction Effects
    • Multivariant Experiments and Comparison Families
    • Cluster Randomization and Group-Level Outcomes
    • Switchback Designs and Time-Based Assignment
    • Network Effects and Interference-Aware Experiments
    • Sequential Testing and Planned Monitoring
    • Alpha Spending and Repeated-Look Error Control
    • Bayesian Monitoring and Decision Rules
    • CUPED and Pre-Experiment Covariate Adjustment
    • Heterogeneous Treatment Effects and Subgroup Credibility
    • Adaptive Allocation and Inference Tradeoffs
    • Long-Term Holdouts and Persistent Effects

Étape 5

Product & Business Analytics

Les chiffres qui font tourner une entreprise

11 modules · 128 thèmes

  1. 46Metric Design and Metric Systems12 thèmes
    • Business Objectives and Operational Metrics
    • North Star Metrics and Supporting Measures
    • Metric Trees and Driver Decomposition
    • Leading, Lagging, and Guardrail Metrics
    • Numerator, Denominator, and Eligibility Definitions
    • Users, Accounts, Sessions, Events, and Transactions
    • Ratios of Totals and Averages of Ratios
    • Aggregation Windows and Timezone Policies
    • Metric Sensitivity and Responsiveness
    • Goodhart's Law and Metric Gaming
    • Ownership, Versioning, and Metric Change Governance
    • Distinguishing a Useful Proxy from the Desired Outcome
  2. 47Event Instrumentation and Behavioral Data12 thèmes
    • Tracking Plans and Event Taxonomies
    • Event Names, Properties, and Schema Contracts
    • Client-Side and Server-Side Measurement
    • Event Time, Processing Time, and Late Arrival
    • Identity Resolution and Anonymous-to-Known Transitions
    • Deduplication, Retries, and Idempotent Event Handling
    • Session Boundaries and Activity Windows
    • Consent, Blocking, and Unobserved Behavior
    • Attribution Metadata and Source Context
    • Instrumentation QA and End-to-End Reconciliation
    • Tracking Changes Across Application Releases
    • Identifying Measurement Gaps Before Interpreting Behavior
  3. 48Product and Engagement Analytics11 thèmes
    • Acquisition, Activation, Engagement, and Value Delivery
    • Defining Meaningful Active Use
    • Feature Adoption and Depth of Use
    • Frequency, Recency, and Engagement Intensity
    • Active User Ratios and Their Limitations
    • User Journeys and Behavioral Sequences
    • Exposure Opportunity and Actual Feature Usage
    • Account-Level and User-Level Product Analysis
    • Segment Mix and Apparent Engagement Changes
    • Diagnosing Product Friction with Behavioral Evidence
    • Linking Product Metrics to User and Business Outcomes
  4. 49Funnel and Conversion Analysis11 thèmes
    • Funnel Steps and Eligible Starting Populations
    • Open and Closed Funnel Definitions
    • User-Level, Session-Level, and Event-Level Conversion
    • Ordered and Unordered Step Completion
    • Conversion Windows and Delayed Completion
    • Repeated Attempts and Deduplicated Outcomes
    • Step-Level Drop-Off and Time Between Steps
    • Segment Comparisons with Consistent Denominators
    • Cross-Device and Cross-Channel Journey Gaps
    • Separating Traffic Mix Changes from Conversion Changes
    • Testing Explanations for Funnel Bottlenecks
  5. 50Cohort, Retention, and Churn Analysis12 thèmes
    • Acquisition, Activation, and Behavioral Cohorts
    • Calendar Time and Time Since Cohort Entry
    • Fixed-Period, Rolling, and Return-Window Retention
    • Cohort Maturity and Incomplete Observation
    • Retention Curves and Retention Matrices
    • Churn Definitions and Inactivity Thresholds
    • Reactivation and Resurrected Users
    • Customer Churn and Revenue Churn
    • Survival-Based Interpretation of Retention
    • Comparing Cohorts Under Changing Product and Channel Mix
    • Leading Signals and Causal Claims About Churn
    • Long-Term Retention with Limited Follow-Up
  6. 51Customer, Revenue, and Unit Economics Analytics13 thèmes
    • Customer, Account, Subscription, and Transaction Units
    • Revenue Definitions and Recognition Timing
    • Bookings, Billings, Cash Receipts, and Reported Revenue
    • Recurring and Nonrecurring Revenue
    • Gross and Net Revenue Retention
    • Revenue per User and Revenue per Paying Customer
    • Discounts, Refunds, and Failed Payments
    • Contribution Margin and Cost Allocation Assumptions
    • Customer Acquisition Cost and Attribution Scope
    • Customer Lifetime Value and Observation Horizon
    • Payback Period and Cohort Economics
    • Discounting, Uncertainty, and Scenario-Based Value Estimates
    • Avoiding Misleading Averages Across Customer Segments
  7. 52Marketing Measurement and Incrementality12 thèmes
    • Campaign Taxonomies and Acquisition Source Definitions
    • Reach, Frequency, Response, and Conversion Metrics
    • Attribution Windows and Touchpoint Visibility
    • First-Touch, Last-Touch, and Multitouch Attribution
    • Attribution Credit and Incremental Impact
    • Selection Bias in Channel Comparisons
    • Holdout Tests and Conversion Lift Studies
    • Geographic Experiments and Market-Level Comparisons
    • Marketing Mix Modeling and Identification Limits
    • Carryover, Saturation, and Channel Interactions
    • Organic and Paid Activity Overlap
    • Evaluating Measurement Under Incomplete Tracking
  8. 53Operational and Process Analytics11 thèmes
    • Process Events, Cases, and Activity Sequences
    • Throughput, Cycle Time, and Waiting Time
    • Capacity, Utilization, and Bottlenecks
    • Queueing Concepts and Little's Law
    • Service Levels and Tail Performance
    • Demand Variability and Workload Planning
    • Process Mining and Deviations from Expected Flows
    • Rework, Error Rates, and First-Pass Outcomes
    • Resource Productivity and Case-Mix Adjustment
    • Operational Changes and Causal Evaluation
    • Turning Process Findings into Testable Improvement Proposals
  9. 54Geospatial Analytics11 thèmes
    • Coordinates, Geometries, and Spatial Data Types
    • Coordinate Reference Systems and Projections
    • Geocoding and Location Uncertainty
    • Spatial Joins and Geographic Aggregation
    • Distances, Areas, and Neighborhood Definitions
    • Spatial Autocorrelation and Dependence
    • Hotspots and Local Concentrations
    • Rates, Population Denominators, and Exposure
    • Modifiable Areal Units and Ecological Fallacies
    • Spatial Sampling and Uneven Data Coverage
    • Communicating Geographic Patterns Without Overclaiming Causes
  10. 55Text and Qualitative Data Analytics12 thèmes
    • Text as Unstructured Analytical Evidence
    • Document Units and Corpus Construction
    • Text Cleaning and Language Identification
    • Word, Phrase, and Document Frequency Summaries
    • Search Terms, Dictionaries, and Coding Rules
    • Human Coding and Annotation Guidelines
    • Inter-Rater Agreement and Label Quality
    • Sentiment Measures and Contextual Limitations
    • Topic Summaries and Independent Validation
    • Linking Qualitative Themes to Quantitative Records
    • Representative Quotations and Selective Evidence Risk
    • Evaluating Automated Text Outputs Against Human Review
  11. 56Graph and Network Analytics11 thèmes
    • Nodes, Edges, and Relationship Definitions
    • Directed, Undirected, and Weighted Networks
    • Bipartite and Multilayer Data Structures
    • Degree, Connectivity, and Component Structure
    • Centrality Measures and Their Interpretation
    • Communities and Group Structure
    • Paths, Reachability, and Network Distance
    • Temporal Networks and Relationship Change
    • Sampling Bias and Missing Edges
    • Distinguishing Network Association from Social Influence
    • Visualizing Networks Without Obscuring Their Structure

Étape 6

Decisions & Delivery

De l'analyse à la décision

10 modules · 112 thèmes

  1. 57Anomaly, Change, and Metric Monitoring11 thèmes
    • Baseline Behavior and Expected Variation
    • Point Anomalies and Contextual Anomalies
    • Control Charts and Stable Process Assumptions
    • Seasonality-Aware Monitoring
    • Change Points and Structural Shifts
    • Threshold Selection and Alert Burden
    • Base Rates and False Alarm Interpretation
    • Multiple Metrics and Repeated Monitoring
    • Decomposing an Unexpected Metric Movement
    • Distinguishing Data Failures from Business Changes
    • Confirming a Signal Before Recommending Action
  2. 58Simulation and Scenario Analysis11 thèmes
    • Defining a System and Its Decision Variables
    • Deterministic and Stochastic Scenarios
    • Monte Carlo Simulation of Uncertain Outcomes
    • Choosing Distributions for Uncertain Inputs
    • Correlated Inputs and Joint Scenarios
    • Discrete-Event Simulation Concepts
    • Queueing and Capacity Simulation
    • Sensitivity Analysis and Dominant Assumptions
    • Stress Scenarios and Tail Outcomes
    • Calibration and Validation Against Observed Behavior
    • Reporting Simulation Uncertainty and Model Limitations
  3. 59Optimization and Prescriptive Analytics11 thèmes
    • Decision Variables, Objectives, and Constraints
    • Linear Programming Formulations
    • Integer and Mixed-Integer Decision Models
    • Resource Allocation and Scheduling Problems
    • Assignment, Routing, and Network Flow Concepts
    • Constraint Feasibility and Conflicting Requirements
    • Sensitivity, Shadow Prices, and Marginal Value
    • Multiple Objectives and Pareto Tradeoffs
    • Stochastic and Robust Optimization Concepts
    • Validating Optimized Decisions Under Real-World Conditions
    • Recognizing When Model Assumptions Dominate the Recommendation
  4. 60Decision Analysis and Value of Information11 thèmes
    • Decisions, States of the World, and Consequences
    • Expected Value and Expected Utility
    • Decision Trees and Probabilistic Outcomes
    • Asymmetric Costs and Decision Thresholds
    • Risk Preferences and Downside Constraints
    • Regret and Robust Decision Alternatives
    • Value of Perfect and Partial Information
    • Whether Additional Data Are Worth Collecting
    • Combining Causal Effects with Costs and Constraints
    • Sensitivity of the Preferred Decision to Assumptions
    • Communicating a Recommendation Under Uncertainty
  5. 61Business Intelligence and Dashboard Design12 thèmes
    • Executive, Analytical, and Operational Dashboards
    • Audience Needs and Decision Frequency
    • Metric Hierarchies and Information Priorities
    • Consistent Definitions Across Reports
    • Filters, Drill-Downs, and Interaction Design
    • Time Comparisons and Reference Periods
    • Alerts, Exceptions, and Actionable Views
    • Displaying Uncertainty and Data Freshness
    • Avoiding Misleading Cross-Filter Calculations
    • Dashboard Performance and Usability
    • Testing Whether a Dashboard Supports Its Intended Decisions
    • Retirement of Unused and Redundant Reports
  6. 62Analytical Communication and Data Storytelling12 thèmes
    • Leading with the Question and Main Finding
    • Separating Evidence, Interpretation, and Recommendation
    • Structuring an Analytical Narrative
    • Choosing the Right Level of Technical Detail
    • Explaining Effect Sizes in Familiar Units
    • Presenting Uncertainty and Alternative Explanations
    • Communicating Null and Inconclusive Results
    • Avoiding Causal Language for Associational Findings
    • Executive Summaries and Decision Memos
    • Technical Appendices and Reproducible Evidence
    • Responding to Challenges and Revising Conclusions
    • Visual and Verbal Consistency Across Deliverables
  7. 63Efficient Analytics at Scale11 thèmes
    • Memory, Compute, Storage, and Data Movement Costs
    • Columnar Data and Selective Reading
    • Partitioning and Predicate Pushdown
    • Query Optimization for Analytical Workloads
    • Join Strategy, Data Skew, and Intermediate Result Size
    • Chunked and Out-of-Core Processing
    • Vectorization and Avoiding Unnecessary Recalculation
    • Sampling and Approximate Aggregation
    • Accuracy-Cost Tradeoffs in Approximate Results
    • Distributed Processing Semantics Relevant to Analysts
    • Validating That Faster Computation Preserves the Intended Result
  8. 64Data Governance and Responsible Access11 thèmes
    • Data Ownership, Stewardship, and Accountability
    • Catalogs, Dictionaries, and Business Definitions
    • Data Provenance, Licensing, and Reuse Conditions
    • Access According to Analytical Need
    • Sensitive Attributes and Data Minimization
    • Pseudonymization and Reidentification Risk
    • Privacy-Preserving Aggregation and Disclosure Risk
    • Retention, Deletion, and Reproducibility Tensions
    • Sharing Data, Code, and Results Responsibly
    • Documenting Approved Uses and Known Limitations
    • Coordinating Analysis with Privacy and Security Requirements
  9. 65Fairness, Ethics, and Societal Impact11 thèmes
    • Representation and Historical Bias in Data
    • Measurement Bias and Unequal Error
    • Proxy Variables and Sensitive Characteristics
    • Subgroup Evaluation and Small-Sample Uncertainty
    • Competing Fairness Definitions and Decision Context
    • Feedback Loops Created by Analytical Decisions
    • Who Benefits and Who Bears the Costs
    • Consent, Expectations, and Appropriate Data Use
    • Human Oversight and Contestability
    • Ethical Review of High-Impact Analyses
    • Communicating Limitations Without Overstating Objectivity
  10. 66Analytics Delivery, Monitoring, and Maintenance11 thèmes
    • Delivering Reusable Datasets, Reports, and Analytical Models
    • Ownership and Handoff Documentation
    • Scheduled Refreshes and Data Dependency Management
    • Versioned Logic and Historical Result Reproducibility
    • Acceptance Checks Before Publishing Results
    • Monitoring Freshness, Completeness, and Metric Behavior
    • Investigating Failed Refreshes and Inconsistent Outputs
    • Upstream Changes and Analytical Drift
    • Revising Models and Metrics with Controlled Comparisons
    • Communicating Corrections to Published Findings
    • Retiring Analyses That No Longer Support Valid Decisions

Étape 7

Practicum & Capstone

Une décision, argumentée avec des données

5 modules · 52 thèmes

  1. 67Data Preparation and SQL Practicum10 thèmes
    • Turning an Ambiguous Request into a Dataset Specification
    • Profiling and Cleaning a Messy Multisource Dataset
    • Resolving Identifier and Join Cardinality Problems
    • Building an Analytical Table at the Correct Grain
    • Implementing Event Windows and Historical State Logic
    • Creating Cohort, Funnel, and Retention Queries
    • Reconciling Metrics Across Independent Calculations
    • Investigating Missing Data and Measurement Gaps
    • Documenting Data Lineage and Quality Limitations
    • Delivering a Reproducible Preparation Workflow
  2. 68Statistical Inference and Modeling Practicum10 thèmes
    • Describing a Distribution Without Hiding Important Variation
    • Designing a Sample and Assessing Representation
    • Estimating an Effect with Appropriate Uncertainty
    • Comparing Parametric and Resampling-Based Results
    • Interpreting Multiple Tests Without Selective Reporting
    • Fitting and Critiquing a Regression Model
    • Analyzing a Binary or Count Outcome
    • Evaluating Repeated or Clustered Observations
    • Comparing Predictive Performance on Appropriate Held-Out Data
    • Writing a Statistical Findings Memo with Explicit Assumptions
  3. 69Experimentation and Causal Analysis Practicum10 thèmes
    • Defining a Causal Question and Drawing Its Assumptions
    • Planning an Experiment with Decision-Relevant Power
    • Auditing Assignment, Exposure, and Outcome Measurement
    • Diagnosing Sample Ratio Mismatch and Attrition
    • Analyzing an A/B Test with Primary and Guardrail Metrics
    • Evaluating the Credibility of a Subgroup Effect
    • Assessing Covariate Balance in an Observational Study
    • Critiquing a Difference-in-Differences or Discontinuity Design
    • Conducting Sensitivity Analysis for a Causal Claim
    • Preparing an Experiment Readout and Decision Recommendation
  4. 70Forecasting and Decision Analytics Practicum10 thèmes
    • Preparing a Time Series with Calendar and Missing-Period Checks
    • Establishing Naive and Seasonal Forecast Baselines
    • Comparing Forecasts Through Rolling-Origin Evaluation
    • Assessing Prediction Intervals and Tail Risk
    • Reconciling Forecasts Across Related Business Units
    • Diagnosing Retention and Revenue Changes by Cohort
    • Simulating an Operational Decision Under Uncertainty
    • Formulating a Constrained Resource Allocation Problem
    • Evaluating Whether More Information Would Change the Decision
    • Presenting a Recommendation with Sensitivity to Key Assumptions
  5. 71Integrated Data Science and Analytics Capstone12 thèmes
    • Selecting a Decision and Defining an Answerable Question
    • Specifying the Population, Unit, Time Horizon, and Estimand
    • Auditing Data Sources and Measurement Processes
    • Building and Validating an Analytical Dataset
    • Exploring Patterns and Recording Competing Explanations
    • Choosing Methods Appropriate to the Question and Data
    • Quantifying Uncertainty and Testing Robustness
    • Distinguishing Descriptive, Predictive, and Causal Conclusions
    • Evaluating Practical Value, Fairness, and Decision Consequences
    • Delivering a Clear Report or Decision-Support Dashboard
    • Providing Reproducible Code, Documentation, and Review Evidence
    • Defining Follow-Up Measurement and Maintenance Needs

Quinze minutes.Chaque jour.

  1. 1

    Une leçon tient dans une pause déjeuner

    Une idée à la fois, en diapositives courtes. Une leçon entière prend environ quinze minutes.

  2. 2

    Des exercices corrigés à l'instant

    Les questions sont dans la leçon. Répondez et voyez tout de suite si c'est juste.

  3. 3

    Une série qui donne envie de revenir

    Une leçon par jour entretient la série. De petites séances régulières vous mènent au bout.

Pour qui a un chiffre à défendre.

Où mène ce cours.

Le métier autour duquel ce cours est construit, et comment on y entre.

Data Analyst

Transforme les données d'une entreprise en réponses sur lesquelles on peut agir, et évolue vers la construction de modèles.

Toutes les carrières d'avenir

Au quotidien

  • Écrire la requête qui répond à la question de la semaine
  • Construire un tableau de bord que la direction lit vraiment
  • Concevoir une expérience et lire correctement son résultat

Comment y entrer

Beaucoup commencent comme analystes, avec SQL, les tableurs et des bases en statistiques ; les postes de data scientist demandent en général un diplôme quantitatif.

Soyez parmi les premiers.

Accès anticipé pour les particuliers, pilotes pour les équipes. Dites-nous qui va apprendre.

enterprise@astratrainer.com