Mon parcours complet en statistiques appliquées à la Data Science et à l'IA
Ce dépôt est le fruit de mon apprentissage intensif des statistiques pour la Data Science et l'analyse. Il contient l'ensemble des notebooks, exercices et ressources que j'ai développés en suivant une formation sur YouTube et avec l'accompagnement de DeepSeek.
La formation qui a guidé ce parcours est disponible ici :
🔗 Lien direct : Statistiques pour la Data Science - Formation Complète
| Notebook | Description | Sujets Principaux |
|---|---|---|
01_stats_basics.ipynb |
Fondations statistiques | Moyenne, médiane, mode, variance, écart-type |
02_distributions.ipynb |
Lois de probabilité | Normale, binomiale, Poisson, loi des grands nombres |
03_inference.ipynb |
Statistique inférentielle | Tests d'hypothèses, intervalles de confiance |
04_correlation.ipynb |
Corrélations | Pearson, Spearman, matrice de corrélation |
05_regression_stats.ipynb |
Régression | Régression linéaire, diagnostics, interprétation |
06_anova.ipynb |
ANOVA | Tests de variance, comparaisons multiples |
**salary.ipynb** |
⭐ PROJET FINAL | creation et analyse statistique complète sur un dataset salarial |
Mon exercice final qui synthétise toutes les compétences acquises :
- ✅ Nettoyage et préparation des données
- ✅ Statistiques descriptives détaillées
- ✅ Visualisations statistiques (Seaborn, Matplotlib)
- ✅ Tests d'hypothèses (t-test, ANOVA)
- ✅ Régression linéaire et interprétation
- ✅ Prédictions et évaluation du modèle
- 📝 Notes de cours : Synthèses des concepts clés
- 📊 Datasets : Données pour la pratique (incluant le dataset salarial)
- 🎯 Cheat Sheets : Formules et commandes essentielles
| Bibliothèque | Utilisation |
|---|---|
NumPy |
Calcul scientifique, algèbre linéaire |
Pandas |
Manipulation et analyse de données |
Matplotlib |
Visualisation de base |
Seaborn |
Visualisation statistique avancée |
Scikit-learn |
ML et prétraitement |
