Python pour la Data Science
Le langage Python est récemment devenu, dans le monde académique comme sur le marché du travail, un outil indispensable pour le traitement de données
Description
Le langage Python est récemment devenu, dans le monde académique comme sur le marché du travail, un outil indispensable pour le traitement de données.
La richesse de ce langage permet de l’utiliser dans toutes les phases du traitement de la donnée, de sa récupération et structuration à partir de sources diverses à sa valorisation. Ce cours introduit différents outils qui permettent de mettre en relation des données et des théories grâce à Python.
Plan détaillé de la leçon
Introduction : (1h)
- Retour sur les notions fondamentales de Python
- Présentation de l’écosystème Python pour la data-science
- Initiation aux bonnes pratiques
- Présentation des principes de la data-science
Partie 1: Manipuler des données (3h)
- Principes de base avec numpy
- Manipuler des bases de données avec pandas et SQL
- Introduction aux données spatiales (geopandas)
- Récupérer des données par webscraping et API
Partie 2: Visualiser (2h)
- Présentation des packages de base pour les graphiques: matplotlib, seaborn
- Visualisations HTML avec plotly
- Cartographie: cartes fixes (matplotlib + geopandas) et cartes dynamiques (folium)
Partie 3: Modéliser (3h)
- Preprocessing et démarche du machine learning
- Evaluation d’un modèle et validation croisée
- Classification
- Régression
- Sélection de variables
- Clustering
- Pipelines scikit
Partie 4: Natural Langage Processing (1h)
- Preprocessing
- Approche bag of words
- Latent Dirichlet Allocation (LDA)
- Word Embedding (Word2Vec)
Supplément: Git & Github
Intervenant
ALESTERD KAMELA
Compétences acquises
À l’issue de ce cours, les étudiants seront capables de :
- Manipulation et analyse de données avec Python, NumPy, Pandas, SQL et API.
- Visualisation et valorisation des données avec Matplotlib, Seaborn, Plotly, Geopandas et Folium.
- Modélisation en data science avec preprocessing, machine learning, validation croisée, classification, régression, clustering et NLP.
A propos de l'intervenant
Alesterd KAMELA
Alesterd KAMELA est diplômé de l’ESLCA Business School Paris et occupe actuellement le poste d’IT QUANT chez Hilbert Investment Solutions.
Il possède une expérience en finance quantitative, gestion des risques, marchés financiers et traitement de données, acquise à travers des missions en support quantitatif, risk management et opérations de marché dans des environnements exigeants.