Certificat de data scientist

Certification : Data science : savoir collecter, décrypter, analyser et prédire à partir de mégadonnées

Proposée par École nationale de la statistique et de l'administration économique — 91120 Palaiseau

Éligible CPF
Formation continue
Présentiel

Prix

Indiqué par le ou les établissement(s)

9 950 €

Présentation

Un taux de réussite à l'examen supérieur à 90% grâce à l'accompagnement personnalisé de la part d'enseignants issus du monde académique et du monde de l'entreprise.

Modalités disponibles

Voie Modalité Prix Durée Niveau de sortie Provenance
Formation continue Présentiel 9 950 € 126 h

Objectifs

Le Data Scientist est à la croisée de plusieurs métiers. Il doit posséder un large champ de compétences : en mathématiques, en statistiques, en modélisation, en analyse de données mais aussi bien entendu en informatique afin d'implémenter les modèles. De plus, il connaît la fonction d'application des données analysées. Ce certificat répond au besoin d'ingénieurs expérimentés en mathématiques appliquées ou en informatique d'évolution vers la fonction de data scientist. Il met en lumière les outils algorithmiques et les techniques liés à la data science afin d'être capable ensuite de mettre en place, au sein de son organisation, une stratégie data répondant à une problématique précise. A l'issue de la certification, les apprenants sauront : * Effectuer des requêtes dans une base de données afin de récupérer des données et d'assurer leur traitement * Extraire du contenu de sites Web via des API (web scraping) dans le but de le transformer pour permettre sont utilisation dans un autre contexte * Mettre en oeuvre les principaux outils de Big data * Modéliser des données à l'aide de l'apprentissage automatique (machine learning) à des fins de prévision puis choisir la méthode la plus adaptée aux données et au problème traité * Déployer une chaîne complète de traitements : du recueil des données à la mise en production et à la mise à disposition via une API * Mettre en oeuvre des méthodes d'analyse factorielle et de classification non-supervisée pour réduire la dimension * Développer une application web pour présenter des résultats * Analyser des textes et les classer * Analyser des communautés via l'analyse de graphes

Programme

Module 1 : Python et les bases de données (3 jours) : Python et SQL - Python et introduction au NoSQL - webscrapping et pipeline de traitements Module 2 : Machine Learning (3 jours) : MCO et régression pénalisées - Régression logistique - Arbres et random forest Module 3 : Machine Learning avancé et visualisation (3 jours) : Méthodes d'agrégation : gradient boosting - Support Vector Machines (SVM) - Visualisation - Cloud Computing - Projet tutoré Module 4 : Réduction de dimension et pipeline de traitements (3 jours) : Clustering et analyse factorielle : ACP, AFC, ACM - Pipeline de traitements Python - Datacamp - Projet tutoré Module 5 : Deep Learning et Text Mining (3 jours) : Réseaux de neurones denses, réseaux de neurones convolutifs - Autres architectures de Deep Learning - Introduction au NLP : Sac et nuages de mots, analyse de thèmes, vectorisation - Projet tutoré Module 6 : Big Data Processing avec Spark (3 jours) : L'écosystème Apache Hadoop - Distribution du stockage et du calcul - SQL avec Hadoop - Passage à l'échelle - Droit et éthique de la donnée - Projet tutoré
Voir la formation sur le site de l'établissement