Articles

🔵 𝐋𝐞𝐬 𝐦é𝐭𝐢𝐞𝐫𝐬 𝐝𝐞 𝐥𝐚 𝐃𝐚𝐭𝐚 𝐧𝐞 𝐬𝐨𝐧𝐭 𝐏𝐀𝐒 𝐭𝐨𝐮𝐬 𝐥𝐞𝐬 𝐦ê𝐦𝐞𝐬

Image
Beaucoup de personnes pensent que les métiers de la data se ressemblent. 👉 En réalité, chaque rôle repose sur une logique et des compétences différentes. Voici une distinction simple et claire 👇 ➤ 𝒟𝒶𝓉𝒶 𝒜𝓃𝒶𝓁𝓎𝓈𝓉 Tu analyses ce qui s’est déjà produit . Tu transformes des données brutes en rapports clairs pour aider à la prise de décision. Compétences clés : SQL, visualisation, reporting, statistiques de base. ➤ 𝒟𝒶𝓉𝒶 𝒮𝒸𝒾𝑒𝓃𝓉𝒾𝓈𝓉 Tu t’intéresses à ce qui va se produire . Tu construis des modèles, détectes des tendances et utilises les mathématiques et la programmation pour anticiper l’avenir . Compétences clés : machine learning, statistiques avancées, deep learning. ➤ 𝒜𝓃𝒶𝓁𝓎𝓈𝓉𝑒 𝑀𝑒 ́ 𝓉𝒾𝑒𝓇 (Business Analyst) Tu fais le lien entre les besoins métiers et la donnée . Tu traduis les problèmes business en solutions opérationnelles . Compétences clés : communication, gestion des parties prenantes, modélisation...

🔵 𝓓𝓸𝓷𝓷é𝓮𝓼 𝓬𝓪𝓽é𝓰𝓸𝓻𝓲𝓮𝓵𝓵𝓮𝓼 : 𝓹𝓸𝓾𝓻𝓺𝓾𝓸𝓲 𝓵’𝓐𝓒𝓟 𝓷’𝓮𝓼𝓽 𝓹𝓪𝓼 𝓽𝓸𝓾𝓳𝓸𝓾𝓻𝓼 𝓵𝓪 𝓫𝓸𝓷𝓷𝓮 𝓸𝓹𝓽𝓲𝓸𝓷 ?

Image
Lorsque vous travaillez avec des 𝓭𝓸𝓷𝓷 é 𝓮𝓼 𝓬𝓪𝓽 é 𝓰𝓸𝓻𝓲𝓮𝓵𝓵𝓮𝓼 , l’ 𝓐𝓷𝓪𝓵𝔂𝓼𝓮 𝓮𝓷 𝓒𝓸𝓶𝓹𝓸𝓼𝓪𝓷𝓽𝓮𝓼 𝓟𝓻𝓲𝓷𝓬𝓲𝓹𝓪𝓵𝓮𝓼 ( 𝓐𝓒𝓟 ) n’est pas toujours adaptée, car elle repose sur des variables 𝓷𝓾𝓶 é 𝓻𝓲𝓺𝓾𝓮𝓼 . Voici des 𝓪𝓵𝓽𝓮𝓻𝓷𝓪𝓽𝓲𝓿𝓮𝓼 𝓹𝓵𝓾𝓼 𝓪𝓭𝓪𝓹𝓽 é 𝓮𝓼 à considérer : ✔️ 𝓐𝓷𝓪𝓵𝔂𝓼𝓮 𝓭𝓮𝓼 𝓒𝓸𝓻𝓻𝓮𝓼𝓹𝓸𝓷𝓭𝓪𝓷𝓬𝓮𝓼 𝓜𝓾𝓵𝓽𝓲𝓹𝓵𝓮𝓼 ( 𝓐𝓒𝓜 ) Extension de l’analyse des correspondances à 𝓹𝓵𝓾𝓼𝓲𝓮𝓾𝓻𝓼 𝓿𝓪𝓻𝓲𝓪𝓫𝓵𝓮𝓼 𝓬𝓪𝓽 é 𝓰𝓸𝓻𝓲𝓮𝓵𝓵𝓮𝓼 , elle permet d’identifier les 𝓻𝓮𝓵𝓪𝓽𝓲𝓸𝓷𝓼 et structures sous-jacentes. ✔️ 𝓐𝓷𝓪𝓵𝔂𝓼𝓮 𝓕𝓪𝓬𝓽𝓸𝓻𝓲𝓮𝓵𝓵𝓮 𝓭𝓮 𝓓𝓸𝓷𝓷 é 𝓮𝓼 𝓜𝓲𝔁𝓽𝓮𝓼 ( 𝓕𝓐𝓓𝓜 ) Méthode idéale pour les 𝓳𝓮𝓾𝔁 𝓭𝓮 𝓭𝓸𝓷𝓷 é 𝓮𝓼 𝓶𝓲𝔁𝓽𝓮𝓼 (catégorielles et numériques), permettant une 𝓻 é 𝓭𝓾𝓬𝓽𝓲𝓸𝓷 𝓭𝓮 𝓭𝓲𝓶𝓮𝓷𝓼𝓲𝓸𝓷 cohérente. ✔️ 𝓽 - 𝓢𝓝𝓔 𝓹𝓸𝓾𝓻 𝓭𝓸𝓷𝓷 é 𝓮𝓼 𝓬𝓪𝓽 é 𝓰𝓸𝓻𝓲𝓮𝓵𝓵𝓮𝓼 Technique non li...

📈 𝓀-Nearest Neighbors (𝓀NN) : comprendre un algorithme clé du Machine Learning

Image
🔹 𝓛𝓮 𝓴 -Nearest Neighbors ( 𝓴 NN) est un algorithme non paramétrique et basé sur les instances , utilisé aussi bien en classification qu’en régression . 👉 En classification , pour prédire la classe d’une nouvelle observation, le kNN identifie les 𝓴 observations les plus proches dans l’espace des variables et attribue la classe majoritaire parmi ces voisins. 👉 En régression , il calcule la moyenne (ou moyenne pondérée) des valeurs cibles des voisins. ✅ 𝓐𝓾𝓬𝓾𝓷 𝓪𝓹𝓹𝓻𝓮𝓷𝓽𝓲𝓼𝓼𝓪𝓰𝓮 𝓬𝓸𝓶𝓹𝓵𝓮𝔁𝓮 : le modèle ne “s’entraîne” pas, il compare directement les nouvelles données aux observations existantes. 🔍 𝓕𝓸𝓷𝓬𝓽𝓲𝓸𝓷𝓷𝓮𝓶𝓮𝓷𝓽 𝓭𝓾 𝓴 NN (classification) 1 ️ ⃣ Choisir 𝓴 (nombre de voisins) et une mesure de distance (souvent euclidienne) 2 ️ ⃣ Pour une observation à prédire : ·          calculer la distance avec toutes les observations d’apprentissage ·     ...

𝑫𝒐𝒏𝒏é𝒆𝒔 𝒎𝒂𝒏𝒒𝒖𝒂𝒏𝒕𝒆𝒔 : 𝒅é𝒄𝒐𝒖𝒗𝒓𝒆𝒛 𝒍’𝒊𝒎𝒑𝒖𝒕𝒂𝒕𝒊𝒐𝒏 𝑵𝑵𝑺, 𝒖𝒏𝒆 𝒂𝒍𝒕𝒆𝒓𝒏𝒂𝒕𝒊𝒗𝒆 𝒑𝒖𝒊𝒔𝒔𝒂𝒏𝒕𝒆

Image
Les données manquantes constituent un problème fréquent dans presque tous les jeux de données , et peuvent fausser sérieusement les résultats statistiques si elles ne sont pas traitées correctement. Une solution largement utilisée est l’imputation des données manquantes , qui consiste à estimer et remplacer les valeurs manquantes par des valeurs plausibles , plutôt que de supprimer les observations incomplètes. Il existe de nombreuses méthodes d’imputation , et il est souvent difficile de choisir la plus adaptée à un jeu de données donné. Une méthode que j’ai récemment découverte et qui présente des résultats très prometteurs est l’imputation NNS (Nonlinear Nonparametric Statistics) . L’imputation NNS repose sur une régression non linéaire et non paramétrique . Elle estime les valeurs manquantes en identifiant des relations locales optimales dans les données , sans supposer de linéarité ni d’ homoscédasticité . 👉 Elle s’adapte donc très bien aux structures complexes , au...

𝙈𝙖𝙘𝙝𝙞𝙣𝙚 𝙇𝙚𝙖𝙧𝙣𝙞𝙣𝙜 : 𝙇𝙚𝙨 𝙗𝙖𝙨𝙚𝙨 𝙢𝙖𝙩𝙝𝙚́𝙢𝙖𝙩𝙞𝙦𝙪𝙚𝙨 𝙦𝙪𝙚 𝙩𝙤𝙪𝙩 𝙙𝙖𝙩𝙖 𝙖𝙣𝙖𝙡𝙮𝙨𝙩 𝙙𝙤𝙞𝙩 𝙢𝙖𝙞̂𝙩𝙧𝙞𝙨𝙚𝙧

Image
Le 𝙈𝙖𝙘𝙝𝙞𝙣𝙚 𝙇𝙚𝙖𝙧𝙣𝙞𝙣𝙜 ne repose pas sur la magi e, mais sur des fondations mathématiques solides. Pour 𝙘𝙤𝙢𝙥𝙧𝙚𝙣𝙙𝙧𝙚, 𝙘𝙤𝙣𝙨𝙩𝙧𝙪𝙞𝙧 𝙚𝙩 𝙞𝙣𝙩𝙚𝙧𝙥𝙧𝙚́𝙩𝙚𝙧 les modèles, il faut maîtriser : 𝘼𝙡𝙜𝙚̀𝙗𝙧𝙚 𝙡𝙞𝙣𝙚́𝙖𝙞𝙧𝙚 → vecteurs, matrices, distances 𝙋𝙧𝙤𝙗𝙖𝙗𝙞𝙡𝙞𝙩𝙚́𝙨 → incertitude, lois, probabilités conditionnelles 𝙎𝙩𝙖𝙩𝙞𝙨𝙩𝙞𝙦𝙪𝙚𝙨 → estimation, inférence, validation des modèles 𝘾𝙖𝙡𝙘𝙪𝙡 𝙙𝙞𝙛𝙛𝙚́𝙧𝙚𝙣𝙩𝙞𝙚𝙡 → optimisation, gradients, fonctions de coût 𝙂𝙧𝙖𝙥𝙝𝙚𝙨 & 𝙫𝙞𝙨𝙪𝙖𝙡𝙞𝙨𝙖𝙩𝙞𝙤𝙣 → comprendre et expliquer les données 𝙈𝙖𝙞̂𝙩𝙧𝙞𝙨𝙚𝙧 𝙘𝙚𝙨 𝙥𝙞𝙡𝙞𝙚𝙧𝙨, c’est passer de l’utilisation aveugle des algorithmes à une analyse intelligente et crédible. 𝙇𝙚 𝙙𝙖𝙩𝙖 𝙨𝙘𝙞𝙚𝙣𝙩𝙞𝙨𝙩 𝙦𝙪𝙞 𝙘𝙤𝙢𝙥𝙧𝙚𝙣𝙙 𝙡𝙚𝙨 𝙢𝙖𝙩𝙝𝙨 𝙘𝙤𝙢𝙥𝙧𝙚𝙣𝙙 𝙡𝙚𝙨 𝙧𝙚́𝙨𝙪𝙡𝙩𝙖𝙩𝙨. ________________________________________ ________________________________________ Si vous avez trouvé cette publication utile, n...