๐‘๐š๐ง๐๐จ๐ฆ ๐…๐จ๐ซ๐ž๐ฌ๐ญ : ๐ฎ๐ง ๐ฆ๐จ๐๐ž̀๐ฅ๐ž ๐ฉ๐ฎ๐ข๐ฌ๐ฌ๐š๐ง๐ญ ๐ฉ๐จ๐ฎ๐ซ ๐ฅ๐š ๐ฉ๐ซ๐ž́๐๐ข๐œ๐ญ๐ข๐จ๐ง ๐ž๐ญ ๐ฅ๐š ๐œ๐ฅ๐š๐ฌ๐ฌ๐ข๐Ÿ๐ข๐œ๐š๐ญ๐ข๐จ๐ง

Le ๐‘๐š๐ง๐๐จ๐ฆ ๐…๐จ๐ซ๐ž๐ฌ๐ญ est une ๐ฆ๐ž́๐ญ๐ก๐จ๐๐ž ๐’๐ž๐ง๐ฌ๐ž๐ฆ๐›๐ฅ๐ž qui construit un grand nombre d’arbres de dรฉcision puis combine leurs prรฉdictions.

Chaque arbre est entraรฎnรฉ sur un รฉchantillon alรฉatoire des donnรฉes obtenu par bootstrap, et ร  chaque sรฉparation, il ne considรจre qu’un sous-ensemble alรฉatoire de variables. Cette double part d’alรฉa rend les arbres diffรฉrents les uns des autres, ce qui permet de rรฉduire le surapprentissage et d’amรฉliorer la prรฉcision du modรจle.

๐Ÿ‘‰ La prรฉdiction finale correspond ร  :
• un vote majoritaire en classification
• une moyenne en rรฉgression

๐Ÿ“ ๐‹๐ž ๐ฆ๐จ๐๐ž̀๐ฅ๐ž :
ลท_RF(x) = (1 / B) ×
ฮฃ T_b(x)

๐Ž๐ฎ̀ :
B → nombre d’arbres
T_b(x) → prรฉdiction de l’arbre b
x → variables explicatives

๐ŸŒฒ ๐‚๐จ๐ฆ๐ฆ๐ž๐ง๐ญ ๐œ̧๐š ๐Ÿ๐จ๐ง๐œ๐ญ๐ข๐จ๐ง๐ง๐ž ?
① Tirer B รฉchantillons bootstrap avec remise
② Construire un arbre sur chaque รฉchantillon
③ ร€ chaque nล“ud, sรฉlectionner alรฉatoirement m variables parmi les p variables disponibles
④ Choisir la meilleure variable de sรฉparation parmi ces m variables
⑤ Rรฉpรฉter jusqu’ร  obtenir des arbres complets
⑥ Agrรฉger les prรฉdictions de tous les arbres

๐Ÿง ๐‘๐š๐ง๐๐จ๐ฆ ๐…๐จ๐ซ๐ž๐ฌ๐ญ ๐ฏ๐ฌ ๐†๐ซ๐š๐๐ข๐ž๐ง๐ญ ๐๐จ๐จ๐ฌ๐ญ๐ข๐ง๐ 

Le ๐‘๐š๐ง๐๐จ๐ฆ ๐…๐จ๐ซ๐ž๐ฌ๐ญ entraรฎne les arbres en parallรจle, sur des รฉchantillons alรฉatoires diffรฉrents. Les arbres sont indรฉpendants et souvent profonds.

Le ๐†๐ซ๐š๐๐ข๐ž๐ง๐ญ ๐๐จ๐จ๐ฌ๐ญ๐ข๐ง๐ , lui, entraรฎne les arbres de maniรจre sรฉquentielle : chaque arbre cherche ร  corriger les erreurs du prรฉcรฉdent. Les arbres sont souvent plus petits et dรฉpendants les uns des autres.

En pratique :
๐‘๐š๐ง๐๐จ๐ฆ ๐…๐จ๐ซ๐ž๐ฌ๐ญ est souvent plus rapide et plus facile ร  rรฉgler.
Le
๐†๐ซ๐š๐๐ข๐ž๐ง๐ญ ๐๐จ๐จ๐ฌ๐ญ๐ข๐ง๐  peut offrir une meilleure prรฉcision, mais demande gรฉnรฉralement un rรฉglage plus fin.

✍️ ๐๐ฎ๐š๐ง๐ ๐ฎ๐ญ๐ข๐ฅ๐ข๐ฌ๐ž๐ซ ๐‘๐š๐ง๐๐จ๐ฆ ๐…๐จ๐ซ๐ž๐ฌ๐ญ ?
Utilisez-le lorsque :
• vous avez besoin d’un modรจle de base solide et rapide
• vos donnรฉes contiennent des variables de types variรฉs
• vous souhaitez mesurer l’importance des variables sans rรฉglages complexes

๐€̀ ๐ซ๐ž๐ญ๐ž๐ง๐ข๐ซ :
Le
๐‘๐š๐ง๐๐จ๐ฆ ๐…๐จ๐ซ๐ž๐ฌ๐ญ est un modรจle robuste, simple ร  utiliser et trรจs efficace pour de nombreux problรจmes de classification et de prรฉdiction.

________________________________________________________________________________

Si vous avez trouvรฉ cette publication utile, n'hรฉsitez pas ร  ๐’๐’‚ ๐’๐’Š๐’Œ๐’†๐’“ ๐’†๐’• ร  ๐’๐’‚ ๐’‘๐’‚๐’“๐’•๐’‚๐’ˆ๐’†๐’“ avec vos amis et collรจgues !

Pour mieux apprendre l’utilisation des logiciel et modรจles statistiques, nous vous invitons ร  prendre part ร  la prochaine session de notre formation en ๐™€๐™˜๐™ค๐™ฃ๐™ค๐™ขรฉ๐™ฉ๐™ง๐™ž๐™š ๐™š๐™ฉ ๐™๐™š๐™˜๐™๐™ฃ๐™ž๐™ฆ๐™ช๐™š๐™จ ๐™Œ๐™ช๐™–๐™ฃ๐™ฉ๐™ž๐™ฉ๐™–๐™ฉ๐™ž๐™ซ๐™š๐™จ https://forms.gle/yZAZimRXbTFbUWZk6



 

#MachineLearning #RandomForest #DataScience #Statistiques #AnalyseDeDonnรฉes

 

Commentaires

Posts les plus consultรฉs de ce blog

ร‰conomรฉtrie des donnรฉes de panel: de la thรฉorie ร  la pratique

Optimisez vos donnรฉes avec l'ACP avant le clustering K-means !