๐๐๐ง๐๐จ๐ฆ ๐ ๐จ๐ซ๐๐ฌ๐ญ : ๐ฎ๐ง ๐ฆ๐จ๐๐̀๐ฅ๐ ๐ฉ๐ฎ๐ข๐ฌ๐ฌ๐๐ง๐ญ ๐ฉ๐จ๐ฎ๐ซ ๐ฅ๐ ๐ฉ๐ซ๐́๐๐ข๐๐ญ๐ข๐จ๐ง ๐๐ญ ๐ฅ๐ ๐๐ฅ๐๐ฌ๐ฌ๐ข๐๐ข๐๐๐ญ๐ข๐จ๐ง
Le ๐๐๐ง๐๐จ๐ฆ ๐ ๐จ๐ซ๐๐ฌ๐ญ est une ๐ฆ๐́๐ญ๐ก๐จ๐๐ ๐’๐๐ง๐ฌ๐๐ฆ๐๐ฅ๐ qui construit un grand nombre d’arbres de dรฉcision puis combine leurs prรฉdictions.
Chaque arbre
est entraรฎnรฉ sur un รฉchantillon alรฉatoire des donnรฉes obtenu
par bootstrap, et ร chaque sรฉparation, il ne considรจre qu’un sous-ensemble
alรฉatoire de variables. Cette double part d’alรฉa rend les arbres
diffรฉrents les uns des autres, ce qui permet de rรฉduire le
surapprentissage et d’amรฉliorer la prรฉcision du
modรจle.
๐ La prรฉdiction finale correspond ร :
• un vote majoritaire en classification
• une moyenne en rรฉgression
๐ ๐๐ ๐ฆ๐จ๐๐̀๐ฅ๐ :
ลท_RF(x) = (1 / B) × ฮฃ T_b(x)
๐๐ฎ̀ :
B → nombre d’arbres
T_b(x) → prรฉdiction de l’arbre b
x → variables explicatives
๐ฒ ๐๐จ๐ฆ๐ฆ๐๐ง๐ญ
๐̧๐ ๐๐จ๐ง๐๐ญ๐ข๐จ๐ง๐ง๐
?
① Tirer B รฉchantillons bootstrap
avec remise
② Construire un arbre sur chaque
รฉchantillon
③ ร chaque nลud, sรฉlectionner alรฉatoirement
m variables parmi les p variables disponibles
④ Choisir la meilleure variable de
sรฉparation parmi ces m variables
⑤ Rรฉpรฉter jusqu’ร obtenir des arbres
complets
⑥ Agrรฉger les prรฉdictions de tous les
arbres
๐ง ๐๐๐ง๐๐จ๐ฆ ๐
๐จ๐ซ๐๐ฌ๐ญ ๐ฏ๐ฌ ๐๐ซ๐๐๐ข๐๐ง๐ญ ๐๐จ๐จ๐ฌ๐ญ๐ข๐ง๐
Le ๐๐๐ง๐๐จ๐ฆ ๐
๐จ๐ซ๐๐ฌ๐ญ entraรฎne les arbres en parallรจle,
sur des รฉchantillons alรฉatoires diffรฉrents. Les arbres sont indรฉpendants
et souvent profonds.
Le ๐๐ซ๐๐๐ข๐๐ง๐ญ ๐๐จ๐จ๐ฌ๐ญ๐ข๐ง๐ , lui, entraรฎne les arbres de
maniรจre sรฉquentielle : chaque arbre cherche ร corriger les erreurs du
prรฉcรฉdent. Les arbres sont souvent plus petits et dรฉpendants
les uns des autres.
En pratique :
๐๐๐ง๐๐จ๐ฆ ๐
๐จ๐ซ๐๐ฌ๐ญ est souvent plus rapide
et plus facile ร rรฉgler.
Le ๐๐ซ๐๐๐ข๐๐ง๐ญ ๐๐จ๐จ๐ฌ๐ญ๐ข๐ง๐ peut offrir une meilleure prรฉcision, mais
demande gรฉnรฉralement un rรฉglage plus fin.
✍️ ๐๐ฎ๐๐ง๐ ๐ฎ๐ญ๐ข๐ฅ๐ข๐ฌ๐๐ซ ๐๐๐ง๐๐จ๐ฆ ๐
๐จ๐ซ๐๐ฌ๐ญ ?
Utilisez-le lorsque :
• vous avez besoin d’un modรจle de base solide et rapide
• vos donnรฉes contiennent des variables de types variรฉs
• vous souhaitez mesurer l’importance des variables sans rรฉglages
complexes
๐̀ ๐ซ๐๐ญ๐๐ง๐ข๐ซ :
Le ๐๐๐ง๐๐จ๐ฆ ๐
๐จ๐ซ๐๐ฌ๐ญ est un modรจle robuste, simple ร utiliser
et trรจs efficace pour de nombreux problรจmes de classification
et de prรฉdiction.
________________________________________________________________________________
Si vous avez trouvรฉ cette publication
utile, n'hรฉsitez pas ร ๐๐ ๐๐๐๐๐ ๐๐
ร ๐๐ ๐๐๐๐๐๐๐๐
avec vos amis et collรจgues !
Pour mieux apprendre l’utilisation des
logiciel et modรจles statistiques, nous vous invitons ร prendre part ร la
prochaine session de notre formation en ๐๐๐ค๐ฃ๐ค๐ขรฉ๐ฉ๐ง๐๐ ๐๐ฉ ๐๐๐๐๐ฃ๐๐ฆ๐ช๐๐จ ๐๐ช๐๐ฃ๐ฉ๐๐ฉ๐๐ฉ๐๐ซ๐๐จ https://forms.gle/yZAZimRXbTFbUWZk6
#MachineLearning #RandomForest #DataScience #Statistiques #AnalyseDeDonnรฉes

Commentaires
Enregistrer un commentaire