๐๐ฎ’๐๐ฌ๐ญ-๐๐ ๐ช๐ฎ๐ le ๐๐ฅ๐๐ฌ๐ฌ๐ข๐๐ข๐๐ฎ๐ซ ๐๐๐ข๐ฏ๐ ๐๐๐ฒ๐๐ฌ ?
Le ๐๐๐ข๐ฏ๐ ๐๐๐ฒ๐๐ฌ est un ๐๐ฅ๐๐ฌ๐ฌ๐ข๐๐ข๐๐ฎ๐ซ ๐ฉ๐ซ๐จ๐๐๐๐ข๐ฅ๐ข๐ฌ๐ญ๐ rapide, fondรฉ sur le ๐ญ๐ก๐́๐จ๐ซ๐̀๐ฆ๐ ๐๐ ๐๐๐ฒ๐๐ฌ.
Son objectif
est de prรฉdire la classe d’une observation en calculant la
probabilitรฉ de chaque classe ร partir des variables explicatives.
Pourquoi
dit-on “naive” ?
Parce qu’il suppose que toutes les variables explicatives sont ๐ข๐ง๐๐́๐ฉ๐๐ง๐๐๐ง๐ญ๐๐ฌ ๐๐จ๐ง๐๐ข๐ญ๐ข๐จ๐ง๐ง๐๐ฅ๐ฅ๐๐ฆ๐๐ง๐ญ ร la classe.
Cette
hypothรจse est souvent peu rรฉaliste dans la pratique, mais le modรจle donne
malgrรฉ tout des rรฉsultats surprenamment efficaces.
๐ ๐๐ ๐๐จ๐ซ๐ฆ๐ฎ๐ฅ๐ :
P(Cโ | x) = P(Cโ) × ∏ P(xแตข | Cโ) / P(x)
๐๐ฎ̀ :
P(Cโ | x) → probabilitรฉ a posteriori de la classe k
sachant les variables
P(Cโ) → probabilitรฉ a priori de la classe k
P(xแตข | Cโ) → vraisemblance de la variable i
sachant la classe k
P(x) → รฉvidence, commune ร toutes les classes, souvent ignorรฉe
dans la dรฉcision finale
⚡ ๐๐จ๐ฆ๐ฆ๐๐ง๐ญ ๐̧๐ ๐๐จ๐ง๐๐ญ๐ข๐จ๐ง๐ง๐ ?
① Calculer les probabilitรฉs a
priori ร partir des donnรฉes d’apprentissage
② Estimer la vraisemblance
de chaque variable pour chaque classe
③ Multiplier la probabilitรฉ a priori par
les vraisemblances de toutes les variables
④ Retenir la classe ayant la probabilitรฉ
la plus รฉlevรฉe
๐ ๐๐๐ข๐ฏ๐ ๐๐๐ฒ๐๐ฌ ๐ฏ๐ฌ ๐๐́๐ ๐ซ๐๐ฌ๐ฌ๐ข๐จ๐ง ๐๐จ๐ ๐ข๐ฌ๐ญ๐ข๐ช๐ฎ๐
La ๐ซ๐́๐ ๐ซ๐๐ฌ๐ฌ๐ข๐จ๐ง ๐ฅ๐จ๐ ๐ข๐ฌ๐ญ๐ข๐ช๐ฎ๐ apprend les poids des variables par
optimisation et modรฉlise directement P(y|x). C’est un modรจle discriminant.
Le ๐๐๐ข๐ฏ๐ ๐๐๐ฒ๐๐ฌ, lui, estime les probabilitรฉs ร partir
des frรฉquences observรฉes, modรฉlise la distribution conjointe P(x,y)
et appartient aux modรจles gรฉnรฉratifs.
En pratique :
๐๐๐ข๐ฏ๐ ๐๐๐ฒ๐๐ฌ est trรจs rapide ร entraรฎner.
La rรฉgression logistique demande une optimisation itรฉrative,
mais gรจre souvent mieux les variables corrรฉlรฉes.
✍️ ๐๐ฎ๐๐ง๐ ๐ฎ๐ญ๐ข๐ฅ๐ข๐ฌ๐๐ซ ๐๐๐ข๐ฏ๐ ๐๐๐ฒ๐๐ฌ ?
Utilisez-le notamment pour :
• la classification de textes (spam, analyse de sentiments)
• les prรฉdictions en temps rรฉel quand la rapiditรฉ est
essentielle
• les donnรฉes de grande dimension et creuses avec peu
d’exemples d’apprentissage
๐̀ ๐ซ๐๐ญ๐๐ง๐ข๐ซ :
Le ๐๐๐ข๐ฏ๐ ๐๐๐ฒ๐๐ฌ est un modรจle simple, rapide et puissant,
particuliรจrement utile lorsque l’on veut construire un classificateur efficace
avec peu de complexitรฉ.
________________________________________
________________________________________
Si vous avez trouvรฉ cette publication
utile, n'hรฉsitez pas ร ๐๐ ๐๐๐๐๐ ๐๐
ร ๐๐ ๐๐๐๐๐๐๐๐
avec vos amis et collรจgues !
Pour mieux apprendre l’utilisation des
logiciel et modรจles statistiques, nous vous invitons ร prendre part ร la
prochaine session de notre formation en ๐๐๐ค๐ฃ๐ค๐ขรฉ๐ฉ๐ง๐๐ ๐๐ฉ ๐๐๐๐๐ฃ๐๐ฆ๐ช๐๐จ ๐๐ช๐๐ฃ๐ฉ๐๐ฉ๐๐ฉ๐๐ซ๐๐จ https://forms.gle/yZAZimRXbTFbUWZk6
________________________________________
________________________________________
#MachineLearning #NaiveBayes #Statistiques #DataScience #Classification

Commentaires
Enregistrer un commentaire