๐๐ฎ’๐ž๐ฌ๐ญ-๐œ๐ž ๐ช๐ฎ๐ž ๐ฅ๐ž ๐๐จ๐จ๐ญ๐ฌ๐ญ๐ซ๐š๐ฉ๐ฉ๐ข๐ง๐  ๐ž๐ง ๐Œ๐‹ ?

Le ๐›๐จ๐จ๐ญ๐ฌ๐ญ๐ซ๐š๐ฉ๐ฉ๐ข๐ง๐  est une ๐ฆ๐ž́๐ญ๐ก๐จ๐๐ž ๐๐ž ๐ซ๐ž́๐ž́๐œ๐ก๐š๐ง๐ญ๐ข๐ฅ๐ฅ๐จ๐ง๐ง๐š๐ ๐ž qui permet d’estimer la ๐๐ข๐ฌ๐ญ๐ซ๐ข๐›๐ฎ๐ญ๐ข๐จ๐ง ๐’é๐œ๐ก๐š๐ง๐ญ๐ข๐ฅ๐ฅ๐จ๐ง๐ง๐š๐ ๐ž d’une statistique sans imposer d’hypothรจses paramรฉtriques fortes.

L’idรฉe est simple : on tire plusieurs รฉchantillons avec remise ร  partir des donnรฉes observรฉes, on calcule la statistique ร  chaque fois, puis on construit une distribution empirique.

Cette approche permet d’estimer :

  • ๐ฅ’๐ข๐ง๐œ๐ž๐ซ๐ญ๐ข๐ญ๐ฎ๐๐ž
  • les ๐ข๐ง๐ญ๐ž๐ซ๐ฏ๐š๐ฅ๐ฅ๐ž๐ฌ ๐๐ž ๐œ๐จ๐ง๐Ÿ๐ข๐š๐ง๐œ๐ž
  • les ๐ž๐ซ๐ซ๐ž๐ฎ๐ซ๐ฌ ๐ฌ๐ญ๐š๐ง๐๐š๐ซ๐

surtout lorsque les formules thรฉoriques sont difficiles, voire impossibles ร  utiliser.

๐๐š๐ฌ ๐›๐ž๐ฌ๐จ๐ข๐ง ๐๐ž ๐Ÿ๐จ๐ซ๐ฆ๐ฎ๐ฅ๐ž ๐œ๐จ๐ฆ๐ฉ๐ฅ๐ž๐ฑ๐ž :
il suffit de rรฉรฉchantillonner et de recalculer.

๐Ÿ“ ๐‹๐š ๐ฉ๐ซ๐จ๐œ๐ž́๐๐ฎ๐ซ๐ž :
ฮธ̂*แต‡ = s(X*แต‡), b = 1, ..., B

๐Ž๐ฎ̀ :
X*
แต‡ → รฉchantillon bootstrap (de mรชme taille que l’รฉchantillon initial, tirรฉ avec remise)
ฮธ̂*แต‡ → statistique calculรฉe sur le rรฉรฉchantillon b
B → nombre de rรฉรฉchantillonnages bootstrap (souvent entre 1 000 et 10 000)
s(·) → fonction statistique (moyenne, mรฉdiane, quantile, etc.)

⚡ ๐‚๐จ๐ฆ๐ฆ๐ž๐ง๐ญ ๐œ̧๐š ๐Ÿ๐จ๐ง๐œ๐ญ๐ข๐จ๐ง๐ง๐ž ?
① Partir de l’รฉchantillon initial de taille n
② Tirer n observations avec remise
③ Calculer la statistique sur cet รฉchantillon bootstrap
④ Rรฉpรฉter l’opรฉration B fois
⑤ Utiliser la distribution des B statistiques pour mesurer l’incertitude

L’รฉcart-type des statistiques bootstrap donne une estimation de l’erreur standard.
Les quantiles
ฮฑ/2 et 1−ฮฑ/2 permettent de construire des intervalles de confiance.

๐Ÿง ๐„๐ง ๐ช๐ฎ๐จ๐ข ๐œ๐ž๐ฅ๐š ๐๐ข๐Ÿ๐Ÿ๐ž̀๐ซ๐ž-๐ญ-๐ข๐ฅ ๐๐ž๐ฌ ๐ฆ๐ž́๐ญ๐ก๐จ๐๐ž๐ฌ ๐ฉ๐š๐ซ๐š๐ฆ๐ž́๐ญ๐ซ๐ข๐ช๐ฎ๐ž๐ฌ ?

Les mรฉthodes paramรฉtriques supposent une loi de distribution (par exemple la loi normale), dรฉrivent les rรฉsultats de maniรจre analytique et demandent souvent des hypothรจses mathรฉmatiques assez strictes.

Le bootstrapping, au contraire, ne repose pas sur une forme de distribution imposรฉe.
Il peut รชtre utilisรฉ pour presque n’importe quelle statistique et estime l’incertitude par simulation.

On peut ainsi bootstrapper :

  • une mรฉdiane
  • un 90e percentile
  • ou toute fonction complexe pour laquelle la thรฉorie classique devient difficile ร  appliquer.

✍️ ๐๐ฎ๐š๐ง๐ ๐ฎ๐ญ๐ข๐ฅ๐ข๐ฌ๐ž๐ซ ๐ฅ๐ž ๐๐จ๐จ๐ญ๐ฌ๐ญ๐ซ๐š๐ฉ๐ฉ๐ข๐ง๐  ?
Utilisez-le lorsque :

  • vous avez besoin d’intervalles de confiance pour des statistiques non standards ;
  • votre รฉchantillon est reprรฉsentatif ;
  • vous souhaitez une mesure de l’incertitude sans dรฉpendre d’une hypothรจse de distribution.

๐€̀ ๐ซ๐ž๐ญ๐ž๐ง๐ข๐ซ :
Le bootstrapping est un outil extrรชmement utile en machine learning, en statistique appliquรฉe et en science des donnรฉes, car il permet d’รฉvaluer la fiabilitรฉ d’un rรฉsultat de faรงon simple, flexible et puissante.

Si vous avez trouvรฉ cette publication utile, n'hรฉsitez pas ร  ๐’๐’‚ ๐’๐’Š๐’Œ๐’†๐’“ ๐’†๐’• ร  ๐’๐’‚ ๐’‘๐’‚๐’“๐’•๐’‚๐’ˆ๐’†๐’“ avec vos amis et collรจgues !

Pour mieux apprendre l’utilisation des logiciel et modรจles statistiques, nous vous invitons ร  prendre part ร  la prochaine session de notre formation en ๐™€๐™˜๐™ค๐™ฃ๐™ค๐™ขรฉ๐™ฉ๐™ง๐™ž๐™š ๐™š๐™ฉ ๐™๐™š๐™˜๐™๐™ฃ๐™ž๐™ฆ๐™ช๐™š๐™จ ๐™Œ๐™ช๐™–๐™ฃ๐™ฉ๐™ž๐™ฉ๐™–๐™ฉ๐™ž๐™ซ๐™š๐™จ (https://forms.gle/yZAZimRXbTFbUWZk6)

 


#๐๐จ๐จ๐ญ๐ฌ๐ญ๐ซ๐š๐ฉ๐ฉ๐ข๐ง๐  #๐Œ๐š๐œ๐ก๐ข๐ง๐ž๐‹๐ž๐š๐ซ๐ง๐ข๐ง๐  #๐’๐ญ๐š๐ญ๐ข๐ฌ๐ญ๐ข๐ช๐ฎ๐ž๐ฌ #๐ƒ๐š๐ญ๐š๐’๐œ๐ข๐ž๐ง๐œ๐ž #๐€๐ง๐š๐ฅ๐ฒ๐ฌ๐ž๐ƒ๐ž๐ƒ๐จ๐ง๐ง๐ž́๐ž๐ฌ

 

Commentaires

Posts les plus consultรฉs de ce blog

ร‰conomรฉtrie des donnรฉes de panel: de la thรฉorie ร  la pratique

Optimisez vos donnรฉes avec l'ACP avant le clustering K-means !