PROBABILITE DE CONVERGENCES CRIMINELLES
.2 Distribution de probabilités La probabilité d'un évènement, sa tendance plus ou moins systématique à se réaliser, est une notion dont nous connaissons une multitude d'exemples intuitifs. Formellement, elle peut être définie comme suit: Soit X une variable catégorielle pouvant prendre une parmi m modalités dans l'ensemble A = a1,...,am. La probabilité pi = P(ai) = P(X = ai) de la i-ème modalité de A est un nombre réel compris entre 0 et 1 (inclus). pi = 0 ssi ai n'est jamais réalisée, et pi = 1 ssi ai est systématiquement réalisée. L'ensemble des m probabilités associées aux m modalités de X est appelé distribution de X et noté P = p1,...,pm. En particulier, P doit satisfaire (1) Il est important de distinguer clairement entre la probabilité pi d'une modalité et sa fréquence fi, définie par (2) où n(ai) dénote le nombre d'occurences de ai dans un échantillon, et n la taille de cet échantillon. La fréquence est une mesure empirique, généralement utilisée comme estimation de la quantité théorique qu'est la probabilité. Pour éclairer cette dialectique, considérons l'exemple hypothétique suivant: lors de la genèse, on a observé que Dieu a créé pendant six jours consécutifs, puis s'est abstenu le septième jour. Un texte correspondant à cette expérience pourrait être 1111110, de longueur n = 7, codé sur A = {0,1} (m = 2) avec 0 et 1 correspondant respectivement aux événements "Dieu ne créa point" et "Dieu créa". Nous pouvons calculer la fréquence de chaque symbole, qui se trouve être f(0) = 1/7 et f(1) = 6/7. A partir de là, nous pouvons utiliser ces valeurs pour inférer les probabilités correspondantes, c'est-à-dire produire un énoncé tel que "Chaque jour de genèse, Dieu a une chance sur sept de ne point créer", ou plus formellement P(0) = 1/7, P(1) = 6/7. En fait, si la fréquence est l'estimateur le plus utilisé pour la probabilité, celle-ci peut être définie indépendamment des observations. Par exemple, on pourrait postuler que "chaque jour de genèse, Dieu a une chance sur deux de ne point créer" (équiprobabilité) puis confronter cette hypothèse aux résultats empiriques afin de confirmer / infirmer l'adéquation du modèle aux données. Dans la suite, et de façon générale, nous nous efforcerons de faire clairement le départ entre les quantités empiriques, calculées à partir des données, et les quantités théoriques, qui constituent les paramètres de modèles. Nous avons mentionné plus haut la possibilité de considérer la probabilité non plus des symboles mais des séquences de k symboles (ou k-grammes). De façon générale, la probabilité pi = P(wi) d'un k-gramme wi Ak (où Ak dénote l'ensemble des k-grammes) peut être estimée par la fréquence correspondante; on a (3) qui généralise (2). -------------------------------------------------------------------------------- Recherche: Annuaires Site map -------------------------------------------------------------------------------- -------------------------------------------------------------------------------- Copyright - Impressum - Webmaster - Login
Publicité