Probabilité & Statistique
Fethi Derbeli 2017
Fethi Derbeli 2017
Programme
(cid:1) Importance de la probabilité et la statistiques
(cid:1) Méthodes d'analyse
(cid:1) Mesures statistiques
(cid:1)
(cid:1)
Tendance centrale
Dispersion
(cid:1) La courbe normale
(cid:1) Prévisions utilisant une distribution normale
(cid:1) Théorème de la limite centrale
(cid:1) Intervalle de confiance
(cid:1) Exercices
Fethi Derbeli 2017
Pourquoi étudier les probabilité & statistiques ?
(cid:1) On entend par statistiques la collecte, l'organisation, l'analyse, l'interprétation et la
présentation des données.
(cid:1) C'est un des nombreux outils permettant de résoudre les problèmes de
qualité.
(cid:1) Les statistiques descriptives nous donnent des informations sur les
performances d'un procédé.
(cid:1) Les statistiques par inférence nous permettent de prévoir les performances
futures d'un procédé sur la base de mesures actuelles.
(cid:1) L'objectif final est de prévoir & prévenir plutôt que de contrôler & détecter.
(cid:1) Les statistiques peuvent avoir plusieurs formes : tabulaires, numériques,
graphiques.
La probabilité est la base des prévisions
Fethi Derbeli 2017
Terminologie
(cid:1) Un échantillon est un nombre limité des éléments prise de la source
des données. (cid:1) le groupe d’objets véritablement mesuré dans une étude statistique (cid:1) un échantillon est en général un sous-ensemble de la population à
laquelle on s’intéresse.
(cid:1) Une population la source des éléments ou les échantillons sont
prises. (cid:1) un groupe entier d’objets qui ont été ou vont être créés, présentant une
caractéristique intéressante
(cid:1) il est probable que nous ne connaissions jamais les paramètres réels de
la population
(cid:1) L'inférence statistique implique la mesure sur un échantillon et les
prévisions sur une population.
(cid:1) Généralement, les symboles grecs représentent les paramètres de population (µ, σ) et les lettres romaines (x, s) sont utilisées pour représenter les valeurs d'échantillon.
Fethi Derbeli 2017
Les paramètres de population / les échantillons
“Paramètres de population”
“Statistiques d’échantillons”
σ = Déviation standard de population
=X
Moyenne d ’échantillon
µ = Moyenne de population
s = Déviation standard d’échantillon
Population
Echantillon
Fethi Derbeli 2017
Principes statistiques fondamentaux de l’amélioration
(cid:1) Variabilité
(cid:1) Le processus atteint-il ses objectifs concernant la variabilité minimum ? (cid:1) On utilise la moyenne pour déterminer si le processus atteint son objectif, et la
Déviation standard (σ), pour connaître la répartition.
(cid:1) Stabilité
(cid:1) Quelle est la performance du processus sur une durée donnée ? (cid:1) La stabilité est représentée par une variabilité moyenne constante et prévisible
dans le temps.
Graphique à barres des X du processus A
Graphique à barres des X du processus B
n e y o m n o
l l i t n a h c E
75
70
65
LSC=77.20
X=70.91
LIC =64.62
n e y o m n o
l l i t n a h c E
80
70
60
50
LSC=77.27
X=70.98
LIC =64.70
0
5
10
15
20
25
Nombre d ’échantillons
0
15
5 10 Nombre d ’échantillons
20
25
Fethi Derbeli 2017
Exercice pratique
(cid:1) Supposons que les machines A, B, et C fabriquent des produits identiques (cid:1) Supposons que la valeur ciblée de chaque variable de produit est 100mm. (cid:1) Répondre aux questions suivantes:
(cid:1) Quelle(s) machin(es) présente(ent) une variation? (cid:1) Sur quoi chaque machine est-elle centrée ? (cid:1) Quelles machines sont prévisibles ? (cid:1) Quelles machines présentent une variation ayant une cause spéciale ? (cid:1) Quelle machine choisiriez-vous pour fabriquer votre produit ? (cid:1) Quelle machine serait la plus facile à réparer ?
Graphique à barres des X de la machine A
Graphique à barres des X de la machine B
Graphique à barres des X de la machine C
X-bar Chart for Machine A
X-bar Chart for Machine B
X-bar Chart for Machine C
n e y o m n o
l l i t n a h c E
145 135 125 115 105 95 85 75 65 55
0
10
Nombre d ’échantillons
138.4
X=100.7
62.93
20
n e y o m n o
l l i t n a h c E
110
1
100
90
0
10
20
Nombre d ’échantillons
Fethi Derbeli 2017
108.5
X=101.0
93.42
120
115
n e y o m n o
l l i t n a h c E
110
0
119.7
X=115.0
110.4
10
20
Nombre d ’échantillons
Pouvons-nous tolérer la variabilité?
(cid:1) Tout processus présentera toujours une certaine variabilité (cid:1) Nous pouvons tolérer cette variabilité si:
(cid:1) le processus remplit ses objectifs; (cid:1) la variabilité totale est relativement faible par rapport aux spécifications du
processus;
(cid:1) le processus est stable dans le temps.
LIS
t û o C
LIS
t û o C
Nom
LSS USL
Acceptable
Vue Traditionnelle
Nom
LSS
Fonction de perte Taguchi
(Vue nouvelle)
Fethi Derbeli 2017
Objectif Versus limites des spécification
Notre souci ne sera plus “est ce que nous sommes dans les specs?”
Vision traditionnelle
Cette valeur est il….
LSL
Nom
USL
Réllement different de celle la?
X
X
Acceptable
CTQ
Nous somme encore entrain d’utiliser l’une et de jeter l’autre !
Fethi Derbeli 2017
Nouvelle vision qualité
Notre souci devient :
“Est ce que nous somme à l’objectif avec le minimum de variation?”
Nouvelle vision
LSL
Nom
USL
CTQ distribution
t û o C
CTQ
Fethi Derbeli 2017
Perte en qualité en s’éloignant de l’objectif
Coût de la Variabilité /Objectif
LSL
Nom
USL
t û o C
t û o C
LSL
Nom
USL
Fethi Derbeli 2017
À l’objectif: minimum de variabilité
À l’objectif: variabilité à la limite d’acceptation
Coût de la Variabilité / hors Objectif
LSL
Nom
USL
Pas à l’objectif: minimum de variabilité
Pas à l’objectif: variabilité à la limite d’acceptation
t û o C
t û o C
LSL
Nom
USL
Fethi Derbeli 2017
Types de données d’arrivée
(cid:1) Attributs (données qualitatives)
(cid:1) Catégories (cid:1) Oui, Non (cid:1) Passe, Ne passe pas (cid:1) Machine 1, Machine 2, Machine 3 (cid:1) Bon/Mauvais
(cid:1) Variables (données quantitatives)
(cid:1) Données discontinues
(cid:1)Pannes d’équipements de maintenance, rupture de fibres, nombre de
blocages
(cid:1) Données continues
(cid:1)Les subdivisions décimales ont un sens (cid:1)Dimensions, rendement chimique, durée de cycle
Fethi Derbeli 2017
Types d'analyses statistiques
(cid:1) Tabulaire
(cid:1) distribution des fréquences, tableau des fréquences
(cid:1) Numérique
(cid:1) moyenne, médiane, étendue, variance, écart type
(cid:1) Graphique
(cid:1) boîte à moustaches, histogramme
Publicité
Fethi Derbeli 2017
Les analyses de données nécessaires à l’amélioration
(cid:1) Déterminer si le processus est stable
(cid:1) Si le processus n’est pas stable, identifier et supprimer les causes (X) d’instabilité
(variation évidente et non aléatoire)
(cid:1) Situer la moyenne du processus. Répond-il à ses objectifs ?
(cid:1) Si ce n’est pas le cas, identifier les variables (X) qui affectent la moyenne et
déterminer les réglages optima pour atteindre les objectifs.
(cid:1) Estimer l’ampleur de la variabilité totale. Est-elle acceptable en ce qui
concerne les exigences du client (limites de spécifications)?
(cid:1) Si ce n’est pas le cas, identifier les sources de variabilité et supprimer ou réduire
leur influence sur le processus.
(cid:1) Nous allons maintenant examiner des statistiques qui peuvent aider ce
processus.
Fethi Derbeli 2017
Répartitions statistiques
(cid:1) On peut décrire le comportement de n’importe quel
processus ou système en indiquant de multiples points de données pour la même variable (cid:1) sur une certaine durée (cid:1) pour plusieurs produits (cid:1) sur diverses machines, etc.
(cid:1) L’accumulation de ces données peut être considérée comme une répartition de valeurs représentée par: (cid:1) des graphiques à points (cid:1) des histogrammes (cid:1) des courbes normales ou autre répartition “arrondie”
Fethi Derbeli 2017
Mesures de tendance centrale
• Moyenne: moyenne arithmétique d’un ensemble de valeurs
– Reflète l’influence de toutes les valeurs – Fortement influencée par les valeurs extrêmes
n nx ∑ == 1 n n
x
• Médiane: reflète les 50% - le nombre central une fois qu’un
ensemble de chiffres a été trié – Ne tient pas forcément compte de toutes les valeurs dans le
calcul
– Est “dure” avec les valeurs extrêmes
• Mode:
– La valeur la plus fréquente dans les ensembles de données
• Pourquoi utiliser la moyenne au lieu de la médiane dans nos
efforts d’amélioration du processus ?
Fethi Derbeli 2017
Exercice
Nous allons calculer ensemble la moyenne et la médiane de la série de données n°1.
Moyenne = Médiane =
Faites maintenant la série de données n°2 et 3 en groupes.
Série n°2
Série n°3
Moyenne = Médiane =
Moyenne = Médiane =
Fethi Derbeli 2017
Set#1 98 102 108 105 89 92 114 90 97 100 104
Set#2 105 109 116 76 148 87 86 70 137 99 119
Set#3 107 169 131 84 81 67 81 122 52 233 46
Mesures de dispersion
Étendue
Distance numérique entre les valeurs les plus élevées et les valeurs les plus basses d'une série de données
– Très sensible aux valeurs extrêmes des données
Étendue interquartile (IQR)
Distance extrême entre le 1er et le 3ème quartile d'une
série de données divisée en 4 groupes égaux
– Utilisée pour générer des boîtes à moustaches
Range
=
min −
max
IQR
=
− 3 QQ 1
Variance (σ 2; s2 ) Moyenne des carrés des écarts de chaque point de
données individuel par rapport à la valeur moyenne – Pas du tout sensible aux valeurs extrêmes des
données
2
s
=
Écart type (σ ; s)
Racine carrée de la variance ; distance moyenne des
données par rapport à la moyenne
– Mesure la plus communément utilisée pour
quantifier une variation
s
=
Fethi Derbeli 2017
n
∑
= 1i
n
∑
1i =
(X
i
2
−
)X
− 1n
(X
i
2
−
)X
− 1n
Exercice
Nous allons calculer ensemble l'étendue, la variance et l'écart type de la série de données n°1. Étendue = Variance = s2 = Écart type = s =
Faites maintenant la série de données n°2 et 3 en groupes. Série n°2
Série n° 3
Étendue = Variance = s2 = Écart type = s = Étendue = Variance = s2 = Écart type = s =
Fethi Derbeli 2017
Set#1 98 102 108 105 89 92 114 90 97 100 104
Set#2 105 109 116 76 148 87 86 70 137 99 119
Set#3 107 169 131 84 81 67 81 122 52 233 46
Probabilité
(cid:1) Nous avons précédemment défini les valeurs d'échantillon et les
paramètres de population.
(cid:1) Une fonction de distribution de probabilité est une formule mathématique
qui rapproche les valeurs des caractéristiques avec leur probabilité d'occurrence dans la population.
(cid:1) Une collection de valeurs de probabilité est appelée une distribution.
(cid:1) Lorsque la caractéristique mesurée peut prendre une valeur quelconque (dépendant de la finesse de la méthode de mesure), sa distribution de probabilité est continue. (cid:1) Les distributions normales, exponentielles et de Weibull sont des exemples.
(cid:1) Lorsque la caractéristique mesurée ne peut prendre qu'une valeur bien
spécifique, sa distribution de probabilité est discrète. (cid:1) Binôme et Poisson sont des exemples.
Fethi Derbeli 2017
Distributions de probabilité
DISTRIBUTION BINOMIALE (distribution discrète finie)
1.1. VARIABLE DE BERNOULLI
Définition : Une variable aléatoire discrète qui ne prend que les valeurs 1 et 0 avec les probabilités respectives p et q = 1- p est appelée variable de BERNOULLI. Plus généralement, on utilisera une variable de Bernoulli lorsqu’on effectue une épreuve qui n’a que deux issues : le succès ou l’échec. On affecte alors 1 à la variable en cas de succès et 0 en cas d’échec.
Distribution de probabilités Paramètres de la distribution
Fethi Derbeli 2017
Distributions de probabilité
DISTRIBUTION BINOMIALE
a) On effectue une épreuve de Bernoulli. Elle n’a donc que deux issues : le succès avec une probabilité p ou l’échec avec une probabilité q. b) On répète n fois cette épreuve. c) Les n épreuves sont indépendantes entre elles, ce qui signifie que la probabilité de réalisation de l’événement « succès » est la même à chaque épreuve et est toujours égale à p. Dans cette situation, on s’intéresse à la variable X = nombre de succès au cours des n épreuves. La probabilité d’obtenir k succès, c’est-à-dire p(X = k ). ⇒ La probabilité d'avoir k succès suivis de (n-k) échecs est pk qn−k car ces résultats sont indépendants les uns des autres. ⇒ La probabilité d'avoir k succès et (n-k) échecs dans un autre ordre de réalisation est toujours pk qn−k . Donc tous les événements élémentaires qui composent l’événement (X =k) ont même probabilité. ⇒ Combien y en a-t-il? Autant que de façons d’ordonner les k succès par rapport aux (n-k) échecs ? Il suffit de choisir les k places des succès parmi les n possibles k manières de choisir et les (n-k) échecs prendront les places restantes. Or il y a Cn k places parmi n.
Fethi Derbeli 2017
Distributions de probabilité
Finalement, on obtient pour 0 ≤ k ≤ n :
On dit que la variable aléatoire X suit une loi binomiale de paramètres n et p. On note : X ∼> B(n,p).
Paramètres descriptifs de la distribution
Fethi Derbeli 2017
Distributions de probabilité
DISTRIBUTION GÉOMÉTRIQUE ( distribution discrète dénombrable)
a) On effectue une épreuve de Bernoulli. b) On répète l’épreuve jusqu’à l’apparition du premier succès. c) Toutes les épreuves sont indépendantes entre elles, ce qui signifie que la probabilité de réalisation de l'événement « succès » est la même à chaque épreuve et est toujours égale à p. Dans cette situation, on s’intéresse à la variable X = nombre de fois qu’il faut répéter l’épreuve pour obtenir le premier succès.
DISTRIBUTION DE PROBABILITÉS
On dit que la variable aléatoire X suit une loi géométrique de paramètre p . On note : X ∼> G(p).
PARAMÈTRES DESCRIPTIFS DE LA DISTRIBUTION
Fethi Derbeli 2017
Distributions de probabilité
DISTRIBUTION DE POISSON ( distribution discrète dénombrable)
Beaucoup de situations sont liées à l’étude de la réalisation d'un événement dans un intervalle de temps donné (arrivée de clients qui se présentent à un guichet d'une banque en une heure. Les phénomènes ainsi étudiés sont des phénomènes d'attente.
Pour décrire les réalisations dans le temps d'un événement donné, on peut : • soit chercher le nombre de réalisations de l’événement dans un intervalle de temps donné qui est distribué suivant une loi de Poisson. • soit chercher le temps entre deux réalisations successives de l’événement qui est distribué suivant une loi exponentielle. La loi de Poisson peut être interprétée comme un cas limite d'une loi binomiale et la seconde comme un cas limite d'une loi géométrique.
Fethi Derbeli 2017
Distributions de probabilité
DISTRIBUTION DE PROBABILITÉS Nous cherchons à déterminer la loi de probabilité de la variable X = « nombre de réalisations d’un événement donné pendant un intervalle de temps t », sachant que le nombre moyen de réalisations de cet événement par unité de temps est α. Il s’agit d’une loi binomiale B(n, p) ou αt = λ.
Définition : La distribution de Poisson de paramètre λ est celle d’une variable discrète X qui prend ses valeurs dans N selon la fonction de densité :
On écrit : X ∼> P(λ).
Fethi Derbeli 2017
Distributions de probabilité
DISTRIBUTION EXPONENTIELLE (distribution continue) . SITUATION CONCRÈTE On se place dans le cas d'un phénomène d'attente et on s’intéresse à la variable aléatoire qui représente le temps d'attente pour la réalisation d’un événement ou le temps d'attente entre la réalisation de deux événements successifs. Si on se place dans le cas où l’intensité α du processus de Poisson est constante, ce temps d’attente suit une loi exponentielle de paramètre α.
La loi exponentielle de paramètre α décrit la distribution d'une variable continue X qui ne prend que des valeurs positives selon la fonction de densité :
On note X ∼> Exp(α)
Fethi Derbeli 2017
Distributions de probabilité
DISTRIBUTION NORMALE ( distribution continue)
SITUATION CONCRÈTE
Donc dès que nous seront dans une situation où la distribution dépend de causes ⇒ en grand nombre et indépendantes ⇒ dont les effets s'additionnent ⇒ dont aucune n'est prépondérante alors nous serons en présence de la distribution normale. Une variable aléatoire continue suit une loi normale si l’expression de sa fonction de densité de probabilités est de la forme :
La loi dépend des deux réels m et σ appelés paramètres de la loi normale. On note : X ∼> N(m, σ).
Fethi Derbeli 2017
Distributions de probabilité
loi normale centrée réduite notée N(0,1).
Donc si X ∼> N(m, σ) , on pose On peut résumer la correspondance de la façon suivante:
et T ∼> N(0,1).
APPROXIMATIONS PAR DES LOIS NORMALES
Fethi Derbeli 2017
Exemple
Exercice 1: Supposons qu'une tentative pour obtenir une communication téléphonique échoue (par exemple, parce que la ligne est occupée) avec la probabilité 0.25 et réussisse avec la probabilité 0.75. On suppose que les tentatives sont indépendantes les unes des autres. Quelle est la probabilité d’obtenir la communication si l’on peut effectuer trois tentatives au maximum?
Fethi Derbeli 2017
Solution : • Nous nous intéressons à la variable X = « nombre de tentatives nécessaires pour obtenir la communication », ce que l’on peut considérer comme le nombre d’essais à faire pour obtenir le premier succès. X suit une loi géométrique de paramètre p = 0.75 • On cherche à déterminer p(X ≤ 3) = p(X = 1) + p(X = 2) + p(X = 3) • → On peut obtenir la communication au 1er essai. On a pour cela une probabilité p(X = 1) = 0.75. → On peut obtenir la communication au 2ème essai. On a pour cela une probabilité p(X= 2) = 0.25×0.75 = 0.1875. → On peut obtenir la communication au 3ème essai. On a pour cela une probabilité p(X= 3) =0.252×0.75 = 0.0469. → Finalement la probabilité d’obtenir la communication en trois essais maximum est p(X ≤ 3) = 0.75 + 0.1875 + 0.0469 = 0.9844 soit 98.5 %.
Fethi Derbeli 2017
Exemple
Exercice 2 : Un fabricant de pièces de machine prétend qu'au plus 10% de ses pièces sont défectueuses. Un acheteur a besoin de 120 pièces. Pour disposer d'un nombre suffisant de bonnes pièces, il en commande 140. Si l'affirmation du fabricant est valable, quelle est la probabilité que l'acheteur reçoive au moins 120 bonnes pièces?
Fethi Derbeli 2017
Solution : • Appelons X la variable aléatoire correspondant au « nombre de bonnes pièces dans le lot de 140 pièces ». • X prend ses valeurs entre 0 et 140. De plus pour chaque pièce, on n’a que deux éventualités : elle est bonne ou elle est défectueuse. La probabilité qu’une pièce soit défectueuse est 0.1. Par conséquent elle est bonne avec la probabilité 0.9. On est donc dans une situation type : X suit la loi binomiale de paramètres n = 140 et p = 0.9. X ∼> B(140,0.9) • On veut déterminer la probabilité que l’acheteur reçoive au moins 120 bonnes pièces sur les 140, soit p(X ≥ 120) . A priori, il nous faudrait calculer la somme des probabilités p(X = 120) + p(X = 121) +.......+ p(X = 140) ce qui serait épouvantablement long. On essaie donc d’approcher la loi binomiale par une loi tabulée :
on pourra approcher la loi binomiale par une loi normale. On
choisit la loi normale qui a la même espérance et le même écart-type. Donc X qui suit la loi B(140, 0.9) sera approchée par Y qui suit la loi N(126, 3.55). • Pour remplacer une loi discrète par une loi continue, il est préférable d’utiliser la correction de continuité : p(X ≥ 120) ≅ p(Y > 119.5) . On se ramène enfin à la loi normale centrée réduite :
Conclusion : l’acheteur a 97 chances sur 100 de recevoir 120 bonnes pièces sur les 140 achetées.
Fethi Derbeli 2017
Exercice 3 : Les statistiques antérieures d'une compagnie d'assurances permettent de prévoir qu'elle recevra en moyenne 300 réclamations durant l'année en cours. Quelle est la probabilité que la compagnie reçoive plus de 350 réclamations pendant l'année en cours ?
Fethi Derbeli 2017
Solution : • La variable X qui nous intéresse est le « nombre de réclamations reçues pendant une année ». Il s’agit du nombre de réalisations d’un événement pendant un intervalle de temps donné. X suit donc une loi de Poisson. Le nombre moyen de réalisations dans une année est 300. Cette valeur moyenne est aussi le paramètre de la loi de Poisson. Donc X suit la loi P(300). • On cherche à déterminer p(X > 350). Il n’y a pas de table de la loi de Poisson pour cette valeur du paramètre λ. Il nous faut donc approcher X qui suit la loi de Poisson P(300) par Y qui suit la loi normale de même espérance et de même écart-type, c’est à- dire N(300,√ 300). • Ici aussi, on remplace une loi discrète par une loi continue. Il faut donc appliquer la correction de continuité : p(X > 350) = p(X ≥ 351) ≅ p(Y > 350.5). On se ramène finalement à la loi normale centrée réduite
La compagnie d’assurances a donc 1.70/1000 de chances de recevoir plus de 350 réclamations en un an.
Fethi Derbeli 2017
Distributions de probabilité
Fethi Derbeli 2017
Distributions de probabilité
Fethi Derbeli 2017
La répartition normale
(cid:1) La répartition “Normale” est une répartition des données qui
possèdent certaines caractéristiques cohérentes
(cid:1) Ces caractéristiques sont très utiles pour nous permettre de comprendre les propriétés du processus d’où viennent les données
(cid:1) La plupart des phénomènes naturels et des processus créés par l’homme sont répartis normalement, ou peuvent être représentés comme tels.
Fethi Derbeli 2017
Distribution normale
(cid:1) La distribution utilisée le plus communément dans les analyses statistiques de procédés industriels est la distribution normale.
(cid:1) La fonction de densité de probabilité (fdp) est :
y
=
1
2σ
π
−
(X
−
e
/22μ)
2 σ
Les propriétés significatives sont les suivantes : La courbe est symétrique autour de la moyenne Les valeurs de l'asymétrie et du kurtosis = 0 La moyenne et l'écart type sont indépendants Moyenne = médiane Le domaine en-dessous de la courbe de - ∞ à + ∞ = 1
Fethi Derbeli 2017
La répartition normale
(cid:1) Caractéristique 1: on peut décrire une répartition
normale en connaissant seulement: (cid:1) la moyenne et
(cid:1) la déviation standard
Répartition N°1
Répartition N°2
Répartition N°3
Qu’est-ce qui différencie ces trois répartitions normales ?
Fethi Derbeli 2017
La courbe normale et ses probabilités
(cid:1) Caractéristique 2: la surface en-dessous de la courbe peut être utilisée pour estimer la probabilité cumulative de la survenance d’un certain “évènement”.
r u e l a v
a l e d é t i l i
b a b o r P
40%
30%
n o
l l i t n a h c é ’ l
20%
Publicité
10%
Probabilité cumulative de l’obtention d’une valeur située entre ces deux valeurs
68%
95%
99,73%
e d
0%
-4
-3
-2
-1
0
1
2
3
4
Nombre de déviations standard par rapport à la moyenne
Fethi Derbeli 2017
68,26 % des données tomberont dans les limites de + / - 1 σ par rapport à la moyenne
95,46 %
99,73 %
des données tomberont dans les limites de + / -2 σ par rapport à la moyenne
des données tomberont dans les limites de + / -3 σ par rapport à la moyenne
99,9937 %
des données tomberont dans les limites de + / -4 σ par rapport à la moyenne
99,999943 % des données tomberont dans les limites de + / -5 σ par rapport à la moyenne
99,9999998 % des données tomberont dans les limites de + / -6 σ par rapport à la moyenne
68.26 %
95.46 %
99.73 %
-3.0
σ
-2.0
σ
σ -1.0
-0.0
σ
1.0
σ
σ
2.0
3.0
Fethi Derbeli 2017
Test de Normalité
(cid:1) Dans certaine circonstances si nécessaire, de savoire si les
données sont normalement distribuées.
(cid:1) Pour savoir si la distribution est normale on conduit un test
de normalité, on peut utiliser Minitab
(cid:1) Pour faire un test de normalité on a besoin de lister quelques
concepts fondamentales concernant le test d’hypothèse.
(cid:1) Pour conduire un test d’hypothèse, on a besoin de statuer notre hypothèse et décider le niveau de risque qu’on prend pour se tromper.
Fethi Derbeli 2017
Graphiques de probabilité normale
(cid:1) Nous pouvons tester si un ensemble de données peut être décrit
comme “normal” grâce à un test appelé le graphique de probabilité normale.
(cid:1) Si la répartition est proche de la normale, le graphique de probabilité
normale sera en ligne droite.
(cid:1) Minitab permet de créer facilement un graphique de probabilité
normale
(cid:1) Produire un graphique normal pour chacune des 3 premières
colonnes. Lequel paraît normal ?
(cid:1) Maintenant, produire un histogramme pour chaque.
(cid:1) Que révèle-t-il ?
Fethi Derbeli 2017
Résultat de Minitab
Fethi Derbeli 2017
Graphiques de probabilité normale
Normal Probability Plots
Normal Probability Plots
Normal Probability Plots
y c n e u q e r F
300
200
100
0
y c n e u q e r F
300
200
100
0
20
30
40
50
60
70
80
90
100
110
60
70
80
90
100
110
120
130
0
10
20
30
40
50
60
70
80
C1
C2
C3
Normal Distribution
Positive Skewed Distribution
Negative Skewed Distribution
y t i l i
b a b o Pr
.999 .99 .95
.80
.50
.20
.05 .01 .001
.999 .99 .95 .80
.50
.20
.05 .01 .001
y t i l i
b a b o Pr
26
36
46
56
66 Normal
76
86
96
106
60
70
80
100 90 Pos Skew
110
120
130
0
10
20
Anderson-Darling Normality Test A-Squared: 0.418 p-value: 0.328
Average: 70 Std Dev: 10 N of data: 500
Anderson-Darling Normality Test
A-Squared: 46.447 p-value: 0.000
Average: 70 Std Dev: 10 N of data: 500
30
40 Neg Skew
50
60
70
80
Anderson-Darling Normality Test
A-Squared: 43.953 p-value: 0.000
Fethi Derbeli 2017
y c n e u q e r F
100
50
0
y t i l i
b a b o Pr
.999
.99
.95
.80
.50
.20
.05
.01
.001
Average: 70 Std Dev: 10 N of data: 500
Règles empiriques pour la déviation standard
(cid:1) Les règles précédentes de la probabilité cumulative s’appliquent même si
un ensemble de données n’es pas réparti parfaitement normalement.
(cid:1) Comparons les valeurs d’une répartition théorique (parfaite) et d’une
répartition empirique (concrète).
N om bre de déviations Standard +/- 1σ
+/- 2 σ
+/- 3 σ
Théorique N orm ale
E m pirique N orm ale
68%
95%
60-75%
90-98%
99,7%
99-100%
Fethi Derbeli 2017
Prévisions utilisant la courbe normale
(cid:1) Les prévisions nécessitent 2 estimations et un tableau :
(cid:1) Estimation de µ = X barre
(cid:1) Estimation de σ = s
(cid:1) Tableau Z
(cid:1) Transformation en Z :
(cid:1) Z = (X- µ ) / σ
Fethi Derbeli 2017
Prévision des niveaux de défauts
La transformation en Z :
z
=
)
( − μx σ
( x
=
x
)
− s
(cid:1)
(cid:1)
Cette transformation produit une “valeur” de distribution où : Moyenne = 0 et sigma = 1
La valeur Z indique combien de déviations standard “entrent” dans la distance
entre X (tout nombre intéressant, comme une limite de spécification) et µ (la moyenne
d'une distribution donnée)
(cid:1)
Pour la prévision des niveaux de défauts (ou probabilité estimée), nous pouvons
utiliser la moyenne actuelle et l'écart type du procédé et substituer la limite inférieure et la
limite supérieure de la spécification (unes à unes) pour x
En utilisant cette méthode, nous pouvons calculer le score Z (ou Sigma) du procédé,
les niveaux PPM et la probabilité de défaut
(cid:1)
Publicité
Analysons un exemple.
Fethi Derbeli 2017
Calculer la note Z
La conversion Z:
z
=
) µ
( x − σ
=
)
( xx − s
• Cette “transformation” convertit n’importe quelle distribution normale (avec une moyenne d’échantillon et un sigma d’échantillon) en une répartition standard qui a toujours une moyenne=0 et un sigma=1.
• Que l’on mesure en mm, en pouces, Volts, etc. la répartition transformée aura TOUJOURS une moyenne=0 & sigma=1. Toute distribution est transformée en distribution normale standard grâce au “transformer”Z .
• La valeur z (ou note z), indique l’éloignement d’un chiffre particulier, X, de la
moyenne d’échantillon, en unités standard de déviation.
• Par exemple, si z = 2, le chiffre particulier X est à 2 unités standard de
déviation de la moyenne d’échantillon.
• Pour prédire les niveaux d’échantillons, (ou le rendement estimé), nous
substituons à X la limite inférieure de spécification (LIS) et la limite supérieure de spécification (LSS).
• Nous pouvons ainsi calculer la proportion de produit hors spécifications à partir d’une moyenne d’échantillon et de la déviation standard. Appliquons cette idée aux données du shampoing.
Fethi Derbeli 2017
Exemple de transformation en Z
u Les données à long terme récapitulées ici ont été collectées à partir du processus d'un tour automatique produisant des broches pour garnitures nues (blank armature shafts)
USL
Moyenne EcartType 10.03
0.061
LIS (LSL) LSS (USL) 9.9
10.1
LSL
y c n e u q e r F
10
5
0
9.9
10.0
10.1
10.2
Diameter
Fethi Derbeli 2017
Exemple de transformation en Z (suite)
LIS (LSL)
LSS (USL)
Problème pratique : Déter-miner le % de produits hors spécifications. Problème statistique : Évaluer la proportion de la courbe nor-male en-dehors des limites supérieure et inférieure de la spécification. Nous y arrivons en “transformant” les données en une distribution normale standard et en calculant une valeur Z pour chaque limite de la spécification.
y c n e u q e r F
700
600
500
400
300
200
100
0
0.8
0.9
1. 0
1. 1
1. 2
1. 3
raw
LIS (LSL)
LSS (USL)
y c n e u q e r F
500
400
300
200
100
0
Fethi Derbeli 2017
-4
-3
-2
-1
0
C2
1
2
3
4
Exemple de transformation en Z (suite)
La fraction hors des limites de spéc. peut être estimée de la façon suivante :
=Z U
=
)x-
(USL σ - .061
( 10.1
10.03
)
=Z L
=
)x-
(LSL σ
( -9.9
10.03
)
.061
=
1.15
- =
2.13
Upper Spec Upper Spec
Lower Spec Lower Spec
0.85
0.90
0.95
1.00
1.05
1.10
1.15
1.20
1.25
0.80
0.85
0.90
0.95
1.00
1.05
1.10
1.15
1.20
Pr ( x ≤ 0.9 ) + Pr ( x ≥ 1.1 ) = Pr ( Z ≤ -2.13 ) + Pr ( Z ≥ 1.15 )
= 1.7 % + 12.5 % ≅ 14.2 %
Fethi Derbeli 2017
Transformation Z
Où allons-nous trouver ces probabilités ? Méthode 3 : utiliser les fonctions de répartition des probabilités de Minitab.
ZLIS
ZLSS
Function de répartition cumulative Normale avec moyenne = 0 et dév std = 1,00
Function de répartition cumulative Normale avec moyenne = 0 et dév std = 1,00
x P( X <= x)
-2,3560 0,0092
x P( X <= x)
1,0340 0,8494
Probabilité ( Z < -2,356 ) = 0,0092
Probabilité ( Z < 1,034 ) = 0,8494
Question: Minitab donne-t-il un biseautage à droite ou à gauche de la répartition ?
Z
OU ?
Z
Fethi Derbeli 2017
Transformation Z
Calculer le Z à long terme:
La pire estimation à long terme de Z est calculée en supposant que tous les défauts sont dans un biseau. Nous pouvons à présent calculer à rebours un Z global à partir du pourcentage total défectueux. Rappeler les informations suivantes:
Pr (Qté > 104) + Pr (Qté < 98) = Pr
( Z > 1,034 ) + Pr ( Z < -2,356 )
Z = ?
= 0.1506 + 0,0092 ≅ 15,06 % + 0,92 % ≅ 15,98 % % de produit hors spéc.
Pire cas: % dans un biseau = 15,98 %
Probabilité ( Z > ? ) = 0,1598 Choisir une méthode
N’importe quel tableau Z Fonction Wizard d’Excel Fonctions de répartition des probabilités Minitab Conseil: vous recherchez maintenant une note Z à partir d’une probabilité cumulative.
Réponse: Z LT = 0,9952
Fethi Derbeli 2017
Exemple de transformation en Z (suite)
(cid:1) Où obtenons-nous ces probabilités ?
(cid:1) Méthode 1 : chercher les valeurs dans une table (probabilité
pour une distribution
normal standardisée)
(cid:1) Méthode 2 : utiliser les tableaux informatiques d'EXCEL.
(cid:1) Lorsque Z(inférieur) = - 2.13
Proportion en-dessous de la spéc. inf. = L = 0.017
(cid:1) Lorsque Z(supérieur) = 1.15
Proportion au-dessus de la spéc. sup. = U = 0.1250
(cid:1) Additionner L + U = .142
Processus global Z = 1.07
(cid:1) Faisons la démonstration des deux méthodes
Fethi Derbeli 2017
Table de conversion
Comment décider s'il faut additionner ou soustraire 1.5 d'une
évaluation Sigma
Convertir DE
Z court terme
Z long terme
Z court terme
Pas d'action
+ 1.5
σ
Convertir EN
Z long terme
- 1.5 σ
Pas d'action
• Les données à court terme sont sans causes attribuables. Par conséquent,
elles ne représentent que l'effet des causes aléatoires.
• Les données à long terme reflètent l'influence des causes aléatoires aussi
bien que celle des phénomènes attribuables.
• Si les données de probabilité ou de défaut ont été collectées sur un grand
intervalle de production, considérez la situation comme étant à long terme. Dans les autres cas, partez du principe qu'il s'agit de court terme.
Fethi Derbeli 2017
Dérive
(cid:1) Question : Qu'est-ce qui peut causer un décalage de 1.5σ
(cid:1)
(cid:1)
Équipe de production
Opérateur
(cid:1) Machine
(cid:1)
(cid:1)
(cid:1)
(cid:1)
(cid:1)
(cid:1)
Usure de l'outil
Arrêt pour réparation
Étalonnage
Température
Humidité
Nouvelle matière
(cid:1) LES DERIVES EXISTENT ! Nous devons donc en tenir
compte.
Fethi Derbeli 2017
Conclusions
(cid:1) Les Statistiques nous permettent de comprendre les
processus d’une façon à nous permettre de prédire le future performance au lieu de seulement détecter les problèmes actuels
(cid:1) Nous donne une idée de ce qui se passe
(cid:1) Nous permet de comprendre le comportement de la population
entière via des échantillons représentative du processus
(cid:1) Nous permet de prendre des décisions avec un certain niveau
de confiance
(cid:1) Savoir la capabilité actuelle du processus et prendre
ulterierement les décisions pour améliorer
Fethi Derbeli 2017
Questions?
Fethi Derbeli 2017