Image Binarization: Two Solutions for This Problem
La binarisation d'images est une étape cruciale dans le traitement d'images, notamment pour distinguer des objets sombres sur un fond clair ou inversement. Ce travail s'adresse aux étudiants et chercheurs en vision par ordinateur, traitement d'images et lecture optique, qui souhaitent comprendre deux méthodes performantes pour résoudre ce problème complexe.
D'après le document Image Binarization: Two Solutions for This Problem
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.
Document source
Image Processing, Computer Vision · PDF · 10 pages · 1977
Afficher l'aperçu du document
La binarisation d'images est une étape cruciale dans le traitement d'images, notamment pour distinguer des objets sombres sur un fond clair ou inversement. Ce travail s'adresse aux étudiants et chercheurs en vision par ordinateur, traitement d'images et lecture optique, qui souhaitent comprendre deux méthodes performantes pour résoudre ce problème complexe.
La question
Le problème abordé ici est la binarisation d'images analogiques représentant des objets sombres sur un fond clair ou l'inverse. En pratique, l'image délivrée par un capteur est rarement idéale : elle souffre d'un éclairage non uniforme, d'une réponse inhomogène du capteur, de bruit électronique et de variations naturelles du niveau de gris. Par conséquent, un simple seuillage global ne permet pas de séparer correctement les objets du fond dans la majorité des cas. Il est donc nécessaire de développer des algorithmes capables de binariser ces images de manière fiable, sans hypothèses trop restrictives sur la taille ou la forme des objets.
Concepts de base
La binarisation consiste à convertir une image en niveaux de gris en une image binaire où chaque pixel est classé comme appartenant soit à l'objet, soit au fond. Idéalement, un seuil unique suffirait à séparer les pixels, mais en raison des défauts d'éclairage, du bruit et des variations du capteur, ce seuil n'existe généralement pas.
La segmentation d'images en régions est une notion plus large qui englobe la binarisation. Les méthodes classiques utilisent souvent un seuil dynamique calculé localement, par exemple en moyennant les niveaux de gris dans un voisinage autour de chaque pixel. Cependant, ces méthodes nécessitent souvent une connaissance préalable de la taille des objets, ce qui limite leur applicabilité.
Une autre approche classique utilise le laplacien, un opérateur de dérivation seconde sensible aux changements rapides d'intensité. Le signe du laplacien peut indiquer les points d'entrée et de sortie des objets sombres lors d'un balayage de l'image. Toutefois, cette méthode est sensible au bruit haute fréquence, ce qui peut entraîner des erreurs dans la détection des contours.
Pour dépasser ces limites, deux concepts clés sont introduits :
- Représentation multifréquence : elle consiste à analyser l'image à plusieurs échelles de fréquence, en construisant une pyramide d'images filtrées par des laplaciens gaussiens à différentes résolutions. Cette approche permet de détecter les contours et les structures internes des objets à différentes échelles, sans hypothèse sur leur taille.
- Apprentissage local d'un seuil : cette méthode repose sur la mise à jour dynamique, au cours du balayage de l'image, des niveaux de gris caractéristiques du fond (blanc) et des objets (noir). Le seuil local est alors calculé comme la moyenne de ces deux niveaux, ce qui permet une classification adaptative des pixels.
Approche
Deux algorithmes sont proposés pour la binarisation :
Binarisation par analyse multifréquence
Cette méthode commence par filtrer l'image originale avec un filtre gaussien pour réduire la fréquence maximale, puis procède à une décimation (réduction de résolution) conforme au théorème d'échantillonnage. Une pyramide d'images est ainsi créée, chaque niveau correspondant à une fréquence maximale réduite.
Ensuite, le laplacien-gaussien est calculé à chaque niveau de la pyramide, produisant une série d'images laplaciennes à différentes échelles. Le signe de ces laplaciens est codé en trois niveaux : blanc si positif au-dessus d'un seuil s, noir si négatif en dessous de -s, gris sinon. Cette représentation multifréquence permet de repérer les contours des objets (laplacien haute fréquence) ainsi que leurs intérieurs (laplaciens basse fréquence).
La décision finale pour chaque pixel est prise selon une règle hiérarchique examinant successivement les signes des laplaciens du plus haut au plus bas niveau de fréquence. Cette règle privilégie l'étiquette "blanc" en cas d'ambiguïté, assurant la préservation des contours tout en remplissant correctement l'intérieur des objets.
Cette approche ne nécessite pas de seuil global ni d'hypothèse sur la taille des objets, ce qui la rend conceptuellement robuste et proche de certains mécanismes biologiques de vision. Cependant, son implémentation en temps réel est difficile car elle demande plusieurs convolutions, décimations, soustractions et expansions, ainsi qu'une mémoire importante. Elle est donc adaptée à des images de taille modérée et à des applications industrielles où le temps de traitement de l'ordre de quelques dizaines de millisecondes est acceptable.
Binarisation par apprentissage local d'un seuil
Cette méthode exploite le fait que le laplacien haute fréquence identifie les pixels proches des contours des objets. En partant de cette information, on peut estimer localement les niveaux de gris caractéristiques du fond (blanc) et des objets (noir) en actualisant ces valeurs au fur et à mesure du balayage de l'image.
Pour chaque ligne d'image, deux variables sont maintenues : B(j,k) pour le niveau de gris local du blanc et N(j,k) pour celui du noir. Ces niveaux sont mis à jour selon des règles basées sur le signe du laplacien et la comparaison des intensités filtrées. Le seuil local S(j,k) est alors calculé comme la moyenne de B(j,k) et N(j,k).
La classification d'un pixel se fait par comparaison de son intensité filtrée avec ce seuil local. Des règles supplémentaires empêchent que le niveau noir dépasse le niveau blanc, ce qui pourrait arriver en présence de variations lentes ou de bruit.
Cette méthode nécessite de fixer un contraste local minimal pour distinguer un objet réel d'un bruit. Elle est plus simple à implémenter en temps réel, notamment grâce à une architecture pipeline, et s'adapte bien aux images avec variations locales importantes, même si elle demande une hypothèse sur ce contraste minimal.
Résultats
Les deux algorithmes ont été testés sur diverses images :
- Images de caractères alphanumériques de bonne qualité avec fond uniforme.
- Images avec contraste réduit.
- Images de qualité médiocre, par exemple des tirages sur papier de mauvaise qualité.
- Images industrielles avec objets manufacturés ne présentant pas une structure de trait, où les niveaux de gris des objets et du fond ne sont pas uniformes.
La binarisation multifréquence préserve bien les contours et l'intérieur des objets sans nécessiter de seuil global. Elle fonctionne même lorsque le contraste est faible, mais peut confondre des variations du fond avec des objets réels en cas de très faible contraste.
La méthode par apprentissage local du seuil s'est avérée très efficace, notamment pour les images à faible contraste. Elle adapte le seuil localement en fonction des niveaux de gris estimés du fond et des objets, ce qui améliore la classification dans des conditions difficiles. Elle peut aussi être adaptée pour traiter des images où les objets sont clairs sur un fond sombre en modifiant symétriquement les règles d'actualisation.
Limites et questions ouvertes
La binarisation multifréquence, bien que conceptuellement élégante et proche des mécanismes biologiques, souffre d'une complexité de mise en œuvre en temps réel, notamment pour des images de grande taille comme celles issues de scanners. Elle nécessite une architecture matérielle lourde et une mémoire importante.
La méthode par apprentissage local du seuil demande de fixer un contraste local minimal, ce qui peut limiter son efficacité en présence de bruit très faible ou de variations très lentes du fond. De plus, elle repose sur l'hypothèse que le début de chaque ligne d'image représente le fond, ce qui peut ne pas toujours être vrai.
Enfin, les deux méthodes supposent que l'image contient essentiellement deux classes de pixels (objet et fond) et qu'une frontière nette existe entre elles. Elles ne traitent pas directement des images plus complexes avec plusieurs classes ou des textures très variées.
Glossaire
- Binarisation : transformation d'une image en niveaux de gris en une image binaire où chaque pixel est classé comme objet ou fond.
- Laplacien : opérateur de dérivation seconde utilisé pour détecter les variations rapides d'intensité dans une image.
- Laplacien-gaussien : convolution de l'image par un filtre gaussien suivie du calcul du laplacien, permettant une analyse à différentes échelles.
- Représentation multifréquence : représentation d'une image par une pyramide de laplaciens gaussiens à différentes échelles de fréquence.
- Seuil dynamique local : seuil calculé localement pour classifier les pixels en fonction de leur voisinage.
- Apprentissage local du seuil : méthode adaptative qui met à jour les niveaux de gris caractéristiques du fond et des objets au cours du balayage de l'image.
- Décimation : réduction de la résolution d'une image par sous-échantillonnage.
- Convolution : opération mathématique appliquée à une image pour filtrer ou transformer ses valeurs de pixels.
- Contraste local minimal : différence minimale de niveau de gris nécessaire pour distinguer un objet réel d'un bruit.
Commentaires
Aucun commentaire pour le moment. Posez la première question.