Les fonctionnalités de vision par ordinateur sur Azure
Ce module présente les principales tâches de vision par ordinateur, classification, détection d'objets et OCR, et les services Azure associés, dont Azure AI Vision, Custom Vision et Azure AI Document Intelligence.
À retenir
- •Les modèles de vision par ordinateur reposent généralement sur des réseaux de neurones convolutifs (CNN) qui analysent les pixels d'une image.
- •Azure AI Vision fournit des capacités prêtes à l'emploi : description d'image, détection d'objets, OCR, détection de visages.
- •Custom Vision permet d'entraîner un modèle de classification ou de détection sur des images propres à une entreprise, sans écrire de code de deep learning.
- •Azure AI Document Intelligence extrait automatiquement des champs structurés depuis des documents comme les factures ou les formulaires.
- •L'usage de la reconnaissance faciale sur Azure est volontairement restreint pour des raisons d'IA responsable.
Comment une machine voit une image
Pour un ordinateur, une image numérique est une matrice de pixels, chacun défini par des valeurs numériques représentant son intensité lumineuse et sa couleur, par exemple trois canaux rouge, vert et bleu pour une image couleur. Un modèle de vision par ordinateur apprend à reconnaître des motifs dans cette matrice de nombres plutôt qu'à voir une image comme un humain.
La plupart des modèles modernes de vision par ordinateur reposent sur les réseaux de neurones convolutifs (CNN), une architecture de deep learning spécialement conçue pour repérer des motifs locaux, comme des contours, des textures ou des formes, puis les combiner progressivement en concepts de plus haut niveau, jusqu'à reconnaître un objet entier. Entraîner un tel modèle depuis zéro nécessite généralement de grands volumes d'images annotées et une puissance de calcul importante, ce qui explique l'intérêt des services prêts à l'emploi proposés par Azure.
Azure AI Vision, les capacités prêtes à l'emploi
Azure AI Vision regroupe plusieurs capacités de vision par ordinateur accessibles directement via une API, sans entraînement préalable. La classification d'image attribue une ou plusieurs étiquettes descriptives à une image entière, par exemple plage, coucher de soleil, personne. La détection d'objets va plus loin en identifiant chaque objet présent dans l'image avec un cadre englobant (bounding box) précisant sa position.
La fonctionnalité OCR, reconnaissance optique de caractères, extrait le texte imprimé ou manuscrit présent dans une image, que ce soit une pancarte photographiée ou un document scanné. Azure AI Vision propose également la génération automatique de légendes descriptives d'une image et la détection de contenu modéré, images explicites ou choquantes, utile pour filtrer du contenu généré par les utilisateurs. La détection de visages, plus sensible, existe mais reste volontairement limitée en accès, comme détaillé dans la dernière section de ce module.
Custom Vision, entraîner son propre modèle sans deep learning
Custom Vision est le service Azure permettant d'entraîner un modèle de vision par ordinateur adapté à un besoin métier spécifique, sans écrire de code de deep learning. Une entreprise qui souhaite reconnaître ses propres références produits, détecter des défauts sur une chaîne de fabrication ou identifier des types de plantes particuliers peut créer un projet dans le portail Custom Vision, y importer ses propres images, les étiqueter manuellement, puis lancer un entraînement.
Le service prend en charge deux types de tâches : la classification, qui attribue une étiquette à l'image entière, par exemple pièce conforme ou pièce défectueuse, et la détection d'objets, qui localise précisément chaque élément recherché dans l'image. Après entraînement, Custom Vision évalue automatiquement la précision du modèle sur un jeu de test et permet d'itérer en ajoutant davantage d'images pour les catégories les moins bien reconnues, avant de publier le modèle comme point de terminaison utilisable en production.
Azure AI Document Intelligence, extraire des données structurées
Azure AI Document Intelligence, anciennement Form Recognizer, est le service Azure spécialisé dans l'extraction de données structurées à partir de documents semi-structurés comme les factures, les reçus, les cartes d'identité ou les formulaires professionnels. Contrairement à un simple OCR qui extrait du texte brut, ce service comprend la structure du document : il associe automatiquement chaque valeur à son champ, par exemple le montant total à l'étiquette Total, la date d'émission à l'étiquette Date, ou reconstitue le contenu d'un tableau ligne par ligne.
Le service propose des modèles prédéfinis pour les documents les plus courants, factures, reçus, cartes d'identité, cartes de visite, directement utilisables sans entraînement, ainsi que la possibilité d'entraîner un modèle personnalisé sur un jeu de documents propre à une organisation, quand leur mise en page ne correspond à aucun modèle standard. C'est le service à privilégier dès qu'un scénario évoque l'automatisation du traitement de factures, de bons de commande ou de formulaires administratifs.
Considérations responsables propres à la vision par ordinateur
La reconnaissance faciale occupe une place particulière parmi les fonctionnalités de vision par ordinateur d'Azure en raison des risques qu'elle soulève en matière de vie privée et d'équité. Des études ont montré que certains modèles de reconnaissance faciale obtenaient des taux d'erreur plus élevés selon le genre ou la couleur de peau des personnes photographiées, ce qui peut conduire à des discriminations si le système est utilisé pour identifier des individus, par exemple dans un contexte de surveillance ou de contrôle d'accès.
Pour cette raison, Microsoft a restreint l'accès à certaines capacités avancées de reconnaissance faciale d'Azure AI Vision, comme l'identification d'une personne précise, à des clients validés qui démontrent un cas d'usage conforme aux principes d'IA responsable. Cette restriction illustre concrètement, dans le domaine de la vision par ordinateur, les principes d'équité et de confidentialité et sécurité présentés dans le premier module de ce parcours.