Un sac oublié sur un quai de gare, une valise posée au milieu d’un hall d’aéroport : ce type de situation peut générer de l’inquiétude et mobiliser de précieuses ressources de sécurité. Les équipes de surveillance doivent vérifier rapidement s’il s’agit d’un objet réellement abandonné ou d’un simple oubli passager. Dans un contexte où le nombre de passagers augmente et où les caméras enregistrent des milliers d’images par jour, il devient difficile d’analyser tout cela manuellement.
Le projet ReconnAIssance s’attaque au problème de développer des systèmes d’analyse vidéo et audio basés sur l’intelligence artificielle et le deep learning, capables de fonctionner directement sur les caméras ou des passerelles locales (edge computing, c’est-à-dire le traitement des données sur site, sans envoi dans le cloud).
De la recherche à la technologie opérationnelle pour la sécurité publique
Il s'agit d'un projet collaboratif financé par la Région wallonne dans le cadre du Pôle MecaTech. Il réunit plusieurs partenaires industriels et académiques : Phoenix AI (coordinateur du projet), Thelis et WNM, Chapsvision/ACIC, l’Université de Liège, l’UCLouvain et Sirris.
Un des cas d'usage du projet, sur lequel ACIC et Sirris ont travaillé, se concentre sur la détection d’objets abandonnés dans les espaces publics, un enjeu crucial pour les opérateurs de transport, les gestionnaires de lieux publics et les autorités locales. L’objectif est clair : détecter automatiquement les objets abandonnés et alerter en temps réel les équipes de sécurité, tout en évitant les fausses alertes pouvant bloquer inutilement un site.
Défis techniques de la détection d’objets abandonnés
Détecter un objet abandonné semble simple, mais les défis sont nombreux :
- Peu de données disponibles : les bases d’images publiques montrent rarement des objets abandonnés en situation réelle (gare, centre commercial, etc.)
- Cas rares et variés : les abandons sont rares, et les bases d'images réelles sont propriétaires, non-annotées, et contiennent des données personnelles, ce qui complique l’entraînement des modèles
- Angles de vue différents : les caméras filment souvent de haut, contrairement aux images standards prises à hauteur d’une personne
- Fiabilité exigée : le système doit détecter les vrais objets sans générer trop de fausses alertes
- Contraintes techniques : le modèle doit être léger pour fonctionner sur des plateformes comme la Jetson Orin de NVIDIA (mini-ordinateur très puissant conçu pour l’IA embarquée) sans dépendre d’un serveur cloud
Comment Sirris améliore la détection avec l’IA
Au sein de Sirris, nous avons contribué à la préparation des données et au développement de méthodes d’apprentissage adaptées à ce projet. Nous avons mobilisé notre expertise en traitement de données et intelligence artificielle.
1. Création d’un jeu de données sur mesure
Les jeux de données publics comme COCO 2017 contiennent de nombreuses images dans des contextes éloignés des environnements de gares ou de centres commerciaux. Inclure ces images « hors contexte » compliquait inutilement l’apprentissage du modèle. Nous avons donc sélectionné les images les plus pertinentes (entre autres en filtrant les catégories « stuff » de COCO 2017 afin d’éliminer les images les moins pertinentes) et exploré d’autres jeux (i-LIDS, YouYube-8M Segments, Open Images, Visual Genome, PETS2006) pour constituer un jeu plus représentatif.
Nous avons ensuite utilisé un modèle de classification d'images (ResNet50) pour générer des « embeddings », c’est-à-dire des représentations numériques des images. Ces embeddings permettent de mesurer la similarité entre les images et de sélectionner celles qui correspondent le mieux à notre cas d’usage.
Résultat : nous avons obtenu un jeu de données beaucoup plus représentatif, qui facilite l’entraînement du modèle et améliore ses performances de détection.
2. Mise en place d’un pipeline d’apprentissage semi-supervisé et actif
Annoter manuellement des milliers d’images est chronophage. Inspirés par les travaux de recherche les plus récents (comme ceux de Chen et al. ), nous avons conçu un pipeline d’annotation qui associe apprentissage semi-supervisé et apprentissage actif. Concrètement, le modèle apprend aussi à partir d’images non-annotées et ne sollicite un expert humain que pour les cas les plus complexes.
Les images sont d’abord augmentées (variations de luminosité, contraste, miroir…). Si le modèle fournit des prédictions stables entre les versions originales et augmentées, les images simples sont automatiquement annotées et ajoutées au jeu de données. En revanche, les images complexes ou ambigües sont envoyées à la phase d’apprentissage actif et soumises à un expert humain pour annotation. De cette manière, beaucoup moins d’images doivent être annotées manuellement, accélérant la constitution du jeu d’entraînement.
La figure ci-dessous illustre ce processus et montre comment le pipeline sélectionne automatiquement les images faciles et fait intervenir un expert humain uniquement pour les cas les plus complexes.
3. Tests et validation sur le terrain
Pour simplifier la validation du pipeline, nous avons emballé la solution dans des composants Docker. Les tests menés par ACIC sur la plateforme Jetson Orin de NVIDIA ont montré que le système peut fonctionner en edge computing, directement sur les caméras ou passerelles locales, sans envoyer les images vers le cloud. Cela garantit une meilleure réactivité et la confidentialité des données.
Grâce à ces contributions (et à celles réalisées par ACIC), le système est plus fiable, plus rapide à entraîner et prêt pour une mise en œuvre dans des environnements réels comme les gares ou les aéroports.
Amélioration continue par l’apprentissage actif
Nous développons actuellement une approche innovante d’apprentissage actif tirant parti de la difficulté éprouvée par un modèle de détection d'objets à correctement détecter les différents objets présents sur une image. Nous espérons que cela permettra d’améliorer encore la précision tout en limitant le nombre d’annotations nécessaires.
Un projet collectif tourné vers l’industrie
La complémentarité des acteurs industriels, intégrateurs, chercheurs et centre technologique (Sirris) garantit que les résultats ne resteront pas au stade de prototype. Ils pourront être rapidement intégrés dans des produits et services opérationnels.
Discutez de vos projets IA avec nos experts
Vous souhaitez explorer comment l’IA et l’edge computing peuvent sécuriser vos infrastructures ou optimiser votre analyse vidéo ? Contactez nos experts.
Source
- [1] S. Chen, Y. Yang, and Y. Hua, "Semi-Supervised Active Learning for Object Detection", Electronics 2023,12, 375.