IA frugale : la promesse d’une nouvelle approche de reconnaissance d’images
- Selon le neuroscientifique Simon Thorpe, l’élément déterminant pour comprendre la construction d’une image dans le cerveau est l’ordre dans lequel les neurones de la rétine envoient des signaux électriques au cerveau.
- Dès les années 1980, il a développé un modèle d’IA pour la reconnaissance d’images fondé sur ce principe.
- Ce modèle a été exploité commercialement dès 1999 pour identifier des logos publicitaires dans des événements sportifs.
- Par la suite supplanté par les modèles actuels, basés sur la science statistique, ce modèle se veut beaucoup plus frugal, ce qui pourrait aujourd’hui lui conférer un avantage concurrentiel.
- Microsoft et l’entreprise française Mistral AI ont sortis leurs propres modèles d’IA frugales : Phi 3 et Mistral 7B.
Les neurones émettent des signaux électriques pour communiquer entre eux et avec d’autres cellules (comme celles des muscles et des différentes glandes). L’amplitude de chaque signal électrique est d’environ 100 millivolts. Cette donnée ne change pas quel que soit le neurone, quelle que soit l’information. Mais le neurone ne délivrera aucun signal électrique si le stimulus auquel il est confronté et sur lequel il souhaite donner une information est trop faible. Autrement dit, c’est la présence ou l’absence de signal électrique qui est une information en soi, et non la variation de son amplitude.
« Mais les signaux électriques sont extrêmement rares, » indique Simon Thorpe. « Pour moi, ce qui compte pour transmettre une image et sa composition, de la rétine jusqu’au cerveau, ce qui compte avant tout c’est l’ordre dans lequel les signaux électriques partent des 100 millions de neurones que possèdent chaque rétine, pour aller jusqu’au cerveau. » Les premiers signaux électriques viendront déterminer les points les plus brillants ou les plus contrastés, puis l’image se construira progressivement en allant du plus lumineux au moins lumineux, jusqu’à ce que les stimuli soient trop faibles pour initier un signal électrique de la part des neurones.
Reconnaissance d’images
C’est sur cette assise théorique développée dès les années 1980 par Simon Thorpe, qu’il a construit les bases de son propre modèle d’intelligence artificielle pour la reconnaissance d’objets à l’intérieur de paysages. En effet, les bords d’un objet à l’intérieur d’une image peuvent être comparés à des changements brutaux de luminosité. Ce qui le rend facilement identifiable par son modèle. « Et, s’il y a un visage dans cette image, on peut le détecter par exemple grâce à l’identification d’un bord supérieur – le haut du crâne, d’un bord inférieur – le menton et d’un bord intermédiaire, la bouche », complète Simon Thorpe.
En 1999, Simon Thorpe a co-fondé Spikenet Technology, une société de traitement d’images basée sur cette technologie. Elle avait pour objectif notamment d’identifier les logos sur le parcours d’événements sportifs comme le cyclisme ou la Formule 1, pour aider les services marketing à mieux optimiser leurs placements. « C’était un marché qui se développait beaucoup à l’époque, sur les événements physiques comme sur les espaces numériques. Les professionnels voulaient utiliser ce type de technologie pour optimiser le placement de leur pub, afin qu’elles touchent le public sans qu’il se sente envahi », souligne Jean-Gabriel Ganascia, professeur à la Sorbonne, spécialiste de ces questions.
Retour vers le futur
De 2010 à 2017, un concours célèbre dans le milieu, nommé ImageNet Large Scale Visual Recognition Challenge (ILSVRC), faisait se côtoyer des équipes de chercheurs venant du monde entier, qui soumettait leurs modèles pour classer des banques d’images. En 2012, un modèle basé sur la science statistique a remporté ce concours. Cet événement a contribué à rendre dominant ce type de modèle – à la base des LLM (Large Language Models), sur la scène mondiale. « En effet, les modèles basés sur la science statistique étaient alors considérés comme ayant une marge d’erreur moindre que ceux basés sur les neurosciences », indique Jean-Gabriel Ganascia.
« Pour les modèles comme le mien, le momentum était passé, indique Simon Thorpe. Mais – l’actualité récente nous le montre bien, nous nous apercevons que ces modèles-là sont très coûteux en énergie ». Ce, notamment à cause des quantités astronomiques d’images qu’ils doivent parcourir pour la phase d’apprentissage, afin d’apprendre à dissocier une casserole d’un tambour. « Or ce n’est pas de cette façon que l’être humain fonctionne. Sinon, 10 ans d’éducation ne suffiraient pas pour passer son baccalauréat ! », s’exclame Simon Thorpe.
Le modèle de Simon Thorpe travaille en deux phases successives : d’abord, l’identification d’une image en se basant sur l’ordre des décharges plutôt que sur leur amplitude pour construire le sens d’une image. Ensuite, cette image est mémorisée dans un système dit de « neurones silencieux ». Ce sont les équivalents numériques de connexions neuronales inactives dans le cerveau qui apprennent puis se mettent en veille – pour éviter la surcharge au cerveau. Puis, ils peuvent se réactiver quand l’image revient sous les yeux.
De fait, il s’inscrit dans la lignée des modèles d’IA dites frugales, qui cherche à atteindre leurs objectifs avec le minimum de ressources, plutôt qu’avec le maximum de puissance. Pour exemple, la multinationale Microsoft et l’entreprise française Mistral AI ont aussi sortis leurs propres modèles d’IA frugales : Phi 3 et Mistral 7B. Ces derniers travaillent sur des banques de données restreintes pour leur apprentissage, et se basent sur la science statistique.

