Accueil / Chroniques / IA frugale : la promesse d’une nouvelle approche de reconnaissance d’images
Généré par l'IA / Generated using AI
π Numérique π Science et technologies

IA frugale : la promesse d’une nouvelle approche de reconnaissance d’images

Jean-Gabriel Ganascia
Jean-Gabriel Ganascia
professeur émérite d’informatique à la faculté des sciences de Sorbonne Université et philosophe
Avatar
Simon Thorpe
directeur de recherche émérite au CNRS
En bref
  • Selon le neuroscientifique Simon Thorpe, l’élément déterminant pour comprendre la construction d’une image dans le cerveau est l’ordre dans lequel les neurones de la rétine envoient des signaux électriques au cerveau.
  • Dès les années 1980, il a développé un modèle d’IA pour la reconnaissance d’images fondé sur ce principe.
  • Ce modèle a été exploité commercialement dès 1999 pour identifier des logos publicitaires dans des événements sportifs.
  • Par la suite supplanté par les modèles actuels, basés sur la science statistique, ce modèle se veut beaucoup plus frugal, ce qui pourrait aujourd’hui lui conférer un avantage concurrentiel.
  • Microsoft et l’entreprise française Mistral AI ont sortis leurs propres modèles d’IA frugales : Phi 3 et Mistral 7B.

Les neu­rones émettent des signaux élec­triques pour com­mu­ni­quer entre eux et avec d’autres cel­lules (comme celles des muscles et des dif­fé­rentes glandes). L’amplitude de chaque signal élec­trique est d’environ 100 mil­li­volts. Cette don­née ne change pas quel que soit le neu­rone, quelle que soit l’information. Mais le neu­rone ne déli­vre­ra aucun signal élec­trique si le sti­mu­lus auquel il est confron­té et sur lequel il sou­haite don­ner une infor­ma­tion est trop faible. Autre­ment dit, c’est la pré­sence ou l’absence de signal élec­trique qui est une infor­ma­tion en soi, et non la varia­tion de son amplitude.

« Mais les signaux élec­triques sont extrê­me­ment rares, » indique Simon Thorpe. « Pour moi, ce qui compte pour trans­mettre une image et sa com­po­si­tion, de la rétine jusqu’au cer­veau, ce qui compte avant tout c’est l’ordre dans lequel les signaux élec­triques partent des 100 mil­lions de neu­rones que pos­sèdent chaque rétine, pour aller jusqu’au cer­veau. » Les pre­miers signaux élec­triques vien­dront déter­mi­ner les points les plus brillants ou les plus contras­tés, puis l’image se construi­ra pro­gres­si­ve­ment en allant du plus lumi­neux au moins lumi­neux, jusqu’à ce que les sti­mu­li soient trop faibles pour ini­tier un signal élec­trique de la part des neurones.

Reconnaissance d’images

C’est sur cette assise théo­rique déve­lop­pée dès les années 1980 par Simon Thorpe, qu’il a construit les bases de son propre modèle d’intelligence arti­fi­cielle pour la recon­nais­sance d’objets à l’intérieur de pay­sages. En effet, les bords d’un objet à l’intérieur d’une image peuvent être com­pa­rés à des chan­ge­ments bru­taux de lumi­no­si­té. Ce qui le rend faci­le­ment iden­ti­fiable par son modèle. « Et, s’il y a un visage dans cette image, on peut le détec­ter par exemple grâce à l’identification d’un bord supé­rieur – le haut du crâne, d’un bord infé­rieur – le men­ton et d’un bord inter­mé­diaire, la bouche », com­plète Simon Thorpe.

En 1999, Simon Thorpe a co-fon­dé Spi­ke­net Tech­no­lo­gy, une socié­té de trai­te­ment d’images basée sur cette tech­no­lo­gie. Elle avait pour objec­tif notam­ment d’identifier les logos sur le par­cours d’événements spor­tifs comme le cyclisme ou la For­mule 1, pour aider les ser­vices mar­ke­ting à mieux opti­mi­ser leurs pla­ce­ments. « C’était un mar­ché qui se déve­lop­pait beau­coup à l’époque, sur les évé­ne­ments phy­siques comme sur les espaces numé­riques. Les pro­fes­sion­nels vou­laient uti­li­ser ce type de tech­no­lo­gie pour opti­mi­ser le pla­ce­ment de leur pub, afin qu’elles touchent le public sans qu’il se sente enva­hi », sou­ligne Jean-Gabriel Ganas­cia, pro­fes­seur à la Sor­bonne, spé­cia­liste de ces questions.

Retour vers le futur

De 2010 à 2017, un concours célèbre dans le milieu, nom­mé Ima­ge­Net Large Scale Visual Recog­ni­tion Chal­lenge (ILSVRC), fai­sait se côtoyer des équipes de cher­cheurs venant du monde entier, qui sou­met­tait leurs modèles pour clas­ser des banques d’images. En 2012, un modèle basé sur la science sta­tis­tique a rem­por­té ce concours. Cet évé­ne­ment a contri­bué à rendre domi­nant ce type de modèle – à la base des LLM (Large Lan­guage Models), sur la scène mon­diale. « En effet, les modèles basés sur la science sta­tis­tique étaient alors consi­dé­rés comme ayant une marge d’erreur moindre que ceux basés sur les neu­ros­ciences », indique Jean-Gabriel Ganascia.

« Pour les modèles comme le mien, le momen­tum était pas­sé, indique Simon Thorpe. Mais – l’actualité récente nous le montre bien, nous nous aper­ce­vons que ces modèles-là sont très coû­teux en éner­gie ». Ce, notam­ment à cause des quan­ti­tés astro­no­miques d’images qu’ils doivent par­cou­rir pour la phase d’apprentissage, afin d’apprendre à dis­so­cier une cas­se­role d’un tam­bour. « Or ce n’est pas de cette façon que l’être humain fonc­tionne. Sinon, 10 ans d’éducation ne suf­fi­raient pas pour pas­ser son bac­ca­lau­réat ! », s’exclame Simon Thorpe.

Le modèle de Simon Thorpe tra­vaille en deux phases suc­ces­sives : d’abord, l’identification d’une image en se basant sur l’ordre des décharges plu­tôt que sur leur ampli­tude pour construire le sens d’une image. Ensuite, cette image est mémo­ri­sée dans un sys­tème dit de « neu­rones silen­cieux ». Ce sont les équi­va­lents numé­riques de connexions neu­ro­nales inac­tives dans le cer­veau qui apprennent puis se mettent en veille – pour évi­ter la sur­charge au cer­veau. Puis, ils peuvent se réac­ti­ver quand l’image revient sous les yeux.

De fait, il s’inscrit dans la lignée des modèles d’IA dites fru­gales, qui cherche à atteindre leurs objec­tifs avec le mini­mum de res­sources, plu­tôt qu’avec le maxi­mum de puis­sance. Pour exemple, la mul­ti­na­tio­nale Micro­soft et l’entreprise fran­çaise Mis­tral AI ont aus­si sor­tis leurs propres modèles d’IA fru­gales : Phi 3 et Mis­tral 7B. Ces der­niers tra­vaillent sur des banques de don­nées res­treintes pour leur appren­tis­sage, et se basent sur la science statistique.

Guénolé Boillot

Le monde expliqué par la science. Une fois par semaine, dans votre boîte mail.

Recevoir la newsletter