Résumé:
- Les chercheurs de HiddenLayer ont développé une nouvelle attaque sur les grands modèles de langage (LLM) appelée TokenBreaker.
- En ajoutant ou en modifiant un seul caractère, ils peuvent contourner certains mécanismes de sécurité.
- Les modèles de langage de base (LLM) sont toujours capables de comprendre l’intention de l’attaque.
Les chercheurs en sécurité ont découvert un moyen de contourner les mécanismes de protection intégrés dans certains Grands modèles de langage (LLM) et le faire répondre aux allégations malveillantes.
Kieran Evans, Casimir Schulz et Kenneth Young de HiddenLayer ont publié un rapport approfondi sur une nouvelle technique d'attaque qu'ils appellent TokenBreak, qui cible la façon dont certains grands modèles de langage (LLM) divisent le texte en jetons, en particulier ceux utilisant les stratégies Byte Pair Encoding (BPE) ou WordPiece.

La tokenisation consiste à décomposer un texte en unités plus petites appelées jetons, qui peuvent être des mots, des parties de mots ou des caractères, et que les grands modèles linguistiques (LLM) utilisent pour comprendre et générer le langage. Par exemple, le mot « unhappiness » peut être décomposé en « un », « happi » et « ness », et chaque jeton est ensuite converti en un identifiant numérique que le modèle peut traiter (les LLM ne lisant pas de texte brut, mais des nombres). Cette attaque représente une menace croissante pour la cybersécurité, obligeant les organisations et les chercheurs à développer des stratégies de défense avancées pour protéger leurs systèmes d'IA.
Qu'est-ce que finstructions ?
Finstructions s'appuie sur l'ajout de caractères supplémentaires aux mots-clés (par exemple, en transformant « instructions » en « finstructions »), permettant aux attaquants de tromper les modèles de sécurité en leur faisant croire que le code est inoffensif.
En revanche, le modèle de langage étendu (LLM) ciblé reste capable de comprendre l'intention initiale des instructions, ce qui permet aux attaquants de faire passer du code malveillant à travers les défenses sans être détectés. Cette vulnérabilité représente un risque de sécurité important pour les systèmes d'IA.
Cette technologie pourrait être utilisée, entre autres, pour contourner les filtres anti-spam alimentés par l'IA et diffuser du contenu malveillant dans les boîtes de réception des utilisateurs, augmentant ainsi le risque d'attaques de phishing et de logiciels malveillants.
Par exemple, si un filtre anti-spam est programmé pour bloquer les messages contenant le mot « loterie », il pourrait laisser passer un message indiquant « Vous avez gagné à la loterie ! », exposant ainsi les destinataires à des pages de destination potentiellement malveillantes, des infections par des logiciels malveillants, etc. Cette manipulation linguistique permet de contourner les mécanismes de sécurité.
« Cette technique d’attaque manipule le texte d’entrée d’une manière qui amène certains modèles à donner des classifications incorrectes », ont expliqué les chercheurs.
« Plus important encore, la cible finale (le grand modèle de langage ou le destinataire du courrier électronique) peut toujours comprendre et répondre au texte manipulé, et donc être vulnérable à l’attaque que le modèle de protection a été spécifiquement conçu pour empêcher », ont-ils ajouté.
HiddenLayer a ajouté que les modèles utilisant des segmenteurs de mots Unigram sont résistants à ce type de manipulation. Par conséquent, une stratégie d'atténuation consiste à choisir des modèles dotés de méthodes de segmentation plus robustes.










