Cum pot fi ocolite măsurile de siguranță ale inteligenței artificiale. Cercetătorii avertizează asupra unor metode noi

INTELIGENȚA ARTIFICIALĂ. Specialiștii în securitate cibernetică avertizează asupra apariției unor metode noi prin care pot fi ocolite mecanismele de siguranță ale modelelor de inteligență artificială generativă. Aceste tehnici ar putea permite generarea de conținut periculos sau ilegal dacă nu sunt identificate și blocate la timp.

Un avertisment a fost emis de CERT Coordination Center, care a analizat modul în care anumite prompturi și interacțiuni pot compromite sistemele de protecție ale platformelor AI.

Prima metodă identificată poartă numele „Inception” și presupune folosirea unui scenariu imaginar care conține, la rândul lui, un alt scenariu fără limitări de siguranță. Prin formularea unor cereri succesive în interiorul acestei structuri, utilizatorii pot încerca să determine modelul AI să genereze conținut care în mod normal ar fi blocat.

A doua metodă exploatează o strategie diferită. Utilizatorul solicită informații despre modul în care inteligența artificială nu ar trebui să răspundă la o anumită întrebare. Alternând solicitări legitime cu unele problematice, sistemul poate fi uneori păcălit să ofere răspunsuri pe care mecanismele de protecție ar trebui să le evite.

Cercetătorii spun că aceste tehnici ar putea afecta mai multe servicii AI populare, inclusiv ChatGPT, Claude, Microsoft Copilot, Gemini, Grok, Meta AI și Mistral AI.

Dacă astfel de vulnerabilități sunt exploatate, modelele ar putea genera conținut legat de subiecte sensibile, precum droguri, arme, tehnici de phishing sau cod malware.

În afară de aceste două metode, cercetătorii au identificat și alte tipuri de atacuri asupra sistemelor AI.

Un exemplu este Context Compliance Attack, care implică introducerea unei replici aparent inofensive într-un istoric de conversație pentru a determina modelul să ofere informații sensibile.

O altă tehnică este Policy Puppetry Attack, unde comportamentul modelului poate fi manipulat prin injectarea unor prompturi ascunse în fișiere de configurare precum XML, INI sau JSON.

De asemenea, Memory Injection Attack urmărește coruperea memoriei unui agent AI prin interacțiuni repetate și atent construite, influențând modul în care sistemul răspunde ulterior la cereri.

Specialiștii atrag atenția și asupra riscurilor din domeniul dezvoltării software cu ajutorul inteligenței artificiale. Codul generat automat poate conține vulnerabilități, mai ales atunci când prompturile nu sunt suficient de clare sau sunt interpretate greșit de model.

În plus, trecerea la versiuni noi ale modelelor AI poate introduce vulnerabilități neașteptate. Unele analize arată că anumite modele recente pot fi mai predispuse la comportamente neadecvate sau utilizări greșite comparativ cu versiunile anterioare.

Un alt posibil punct vulnerabil este Model Context Protocol (MCP), un standard creat pentru conectarea modelelor AI la surse externe de date și instrumente. Dacă un server MCP este compromis, există riscul ca acesta să extragă date sensibile sau chiar să influențeze modul în care funcționează agentul AI.

Specialiștii în securitate subliniază că aceste descoperiri nu înseamnă neapărat că sistemele AI sunt nesigure, dar arată cât de importantă este dezvoltarea continuă a mecanismelor de protecție pe măsură ce tehnologia evoluează.

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *

Ultimele articole

Articole Similare