Cum poți fura date personale de la un chatbot AI fără nicio interacțiune suspectă din partea utilizatorului? Cercetătorii de la Adversa AI, conduși de Rony Utevsky, au găsit răspunsul pentru Grok, asistentul AI al companiei xAI: o tehnică nouă, numită „cryptographic context injection" (injecție de context criptografic), care transformă o cerere banală — „rezumă-mi această pagină" — într-un canal de scurgere de date, fără nicio confirmare din partea utilizatorului.

Cum funcționează atacul, pas cu pas

Un atacator ascunde într-o pagină web un bloc de text criptat, însoțit de cheia de decriptare și de instrucțiuni. Când un utilizator îi cere lui Grok să rezume acea pagină, chatbot-ul rulează cod Python pentru a decripta blocul, folosind algoritmii standard PBKDF2 și AES-256-GCM. Aici e trucul: textul decriptat ajunge în „contextul" modelului ca rezultat al rulării de cod, nu ca text vizibil de pe pagină — ceea ce îi permite să treacă neobservat de filtrele care ar bloca, în mod normal, instrucțiuni ascunse pe o pagină web. Instrucțiunile decriptate îi cer apoi lui Grok să construiască o „cheie de decriptare" falsă, care conține de fapt datele din sesiunea curentă a utilizatorului — nume, locație aproximativă, tipul de abonament și conversația în desfășurare — și să o atașeze la adresa unui link. Grok își folosește propriul instrument de navigare pentru a accesa acel link, trimițând astfel datele direct pe un server controlat de atacator.

O rată de succes de 40%

Adversa a testat tehnica de 20 de ori, începând din iunie 2026, cu o rată de reușită de 40% — eșecurile s-au datorat mai ales dificultăților lui Grok de a decripta corect textul, nu detectării atacului de către vreun mecanism de siguranță.

Raportat din iunie, ignorat până acum

Adversa a raportat vulnerabilitatea către xAI, prin programul de recompense HackerOne, încă din 3 iunie 2026. Au urmat două încercări de follow-up, pe 4 și 10 august, fără niciun răspuns din partea companiei. Cercetătorii au făcut publică descoperirea pe 20 august 2026. Până la acel moment, xAI nu emisese niciun patch, niciun identificator CVE și nicio declarație oficială.

Cum se descurcă restul modelelor AI

Adversa a testat aceeași tehnică și pe alți chatboți majori, cu rezultate diferite. Google Gemini (în modul „Deep Thinking") a căzut într-o capcană similară, ajungând să reproducă inclusiv instrucțiunile proprii de sistem — deși rata de succes a scăzut vizibil până în august. GPT-5 de la OpenAI a eșuat complet să interpreteze instrucțiunile de decriptare. Cel mai bine s-a descurcat Claude Sonnet 4.5 de la Anthropic, care a marcat pachetul primit drept „încercare de prompt injection" chiar și după ce l-a decriptat — un semn, potrivit Adversa, al unor mecanisme de apărare mai robuste decât ale competiției.

🤖 Inteligență Artificială
← Toate articolele
💬 Comentarii

Fii primul care comentează acest articol!

✍️ Lasă un comentariu
4 + 7 = ?