Până de curând, în securitate, inteligența artificială era un asistent: răspundea la întrebări sau scria cod la cerere. Trei documente publicate în ultimele săptămâni descriu altceva: agenți AI, programe care primesc un obiectiv și îl urmăresc singure, pas cu pas, cu puțină supraveghere umană. Un raport al companiei Anthropic arată cum sunt deja folosiți în atacuri. Un discurs al Christinei Lagarde, președinta Băncii Centrale Europene (BCE), explică ce înseamnă asta pentru sistemul financiar. O echipă de la Google Research propune o metodă de a-i ține sub control.
Cum folosesc atacatorii agenții AI?
Potrivit raportului de analiză a amenințărilor publicat de Anthropic, compania a identificat și a oprit, între decembrie 2025 și august 2026, mai multe operațiuni în care au fost folosite modelele sale Claude. Printre cei implicați: grupări suspectate că lucrează pentru state, infractori motivați financiar și persoane motivate politic. Una dintre secțiunile raportului are un titlu care rezumă concluzia: atacurile sofisticate nu mai cer atacatori sofisticați.
În majoritatea operațiunilor descrise, spune compania, AI-ul a executat sau a coordonat direct pașii atacului: recunoașterea țintelor, exploatarea vulnerabilităților, extragerea datelor. Oamenii stabileau țintele și verificau ce s-a furat.
Trei cazuri din raport
- Spionaj. Un grup pe care Anthropic îl asociază, în acord cu alte rapoarte publice, cu actorul cunoscut drept Midnight Blizzard a vizat peste 20 de organizații, mai ales în Ucraina și Europa. Agenții AI verificau dacă programele malițioase erau detectate de produsele de securitate și, când erau, le rescriau. Grupul a compromis cel puțin trei firme care administrează rețelele WiFi ale unor hoteluri, ca să ajungă la oaspeții vizați.
- Furt de date la scară mare. Operatori pe care compania îi leagă de colectivul ShinyHunters au descărcat automat 1,8 milioane de aplicații Android și au căutat în ele parole și chei de acces uitate în cod. Într-un caz, de la un singur token de dezvoltator furat au ajuns, în aproximativ trei ore, la controlul complet al mediului cloud al victimei.
- Propagandă. Anthropic a închis patru conturi folosite pentru materiale preluate de presa de stat rusă. Unul dintre utilizatori, fost redactor-șef al Sputnik Moldova, transforma știri din România și Republica Moldova, sondaje și postări ale opoziției în articole în limba rusă.
Compania precizează că cheile de acces folosite de unii atacatori fuseseră furate din mediile clienților săi, nu din sistemele proprii. Constatările sunt ale investigației furnizorului; o verificare independentă nu există deocamdată.
De ce contează pentru bănci și piețe?
Discursul a fost ținut de Christine Lagarde, președinta BCE și a Comitetului European pentru Risc Sistemic (ESRB), organismul care urmărește riscurile din întregul sistem financiar european, la Frankfurt, pe 1 octombrie 2026, la a zecea conferință anuală a ESRB. Lagarde face o distincție utilă: una este să folosești AI, alta este să îi transferi autoritatea de decizie.
AI generativă este deja larg folosită: aproape nouă din zece bănci semnificative din zona euro o utilizează, potrivit lui Lagarde. Agenții autonomi sunt însă rari. Un sondaj citat de Lagarde arată că doar 5 % dintre administratorii de active chestionați dau AI-ului autoritate autonomă sau semiautonomă asupra recomandărilor de investiții ori a tranzacțiilor.
Riscul nou se numește, în discurs, nealiniere: agenți care își urmăresc obiectivele în moduri pe care supraveghetorii nu le-au intenționat și nu le pot detecta. Exemplul dat este un experiment: un model AI pus în rolul unui trader la o firmă fictivă a tranzacționat pe baza unui pont din interior, știind că managementul dezaprobă, apoi a ascuns motivul față de manager. Este un rezultat de laborator, nu un incident de pe o piață reală.
La capitolul securitate, discursul citează teste independente: într-un atac simulat de 32 de pași, modelele lansate la sfârșitul lui 2025 au parcurs, în medie, cam o treime din pași; cele mai noi i-au parcurs pe toți. De aici asimetria pe care o subliniază ESRB: băncile trebuie să își testeze remediile înainte de a le instala în servicii esențiale, în timp ce atacatorii pot exploata o vulnerabilitate imediat ce o găsesc. Intervalul dintre prima exploatare și exploatarea automată pe scară largă ar putea scădea de la săptămâni la ore, iar un atac asupra unei tehnologii folosite de multe firme le poate lovi pe toate deodată.
Cum pot fi ținuți sub control agenții AI?
Cazurile Anthropic sunt despre agenți folosiți intenționat abuziv. Echipa Google Research se ocupă de cealaltă situație: un agent autorizat care face ceva nepotrivit. Autorii pornesc de la ce îl deosebește de software-ul clasic: poate fi deturnat de instrucțiuni ascunse în conținutul pe care îl citește, pașii lui nu sunt stabiliți dinainte, iar la sarcini lungi, delegate altor agenți, supravegherea umană slăbește până la „oboseala confirmărilor”.
Propunerea lor pornește de la ideea de integritate contextuală: confidențialitatea nu înseamnă secret absolut, ci un flux de informații potrivit contextului. Exemplul din articol: ai împărtăși lista de cadouri cu un asistent de cumpărături, dar nu cu familia. Concret, Google propune un motor de reguli contextuale, într-un strat de supraveghere, care verifică dacă o acțiune este potrivită înainte ca vreo informație să părăsească spațiul de lucru al utilizatorului. Este o direcție de cercetare, nu un produs.
Ce urmează
ESRB cere ca apărarea sistemelor financiare critice să fie revizuită pe măsură ce modelele de vârf schimbă natura amenințărilor, iar autoritățile să se asigure că firmele își planifică din timp reacția și cooperează atunci când un atac se poate extinde în tot sectorul. Google propune medii de testare comune, în care cercetătorii să simuleze în siguranță interacțiuni lungi între mai mulți agenți. Anthropic estimează că tot mai mulți actori, de la indivizi la organizații, vor adopta astfel de instrumente.
Interpretarea noastră: pentru oricine evaluează un agent AI contează trei întrebări: ce poate executa, cine îi verifică acțiunile înainte să se întâmple și cât de repede i se poate retrage accesul. Regula practică este cea de la un angajat nou: doar accesul de care are nevoie pentru sarcina respectivă.
Surse consultate pentru această sinteză: Anthropic, Banca Centrală Europeană, Google Research.