
Claude Mythos Preview poate găsi vulnerabilități de securitate pe care cercetătorii umani le-au ratat decenii întregi. Compania îl ține secret, dar trage un semnal de alarmă: era în care AI-ul putea fi periculos doar teoretic s-a încheiat.
UN MODEL PREA PERICULOS PENTRU PUBLIC
Anthropic, una dintre cele mai influente companii de inteligență artificială din lume, a anunțat că a dezvoltat un nou model AI pe care a decis să nu îl lanseze publicului larg. Motivul invocat nu este lipsa de maturitate tehnică, ci exact opusul: modelul este prea capabil.
Botezat Claude Mythos Preview – dezvoltat intern sub numele de cod „Capybara” – noul sistem a fost descris de conducerea Anthropic drept un „moment de cotitură” în evoluția inteligenței artificiale, cu performanțe semnificativ superioare generațiilor anterioare în două domenii în particular: scrierea de cod și cercetarea de securitate cibernetică. Tocmai această a doua capabilitate a ridicat semne de întrebare serioase în interiorul companiei.
„Acesta este modelul cel mai puțin capabil la care vom avea acces în viitor.” (Jared Kaplan, director științific Anthropic)
CE POATE FACE CONCRET
Potrivit declarațiilor oficiale ale Anthropic, Claude Mythos Preview este capabil să execute cercetare autonomă de securitate cibernetică: să scaneze cod, să identifice breșe și chiar să construiască instrumente de exploatare a acestora, fără supraveghere umană directă. Mai îngrijorător: aceste operațiuni pot fi declanșate de utilizatori fără pregătire tehnică de specialitate, prin comenzi simple în limbaj natural.
Compania susține că modelul a identificat deja mii de vulnerabilități în programe software utilizate pe scară largă, inclusiv în toate sistemele de operare și browserele majore. Printre descoperiri: o vulnerabilitate în OpenBSD – un sistem de operare proiectat special pentru securitate maximă, pe care o rulează nenumărate routere și firewall-uri din infrastructura internetului – care exista nedetectată de 27 de ani. O altă breșă găsită fusese scanată de instrumente automate de cinci milioane de ori, fără rezultat.
„Modelul a găsit vulnerabilități suficient de sofisticate încât au scăpat atât deceniilor de cercetători umani, cât și tuturor instrumentelor automate concepute să le detecteze.” (Logan Graham, șeful echipei de testare a capabilităților periculoase, Anthropic)
PROIECTUL GLASSWING: O COALIȚIE DE APĂRARE
În loc să lanseze modelul pe piață, Anthropic a ales o cale intermediară: pune Claude Mythos Preview la dispoziția unui consorțiu de peste 40 de companii și organizații tehnologice, reunite sub umbrela Project Glasswing. Din consorțiu fac parte Apple, Amazon, Microsoft, Google — inclusiv concurenți direcți ai Anthropic — alături de producători de hardware precum Cisco și Broadcom, și organizații care gestionează infrastructură open-source critică, printre care Linux Foundation.
Obiectivul declarat este folosirea modelului în scop defensiv: identificarea și remedierea vulnerabilităților din software-ul critic înainte ca acestea să fie exploatate de actori malițioși. Anthropic alocă fonduri de până la 100 de milioane de dolari în credite de utilizare Claude pentru această inițiativă.
Numele proiectului face trimitere la fluturele glasswing, ale cărui aripi transparente îi permit să se ascundă la vedere. Analogia este deliberată: cele mai periculoase vulnerabilități din infrastructura digitală mondială nu sunt neapărat ascunse adânc în sisteme obscure – ele zac în cod deschis, accesibil, pe care nimeni nu l-a privit suficient de atent.
PROJECT GLASSWING — DATE ESENȚIALE
- Peste 40 de companii partenere: Apple, Amazon, Microsoft, Google, Cisco, Broadcom, Linux Foundation
- 100 milioane dolari în credite Claude alocate de Anthropic pentru inițiativă
- Mii de vulnerabilități identificate, inclusiv o breșă de 27 de ani în OpenBSD
- Venituri Anthropic: peste 30 miliarde dolari în 2026, de trei ori mai mult față de 2025
PARADOXUL ANTHROPIC: CONSTRUIEȘTI PERICOLUL, ÎL ANUNȚI PUBLIC
Decizia Anthropic de a anunța public un model pe care refuză să îl lanseze nu este lipsită de precedent. În 2019, OpenAI a urmat o strategie similară cu GPT-2, susținând că potențialul de dezinformare al modelului impunea o lansare graduală. Mulți dintre cercetătorii implicați în acel proiect au plecat ulterior din OpenAI pentru a fonda tocmai Anthropic.
De data aceasta, miza declarată este diferită și mai concretă. Nu mai vorbim de riscuri abstracte legate de conținut generat. Vorbim de capacitatea unui sistem AI de a ataca autonom infrastructura digitală critică — rețele electrice, sisteme bancare, servicii medicale, comunicații guvernamentale — exploatând breșe pe care niciun om și niciun instrument automatizat nu le-a găsit până acum.
Anthropic ocupă o poziție incomodă, pe care și-a asumat-o deliberat: construiește sisteme din ce în ce mai puternice, le vinde companiilor din toată lumea — veniturile au depășit 30 de miliarde de dolari în 2026, de trei ori mai mult față de anul precedent — și, simultan, trage semnale de alarmă despre pericolele pe care chiar aceste sisteme le generează. Compania a intrat deja în conflict cu Pentagonul, care a desemnat-o risc pentru lanțul de aprovizionare după ce Anthropic a impus limitări privind utilizarea militară a tehnologiei sale.
„Imaginați-vă o armată de agenți care cataloghează metodic fiecare slăbiciune din infrastructura voastră tehnologică, în permanență.” (Nikesh Arora, CEO Palo Alto Networks)
ÎNTREBAREA PE CARE NIMENI NU VREA SĂ O PUNĂ CU VOCE TARE
Dincolo de anunțuri și de consorții, Claude Mythos Preview ridică o problemă structurală pe care Logan Graham, șeful echipei de testare Anthropic, o formulează direct: dacă tot software-ul critic din lume a fost „securizat” parțial datorită faptului că atacarea lui necesita efort uman enorm, ce se întâmplă când acel efort devine instantaneu și automat?
Răspunsul implicit al Anthropic este că vor exista modele similare în curând – la concurenți, la actori statali, la grupări criminale. Capabilitatea nu poate fi îngropată. Singura opțiune realistă este să o folosești mai repede în apărare decât o vor folosi alții în atac.
Elia Zaitsev, directorul de tehnologie al CrowdStrike, unul dintre membrii Project Glasswing, a confirmat că modelul reprezintă „un risc semnificativ de securitate cibernetică” și că adversarii vor căuta inevitabil să exploateze aceleași capabilități. „Ceea ce odinioară lua luni se întâmplă acum în minute cu AI”, a declarat Zaitsev.
CONCLUZIE: CEL MAI PUȚIN CAPABIL MODEL PE CARE ÎL VOM VEDEA
Anthropic nu pretinde că a rezolvat problema. Pretinde că a identificat-o cu suficientă precizie încât să fie obligată să o anunțe. Faptul că Claude Mythos Preview nu va fi disponibil publicului nu înseamnă că amenințarea pe care o reprezintă va rămâne conținută. Capabilitățile de securitate cibernetică ale modelului nu sunt rezultatul unui antrenament special — sunt o consecință naturală a faptului că un sistem bun la scris cod este, prin construcție, și bun la găsit greșeli în cod.
Pe măsură ce modelele AI continuă să se îmbunătățească, această capabilitate se va răspândi. Project Glasswing este, în esență, un pariu: că infrastructura digitală mondială poate fi auditată și consolidată mai repede decât va fi atacată. Este un pariu rezonabil. Dar și unul pe care omenirea nu și l-a mai asumat niciodată la această scară.
Iar ceasul, după cum sugerează Anthropic, deja merge.
Articol elaborat pe baza reportajului „Anthropic Claims Its New A.I. Model, Mythos, Is a Cybersecurity ‘Reckoning’” de Kevin Roose, publicat în New York Times la 17 aprilie 2026, și a informațiilor publice furnizate de Anthropic. Citatele reprezentanților companiei și partenerilor Project Glasswing provin din sursa originală.






