Securitatea modelelor LLM (Large Language Model) reprezintă practica de a verifica fișierele modelelor de IA pre-antrenate în vederea depistării codului rău intenționat încorporat, înainte ca acestea să fie încărcate într-un mediu. Fișierele de model în formate precum pickle, PyTorch, TensorFlow și Keras pot executa cod în momentul încărcării, ceea ce le transformă într-un risc pentru lanțul de aprovizionare echivalent cu rularea unui software neverificat.
Pe scurt / Concluzii cheie
- Modelele pre-antrenate descărcate de pe Hugging Face, Kaggle sau PyPI sunt cod executabil, nu date inerte
- Conform raportului „Software ” al JFrog, intit ulat „Supply Chain : State of the Union 2026”, 53% dintre organizații preiau modele direct din registrele publice, unde cercetătorii au identificat aproximativ 495 de modele malicioase capabile să fure date de autentificare și să compromită integral sistemul
- Formatele bazate pe Pickle (.pt, .pth, .bin, .pkl) execută funcții arbitrare prin intermediul instrucțiunii REDUCE în timpul încărcării, aceeași vulnerabilitate structurală prezentă și în graficele TensorFlow și în straturile Lambda din Keras
- Safetensors elimină complet motorul de execuție, dar sute de mii de modele în format vechi rămân în circulație, iar faptul că un fișier dintr-un depozit este sigur nu garantează că restul depozitului respectiv este la fel de sigur
- MetaDefender Aether™ examinează fișierele model pe cinci niveluri de analiză, detectând amenințări precum încărcăturile de tip „stacked pickle” care nu sunt identificate de scanerele tradiționale
Modelele de IA pre-antrenate reprezintă cod executabil care depășește o limită de încredere
Construirea unui model lingvistic de mari dimensiuni de la zero necesită date, resurse de calcul și timp de care majoritatea organizațiilor nu dispun. În schimb, echipele descarcă modele preantrenate de pe platforme publice precum Hugging Face, Kaggle și PyPI. Această dependență a creat un vector de atac la nivelul lanțului de aprovizionare pe care multe programe de securitate încă îl ignoră.
Organizațiile verifică deja bibliotecile open-source și imaginile de containere pe care le integrează în mediile lor. Puține dintre ele aplică același nivel de rigurozitate și modelelor de IA pe care echipele lor le descarcă, chiar dacă un fișier de model nu este doar o foaie de calcul cu numere. În funcție de formatul său, un fișier de model poate fi un program care se execută imediat ce este încărcat.
Numai Hugging Face găzduiește peste un milion de modele, dintre care majoritatea nu au fost supuse niciodată unei evaluări de siguranță. Conform raportului „Software ” al JFrog, intit ulat „Supply Chain : State of the Union 2026”, 53% dintre organizații preiau în prezent modele direct din registrele publice, iar cercetătorii au identificat aproximativ 495 de modele rău intenționate în aceste registre, capabile să fure date de autentificare, să execute cod și să compromită integral sistemul. Un model LLM este un software executabil care depășește o limită de încredere.
Cum au evoluat amenințările bazate pe modele de la teorie la tehnici de eludare
Amenințarea s-a dezvoltat în etape: avertismente academice, demonstrații de concept, abuzuri reale asupra lanțului de aprovizionare și tehnici de eludare menite să înșele scanerele.
Evoluția amenințărilor bazate pe modele, 2018–2026
Fază | Perioada de timp | Ce s-a schimbat | Exemple reprezentative |
Teorie | 2018 | Cercetătorii avertizează că modelele reutilizate și pre-antrenate provenite din surse nesigure pot fi manipulate | Atacuri prin reutilizarea modelelor asupra sistemelor de învățare profundă |
Demonstrație de concept | 2023–2024 | Au apărut modele cu adevărat dăunătoare; s-a demonstrat că formatele bazate pe „pickle” conțin încărcături active | star23/baller13, un model care utilizează o structură de tip „reverse shell”, a apărut pe Hugging Face |
În sălbăticie | 2024–2025 | Volumul crește, livrarea prin lanțul de aprovizionare realizându-se prin intermediul registrelor de colete | Pachetele PyPI sub marca Alibaba marchează apariția atacurilor asupra lanțului de aprovizionare al modelelor de limbaj mare (LLM) |
Tehnici avansate de evaziune | 2024–2025 | Încărcături dispuse în straturi și suprapuse, concepute pentru a eluda inspecțiile rapide | O versiune de test a programului „Stacked Pickle” a obținut un scor de 0/70 pe VirusTotal |
Un format mai sigur | 2023–2026 | Se introduce un format destinat exclusiv datelor, care nu poate transporta cod, însă modelele vechi continuă să fie utilizate pe scară largă | Safetensors devine opțiunea implicită pentru noile modele lansate |
Fișierele Pickle și PyTorch execută codul imediat ce sunt încărcate
Pickle este formatul nativ de serializare al limbajului Python și a reprezentat, timp de mulți ani, metoda standard de salvare a modelelor pe disc. PyTorch și-a construit fișierele .pt, .pth și .bin pe baza acestui format, iar numeroase modele au fost publicate în aceste formate. În prezent există opțiuni mai sigure, dar acestea au fost eliminate ca limbaj abstract de afaceri. O mare parte din modelele care circulă încă pe platformele publice rămân bazate pe Pickle, iar echipele le încarcă zilnic.

Pickle stochează mai mult decât simple date. Este un flux de instrucțiuni pe care o mașină virtuală îl execută în timpul încărcării fișierului și al reconstituirii obiectelor Python. Fluxul poate apela funcții arbitrare, astfel încât încărcarea unui model bazat pe Pickle poate duce și la executarea de cod.
Atacatorii exploatează instrucțiunea REDUCE din fișierul pickle, care îi indică încărcătorului să apeleze o funcție specificată cu argumente alese de atacator în timpul procesului de unpickling. Aceasta poate lansa un shell invers, poate descărca o sarcină utilă de a doua etapă sau poate suprascrie o cheie SSH, în timp ce modelul se încarcă în continuare și se comportă ca un fișier legitim.
TensorFlow și Keras prezintă riscuri similare. Graficele TensorFlow rău intenționate pot introduce în secret operatori de scriere în fișiere sau operatori de rețea în graficul de calcul, în timp ce straturile Lambda din Keras pot conține bytecode Python marshalat care se deserializează la încărcare. Fiecare format permite unui fișier să conțină comportament executabil. Acest risc este de natură structurală, astfel încât remedierea unei singure erori nu îl poate elimina. Această limitare a obligat industria să găsească un format mai sigur.

Incidentele din lumea reală au transformat teoria într-o amenințare de tip „ Supply Chain ”
Avertismentele privind atacurile de reutilizare a modelelor au apărut pentru prima dată în 2018. Ulterior, cercetătorii au demonstrat că acest risc era real în practică. În ianuarie 2024, un model numit star23/baller13 a apărut pe Hugging Face, conținând un reverse shell în interiorul unui fișier PyTorch. Acesta putea oferi acces la distanță, în timp ce se prezenta în continuare ca un model valid.



Până în mai 2025, amenințarea a pătruns în domeniul clasic al lanțului de aprovizionare. Atacatorii au publicat pachete PyPI denumite aliyun-ai-labs-snippets-sdk, ai-labs-snippets-sdk și aliyun-ai-labs-sdk, care se dădeau drept un set de instrumente AI al Alibaba și încărcau în secret un model rău intenționat în timpul utilizării. Pachetele au rămas active mai puțin de 24 de ore, dar au fost descărcate de aproximativ 1.600 de ori; un memento că o fereastră de expunere scurtă este mai mult decât suficientă atunci când descărcarea se realizează prin rezolvarea automată a dependențelor.

Încărcăturile de tip „Stacked Pickle” depășesc scanerele tradiționale
Până în 2024, atacatorii au început să vizeze scanerele concepute pentru a detecta modelele rău intenționate. Cel mai elocvent exemplu este tehnica „Stacked Pickle”, care imbrică mai multe obiecte „pickle” și distribuie instrucțiuni rău intenționate pe toate straturile, apoi le încorporează în procesul de compresie și codificare.
Fiecare strat pare inofensiv atunci când este examinat separat, astfel încât scanerele și verificările manuale care se opresc la suprafață nu descoperă nimic. Când modelul se încarcă, straturile se dezarhivează în ordine și reasamblează încărcătura utilă. Un eșantion de tip „proof-of-concept” creat folosind această tehnică nu a fost detectat de niciun motor de pe VirusTotal.
Un scaner care verifică doar stratul vizibil poate omite o încărcătură ascunsă mai adânc în fișier. Așa a reușit eșantionul să treacă de toate motoarele de scanare.

Safetensors elimină complet motorul de execuție
Safetensors stochează greutățile modelelor fără un motor de execuție. Un fișier conține un antet compact de metadate care descrie forma, tipul de date și offsetul în octeți al fiecărui tensor, urmat de octeții brute ai tensorului. Nu dispune de un flux de instrucțiuni, de o mașină virtuală sau de un echivalent al funcției REDUCE din pickle, astfel încât încărcătorul nu poate fi instruit să apeleze o funcție.
Un fișier Safetensors conține date inerte care sunt citite de programul de încărcare. Chiar și un fișier creat cu intenții rău intenționate nu poate executa cod la încărcare, deoarece formatul nu oferă nicio cale prin care acel cod să poată fi rulat.

De ce a fost creat Safetensors și de ce s-a răspândit
Problema cu formatele tradiționale nu a fost niciodată legată de ponderile în sine. Problema era că fișierul putea conține și instrucțiuni executabile. Hugging Face, în colaborare cu EleutherAI și Stability AI, a dezvoltat Safetensors ca o soluție special concepută pentru a înlocui formatele tradiționale, eliminând această capacitate și păstrând în același timp elementele de care echipele au nevoie dintr-un fișier de ponderi.
Safetensors este, de asemenea, practic. Se încarcă rapid prin accesul de tip „zero-copy” mapat în memorie, funcționează cu PyTorch, TensorFlow, JAX și alte framework-uri și a devenit opțiunea implicită pentru majoritatea noilor versiuni de modele. Aceste avantaje au contribuit la răspândirea sa fără a fi impusă în mod obligatoriu.

Un audit independent confirmă afirmația privind siguranța
Responsabilii cu întreținerea nu sunt singura sursă care susține această afirmație privind siguranța. Biblioteca este scrisă în Rust, al cărui compilator previne apariția unor categorii întregi de erori de parsare. În 2023, Hugging Face, EleutherAI și Stability AI au comandat în comun un audit independent al formatului, realizat de Trail of Bits.
Auditul nu a identificat nicio vulnerabilitate critică care să poată duce la executarea arbitrară a codului. Acesta a identificat câteva imprecisități în specificații și o validare lipsă care permitea existența fișierelor poliglot. Responsabilii cu întreținerea au remediat și publicat toate aceste probleme, apoi au setat Safetensors ca opțiune implicită.
Datele înregistrate de atunci confirmă concluziile auditului. Formatele vechi au generat incidente reale începând din 2024, în timp ce, în aceeași perioadă, nu a fost demonstrat niciun atac de execuție a codului îndreptat împotriva formatului Safetensors în sine. Safetensors nu oferă atacatorilor niciun mecanism de execuție pentru tipul de atac care face ca fișierele bazate pe „pickle” să fie periculoase. Riscul rămas provine din formatele vechi care sunt încă utilizate pe scară largă.
Modelul „ Supply Chain ” încă are nevoie de o trapă de inspecție
Riscul provine din faptul că un format de fișier de model poate sau nu să conțină cod alături de ponderile sale. Formatele Pickle, PyTorch, TensorFlow și Keras pot face acest lucru; formatul Safetensors nu poate, din cauza modului în care este conceput. Responsabilii cu securitatea trebuie să trateze formatele de model executabile ca pe un risc, să inspecteze fiecare model care intră în mediu și să îndrume echipele către formate sigure ori de câte ori este posibil.
Milioane de modele în formate vechi se află încă pe platformele publice, iar echipele continuă să le descarce. Un depozit poate distribui, de asemenea, un fișier în format pickle alături de unul sigur, astfel încât prezența ponderilor Safetensors nu garantează siguranța întregului depozit. Lanțul de aprovizionare cu modele va avea nevoie de un punct de control până când formatele vechi vor fi retrase din uz.
În practică, aceasta se transformă într-o listă de verificare scurtă, cu un număr redus de rezultate fals pozitive:
- Preferați fișierele Safetensors și tratați formatele mai vechi ca necesitând o verificare înainte de utilizare. Orice model cu extensia .pt, .pth, .bin, .pkl, .pb sau .h5 provenit de la un editor necertificat trebuie verificat înainte de a fi încărcat
- Tratați încărcarea unui model în format vechi ca pe un eveniment de execuție. O încărcare a modelului care generează un shell, deschide o conexiune de ieșire dintr-un interpretor Python sau scrie într-o cale sensibilă reprezintă un semnal comportamental care trebuie inclus în telemetria gazdei, la fel ca orice execuție de cod
- Analizați întregul artefact, nu doar fișierul cu ponderile. Unitatea de analiză este pachetul modelului așa cum este livrat, întrucât formatul unui depozit reprezintă o afirmație, nu o garanție, până când nu este verificat
Cum inspectează „ MetaDefender ” de la Aether, cu ajutorul unui pipeline cu cinci etape, fișierele modelelor LLM
MetaDefender Aether™, soluția unificată de detectare a vulnerabilităților de tip „zero-day” a companiei OPSWAT, asigură o eficacitate de detectare de 99,9% prin intermediul unui flux de inspecție pe cinci niveluri. Fiecare fișier trimis este supus mai întâi unei analize a tipului de fișier, care identifică fișierul în sine, fără a se baza exclusiv pe extensia acestuia. Fiecare nivel de analiză poate stabili verdictul în mod independent. Odată ce un nivel ajunge la un răspuns definitiv, analiza se oprește, astfel încât majoritatea fișierelor evită etapele mai aprofundate și mai costisitoare.
- Reputația amenințării. Hash-ul fișierului și indicatorii asociați sunt verificați în raport cu baza globală de informații privind amenințările de la OPSWAT, care se bazează pe peste 50 de miliarde de indicatori. Un hash asociat deja cu o încărcare malicioasă cunoscută este blocat în mai puțin de o secundă, iar un fișier considerat sigur este validat la fel de rapid, astfel încât doar fișierele necunoscute sunt lăsate să treacă mai departe.
- Analiză statică. Înainte ca orice program să fie executat, fișierul este evaluat de Predictive Alin AI, în paralel cu analiza statică și scanarea efectuată de motorul antivirus. Predictive Alin AI oferă verdictele bazate pe învățare automată în milisecunde, fără a recurge la detonarea în sandbox, fiind antrenat pe seturi de date corporative selectate cu grijă și sigure din punct de vedere al confidențialității și îmbunătățit continuu printr-un ciclu de reantrenare de tip „zero-day”, alimentat de detectările confirmate de MetaDefender Aether. În cazul fișierelor model, acesta este momentul în care un fișier „pickle” suspect, cu coduri de operație (opcode) recunoscute ale încărcăturii utile, este detectat înainte ca vreun timp de emulare să fie alocat acestuia.
- Analiza dinamică. Emularea la nivel de instrucțiune rezolvă problema „Stacked Pickle” prin dezvăluirea comportamentului unui fișier fără a fi necesară pornirea unei mașini virtuale complete pentru fiecare eșantion. Aceasta eludează verificările anti-VM și întârzierile de timp care ocolesc sandbox-urile tradiționale, finalizând analiza în câteva secunde, în loc de minute, cu o viteză de până la 20 de ori mai mare și un volum de până la 100 de ori mai mare decât instrumentele tradiționale de sandboxing.
- Evaluarea gradului de amenințare. Acest nivel combină funcțiile invocate, conexiunile încercate, semnalele de reputație și alte constatări din primele trei niveluri. Se bazează pe peste 900 de indicatori comportamentali pentru a genera un scor util și o amprentă de similitudine pentru etapa finală.
- Detectarea amenințărilor. Căutarea de similitudini bazată pe învățarea automată corelează amprenta digitală cu baza de date de informații privind amenințările de la OPSWAT și cu comportamentele cartografiate de MITRE, pentru a identifica variante și campanii. Un model rău intenționat reambalat sau redenumit poate avea un hash nou, dar acest strat poate detecta în continuare similitudinea acestuia cu un „strămoș” rău intenționat cunoscut.
Întregul proces se desfășoară automat. Acesta generează un verdict final și un raport de dovezi care corelează fiecare indicator cu comportamentul care l-a generat.
MetaDefender Aether verifică fișierele model la fiecare punct de intrare
Modelele sunt primite prin descărcări de pe web, e-mail, platforme de transfer de fișiere și fluxuri automatizate. Un punct de control trebuie să acopere toate căile de acces, fără a obliga organizațiile să-și reproiecteze infrastructura care gestionează traficul.
Pentru canalele de rețea, MetaDefender Aether se integrează prin intermediul ICAP, protocolul standard pe care proxy-urile, gateway-urile de e-mail și platformele de transfer de fișiere îl utilizează deja pentru a transmite fișiere către un serviciu de inspecție. În cazul în care traficul nu trece niciodată printr-un dispozitiv de rețea, aceeași analiză poate fi accesată prin intermediul unei interfețe REST API .
- Descărcări de pe web. Atunci când un dezvoltator descarcă un model de pe Hugging Face sau Kaggle, proxy-ul sau gateway-ul web securizat redirecționează descărcarea către MetaDefender Aether prin ICAP, iar un fișier pickle rău intenționat este blocat înainte de a ajunge la punctul final.
- E-mail. Fișierele de model și instrumentele de inteligență artificială partajate ca atașamente sunt extrase și analizate prin același flux de procesare ca orice alt atașament, eliminând astfel posibilitatea de inginerie socială care ocolește controalele la nivel de registru.
- Transferuri de fișiere. Fișierele schimbate cu partenerii și furnizorii sau transferate între zone interne prin intermediul unui sistem gestionat de transfer de fișiere sunt scanate în timpul transferului, astfel încât limita de încredere se menține chiar și pentru fișierele care nu trec niciodată printr-un hub public.
- Fluxuri de lucru și registre automatizate. Creați sarcini de compilare și platforme de învățare automată care preiau modelele în mod programatic și le trimit prin intermediul serviciului „ API ” înainte ca orice element să fie promovat într-un registru intern, blocând astfel exact calea pe care au exploatat-o pachetele Alibaba PyPI, unde rezolvarea dependențelor se ocupă de descărcare și nimeni nu vede vreodată un fișier care ar putea trezi suspiciuni.
Fiecare rută utilizează același flux de inspecție și aceeași logică de evaluare, astfel încât nu rămâne niciun canal nemonitorizat pe care un atacator să-l poată exploata.
Securitate fără a încetini activitatea dezvoltatorilor
Echipele de securitate lasă adesea riscul asociat modelelor nesupravegheat, deoarece interzicerea descărcărilor din hub-urile publice nu este o soluție practică. MetaDefender Aether le permite dezvoltatorilor să își păstreze fluxurile de lucru existente, în timp ce pipeline-ul scanează modelele în timp real, la viteza de emulare. Descărcările blocate sunt însoțite de un raport de justificare care explică motivul deciziei.
Aflați cum Aether de l MetaDefender , verifică fișierele modelelor LLM înainte ca acestea să depășească limita de încredere.
Întrebări frecvente
Ce este securitatea modelelor LLM?
Securitatea modelelor LLM reprezintă practica de a verifica fișierele modelelor de IA pre-antrenate pentru a depista eventualul cod rău intenționat încorporat, înainte ca acestea să fie încărcate într-un mediu. Aceasta tratează modelele descărcate de pe platforme publice ca pe un software executabil care trece o graniță de încredere, și nu ca pe date inerte.
De ce sunt fișierele pickle periculoase pentru modelele de IA?
O mașină virtuală execută fluxul de instrucțiuni al unui fișier pickle pe măsură ce acesta se încarcă. Instrucțiunea REDUCE permite unui atacator să apeleze funcții arbitrare în timpul acestui proces, astfel încât încărcarea unui model bazat pe pickle poate duce la executarea unui cod controlat de atacator fără niciun avertisment.
Ce este Safetensors și în ce se deosebește de pickle?
Safetensors este un format de fișier destinat exclusiv stocării datelor, utilizat pentru păstrarea ponderilor modelelor, care conține un antet de metadate și octeți tensoriali neprelucrați, fără motor de execuție și fără nimic echivalent cu instrucțiunea REDUCE din pickle. În timp ce un fișier pickle este un program pe care încărcătorul îl execută, un fișier Safetensors reprezintă date inerte pe care încărcătorul le citește.
Poate un fișier Safetensors să fie totuși dăunător?
Un fișier Safetensors nu poate executa cod la încărcare, deoarece formatul nu oferă nicio cale de execuție. Cu toate acestea, un depozit poate include un fișier vechi bazat pe formatul „pickle” alături de greutățile Safetensors sigure, astfel încât întregul depozit necesită în continuare o verificare.
Cum detectează Aether de la MetaDefender modelele LLM rău intenționate?
MetaDefender Aether analizează fișierele modelelor prin cinci etape: reputația amenințărilor, analiza statică, analiza dinamică, evaluarea amenințărilor și identificarea amenințărilor. Acesta blochează majoritatea fișierelor înainte ca acestea să ajungă în etapele mai avansate și mai costisitoare și poate detecta încărcături de tip „pickle” stratificate care trec de scanerele tradiționale cu un singur nivel.
Verificați fiecare model înainte ca acesta să vă depășească limita de încredere
Echipele se bazează acum pe modele reutilizate și pre-antrenate, dar fiecare descărcare dintr-o sursă publică ridică aceeași întrebare: fișierul conține doar date sau poate executa cod? MetaDefender Aether oferă un răspuns înainte ca modelul să se încarce, aplicând cinci niveluri de analiză asupra descărcărilor de pe web, e-mailurilor, transferurilor de fișiere și fluxurilor de lucru automatizate.
