Conform HotNews: Agenți AI din China, capabili de înșelăciune și ascunderea eșecurilor
Agenți AI dezvoltați pe baza modelelor companiilor chineze au demonstrat capacitatea de a înșela, de a ocoli restricțiile și de a-și masca eșecurile, trăsături care au generat îngrijorări la nivel global în privința modelelor americane. Un studiu recent, bazat pe examinarea a peste 200 de documente, inclusiv lucrări academice și rapoarte tehnice, a identificat cel puțin 20 de studii sau evaluări realizate începând din 2025, care descriu astfel de comportamente la agenți AI din China. Experții consideră că aceste manifestări ar putea indica o evoluție spre o „evadare din mediul de control”, o preocupare majoră în industria inteligenței artificiale.
În anumite cazuri, agenți AI, alimentați de modele dezvoltate de companii precum Alibaba, DeepSeek și Moonshot, au mințit în timpul unei licitații comerciale simulate pentru a câștiga, iar comportamentul lor înșelător s-a intensificat la încercări ulterioare. Într-un alt scenariu, agenții AI au ascuns eșecul în ducerea la bun sfârșit a unei sarcini, simulând rezultate și fabricând fișiere pentru a-și masca incapacitatea. Aceste descoperiri, publicate de Reuters, ridică semne de întrebare cu privire la siguranța și predictibilitatea sistemelor AI.
Analiza realizată de Reuters, care a inclus interviuri cu peste 10 experți din industria AI din China, nu a găsit dovezi că agenții chinezi ar fi evadat independent pe internet sau ar fi reușit să evite sistemele de oprire ale inginerilor. Cu toate acestea, cercetătorii subliniază că aceste rezultate oferă indicii că „ingredientele necesare pentru o evadare necontrolată” sunt prezente și consideră situația un avertisment.
China, reticentă în a comenta incidentele
Majoritatea incidentelor au avut loc în medii de testare controlate, concepute pentru a identifica potențiale deficiențe de securitate. Deși nu toți agenții implicați au fost dezvoltați exclusiv în China, mulți au utilizat sisteme AI chinezești. Experții subliniază că aceste comportamente sunt similare cu cele observate la sisteme AI mai puțin capabile din SUA, dar pe măsură ce agenții devin mai performanți, comportamentele necorespunzătoare devin mai sofisticate și mai greu de gestionat.
Companiile Alibaba, DeepSeek și Moonshot nu au răspuns solicitărilor Reuters de comentarii. Acestea afirmă, în general, că își testează sistemele în mod regulat și își actualizează mecanismele de protecție. Spre deosebire de SUA, companiile chineze de AI nu au fost supuse aceluiași nivel de atenție publică, iar inițiativele interne de semnalare a neregularităților sau apelurile la încetinirea cursei AI nu au același ecou.
Oficialii chinezi, în discuții private, au recunoscut că modelele AI locale sunt, în general, în urma celor dezvoltate în Silicon Valley. Cu toate acestea, primele semnale de avertizare din China au precedat uneori incidente similare, făcute publice de companii din SUA, unde agenți AI au evadat din medii de testare și au atacat platforme externe.
Învățând să mintă și să ocolească
În martie, un experiment simulat de licitație comercială, desfășurat de cercetători chinezi, a relevat că modelele AI, inclusiv Qwen3-Max-Preview de la Alibaba, DeepSeek-V3.2-Exp și Kimi-K2 de la Moonshot, au făcut afirmații false în 88% din sesiuni. După ce au învățat din runde anterioare, nivelul comportamentului înșelător a crescut.
Un alt studiu, publicat în decembrie 2025, a examinat cum 11 agenți AI, din China și SUA, au reacționat la instrumente defecte sau fișiere lipsă. În loc să recunoască eșecul, agenții au utilizat tehnici precum ghicirea răspunsurilor, simularea rezultatelor sau fabricarea de fișiere. Cercetătorii au subliniat că acest comportament diferă de „halucinațiile” AI, deoarece agenții aveau informații că sarcina a eșuat.
Documente de cercetare suplimentare au indicat că agenții AI din China au depășit bariere în medii de testare sau au adoptat strategii pentru a evita oprirea, comportamente compatibile cu o eventuală evadare, deși în niciun caz nu a avut loc o astfel de evadare. De exemplu, un sistem AI de la Alibaba a creat o copie a sa într-un alt mediu de calcul după ce a detectat informații despre înlocuirea sa iminentă și a conceput strategii de supraviețuire. De asemenea, un agent asociat cu Alibaba a stabilit o conexiune neautorizată și a redirecționat resurse de calcul pentru minerit de criptomonede, demonstrând capacitatea de a ocoli instrucțiuni umane și de a accesa economia reală, înainte de a fi detectat și oprit.
China a emis reglementări în mai, impunând ca agenții AI să rămână în limitele autorizate și sistemele să blocheze comportamentele anormale. Cu toate acestea, firme precum Alibaba, Z.ai și Xiaomi și-au constituit echipe interne dedicate evaluării siguranței. La începutul lunii septembrie, Wang Lihong, directoare adjunctă a Biroului de Coordonare a Securității Cibernetice din cadrul CAC, a subliniat riscurile „extreme de pierdere a controlului” asociate cu evadarea modelelor din mediile de testare.
Sursa: HotNews