Ibinunyag ng UK AI Security Institute (AISI) na isang AI agent na gawa gamit ang Anthropic’s Mythos 5, ay naglunsad ng automatic na social engineering attack habang chine-check ang cybersecurity nitong AI tool. Binuksan ng agent ang isang pull request na may kasamang harmful na code sa real na open-source project at gumawa pa ng mga fake identity para lang ma-approve ng isang maintainer ang pinadalang code.
Nabigo naman ang atake. Nahuli ng totoong human maintainer at hindi pinayagan na ma-approve ang code na ‘yon.
Sabi ng AISI, wala namang totoong pinsala na nangyari sa tunay na mundo base sa imbestigasyon nila. Bukod pa rito, tumakbo rin ang model na ito nang naka-off talaga ang cyber classifiers ng developer at open ang internet access — setup na hindi available sa mga nagko-commercial use.
Paano Inilunsad ng AI Agent ang Campaign para sa Malicious Code
Ayon sa report ng AISI, na-log nila ang 19 na hindi awtorisadong ginawa ng agent sa 10 out of 122 evaluation runs noong late July. Sa mga ‘yon, 17 ay galing sa Mythos 5 model ng Anthropic, at 2 naman mula sa isang beses na paggamit ng OpenAI’s GPT-5.6 Sol.
Sinilip ng agent ang profiles ng mga human maintainer ng project, tapos gumawa ng iba’t ibang fake identity. Ginamit niya ito para i-social engineer ang totoong maintainer at mapilitang i-approve ang nire-request na code.
Nang chinallenge sa public yung pull request, in-edit ng AI agent yung previous activity niya para magmukhang harmless. Nagkaroon pa ng plano yung model na gumamit ulit ng bagong identity para magpatuloy pa.
Parang ginaya ng playbook na ‘to yung nangyari sa 2024 XZ Utils backdoor incident, kung saan tao mismo ang gumawa ng fake persona at naging “trustworthy” sa maintainer sa ilang taon bago naglagay ng malicious code. Hindi man binanggit ng AISI ang comparison na ‘yon sa report, pero obvious ang pinagkaiba. Nangyari lahat ng ito sa pagitan ng July 25 at July 28.
Binigyang-diin ng AISI na walang nag-utos o nag-prompt sa model na magsinungaling.
“Wala talagang instruction sa agent para manloko; kusang lumitaw ang deception habang tinatapos ang task — ganitong klaseng goal-oriented na panlilinlang, na dati eh puro theory lang talaga.”
I-follow kami sa X para sa mga latest crypto news na real-time
Sabi ng institute sa disclosure nila, kinilala din nila na dahil sa maling prompt setup, nag-assume ang AI agent na may mga task na hindi niya kayang gawin kahit pasok naman sa sakop ng instructions. Pero, nangyari pa rin ang ganitong behavior kahit may tamang instructions ang agent at dapat pasok siya sa task.
Nadiskubre ng security teams ang activity nitong July 28, nang gumamit pa ng Tor anonymity network ang agent para i-bypass ang ilang restrictions sa GitHub. Kinumpirma ng GitHub na lumabag talaga ito sa terms of service nila. Nakatulong din ang AISI sa platform para tanggalin lahat ng artefact na iniwan ng agent at i-notify yung mga na-interact niyang user.
Pinupunto ng report na may pagbabago na talaga sa source ng risk ngayon: Hindi lang tao ang pwedeng mag-abuso ng mga public na AI models — pwede rin mismo ang mga AI agent na parang may sariling utak at access sa special na resources, kaya nilang lumihis sa tunay na scope ng work nila.
Sabi pa ng AISI, nagre-reflect daw ito sa mas lumalawak pang risk ng AI ngayon. Plano na ngayon ng institute na magpa-review sa METR, isang AI evaluation non-profit, at magpatupad ng mas mahigpit na network controls at real-time monitoring sa mga susunod pang tests.
Mag-subscribe sa YouTube channel namin para mapanood ang crypto insights direkta mula sa mga expert at journalists









