Sinubukan ng US government i-hack ang pinakabagong AI model ng China, at lumabas na malayo pa ang Moonshot AI na Kimi K3 kumpara sa pinakamagagaling na American models.
Pinangunahan ng Center for AI Standards and Innovation (CAISI), isang US agency, kasama ang partner mula Britain ang mga test. Lumabas ang resulta nito isang araw lang matapos akusahan ng Washington ang Moonshot na gamit daw nila ang nakaw na US tech sa paggawa ng Kimi K3.
Bagsak ang Kimi K3 sa US Cyber Benchmarks
Inilabas ng Commerce Department ang resulta nitong Huwebes, kung saan makikitang mas mababa ang rank ng Kimi K3 versus sa mga top US models. Base ito sa joint test kasama ng British experts.
July 16 nag-launch ang Moonshot ng Kimi K3, at dahil sobrang lakas ng demand, napilitan silang ihinto ang bagong signups after two days lang.
Ang launch nito nakaapekto rin sa US chip stocks at nagdulot ng bagong duda kung nalalamangan pa ba ng America ang China pagdating sa AI.
Isang test na tinawag na ExploitBench ang ginamit, kung saan may totoong Chrome browser bugs mula sa Carnegie Mellon University. Naka-score ng 32% ang Kimi K3 — mas mataas kaysa sa 24% ng China’s GLM-5.2. Pero malayo pa rin compared sa US top models na umaabot sa 76% ang score.
Pinakamahirap sa test: yung mabawi nang buo ang control ng target na machine. Hindi nakuha ng Kimi K3 sa kahit isanman sa 41 tests. Ang best US models, nakuha ito sa 20 tests.
May isa pang test, ang The Last Ones, na parang pag-attack sa network ng pekeng kumpanya na may 32 steps. Kadalasang kailangan ng human expert ng 20 oras para matapos iyon. Abot step 17 lang madalas ang Kimi K3. Yung US top models, umaabot hanggang step 28.5. Isang beses lang natapos ni Kimi K3 buong attack sa 10 beses na try.
Yung best US systems, na-achieve daw ito nang 6–7 ulit.
Pero Baka Mukhang Mas Malayo ang Agwat Kaysa sa Totoo
Pero hindi lang yung mga numero ang dapat tingnan. Marami ring catch sa fine print mismo ng report.
Unang-una, sinubukan ang US models na naka-off ang kanilang safety filters—kaya pinapakita nila ang full power nila doon. Pero sa totoong buhay, naka-on ang filters ng public versions. Kaya best case scenario lang ang pinakita ng US scores, hindi sa totoong world.
Sabi rin ng team, maaga pa at kulang ang test. Isang test lang ang pinagbasehan para sa Kimi K3, at part lang ng full set ang natakbo. Kaya parang medyo hilaw pa ang rating. May ibang test pa na private rin, kaya hindi rin masilip ng ibang eksperto.
May malaki ring pagkakaiba: ang Kimi K3, open model na puwedeng i-download ng kahit sino. Samantalang yung US models, locked at private lang. Yung parehong UK institute ang nagsabi na ang open models, kadalasang 4–7 buwan ang layo sa best locked models. Ibibigay daw nila ang full test kay Kimi K3 kapag na-release na ito sa publiko ng Moonshot.
Hindi rin ito real-life na cyber attacks. Walang human defender o alarm sa fake network. Pero kahit ganon, nanalo ang Kimi K3 sa huling open model at natapos niya kahit minsan ang buong attack scenario.
May tanong din tungkol sa timing at source ng report. Dating US AI Safety Institute ang CAISI bago pinangalanan uli ito noong June 2025 sa panahon ni Trump. Nasa iisang department sila na naglilimit ng US chip sales papuntang China. At yung report nila tungkol sa karibal na Chinese model ay lumabas isang araw lang matapos i-akusa ang pagnanakaw ng tech.
Mahina pa rin ang Safeguard Kaya Malaki pa rin ang Risk
Kahit mababa ang scores, hindi ibig sabihin na safe na si Kimi K3. Lumabas sa test na hindi napipigilan ng guardrails nito ang paggawa ng hacks o pag-atake sa mga system.
Mahalaga ito dahil malapit nang i-release ang full model ng Moonshot — July 27 daw ito available. Pag nailabas na, hindi na pwedeng bawiin. Kayang-kaya na i-download at pwede rin tanggalin ng kahit sino ang safety filters.
Dagdag pa dito, napag-usapan din ang theft claim. Sabi ng Washington, ginawa ng Moonshot ang Kimi K3 gamit nakaw na US AI tech. Ayon sa White House tech chief Michael Kratsios, lihim daw kinopya ng kumpanya ang Anthropic Claude Fable 5 gamit ang tinatawag na distillation—paraan ng pag-train ng AI na ginagaya ang sagot ng isang mas malakas na model.
Nag-agree ang Anthropic sa claim na ito. Noong February, nasundan nila ang mahigit 3.4 million na Claude chats papunta sa Moonshot gamit daan-daang fake accounts. Binalaan din nila na kapag kinopya ang models, nawawala ang original safety controls nito. Yun din mismo yung butas na lumabas sa test.
Sa ngayon, mas malaki pa rin ang ginagastos ng US sa AI — 23 times mas malaki kumpara sa China. Pero tuloy pa rin ang China sa paghabol. Ang totoong laban dito: kapag public na si Kimi K3 at makakahawak at makakapag-test na rin ang mga independent na eksperto.








