Talo ang MuseCode ni Zuckerberg vs Anthropic sa Benchmark Chart ng Meta

  • Nag-launch si Zuckerberg ng Muse Code, pero sa Meta charts nila, Opus 5 ng Claude pa rin ang nangunguna.
  • Hindi Sinama ng Meta ang Pinakamalupit na Coding Model ng OpenAI sa Benchmark Test Nila
  • Independent test, umiskor ng 89.5% ang totoong lider—mas mataas pa sa kahit anong number ng Meta.

Ni-launch ni Mark Zuckerberg ang Muse Code sa beta nitong Miyerkules — ito ang kauna-unahang artificial intelligence (AI) coding agent ng Meta. Pero, tinalo ito ng Anthropic Claude Opus 5 sa lahat ng apat na comparison na ipinakita mismo ng Meta sa launch nila.

Ni-release pa rin ng Meta yung mga charts na ‘yon. Ang goal ng kumpanya: magbenta ng mas murang tool — hindi yung pinaka-powerful. Base pa sa mga independent na test, mas malaki pa raw ang lamang ng competitor kaysa sa ipinakita ng Meta.

I-follow kami sa X para lagi kang updated sa pinakabagong crypto news!

Talo ang Meta sa Sarili Niyang Charts — Panalo si Anthropic Lahat ng Round

Muse Spark 1.2 ang model na ginagamit sa Muse Code. Naka-score ito ng 82.9% sa Terminal-Bench 2.1.

Si Claude Opus 5 naman — 86.7% ang score sa parehong test. Galing ang Terminal-Bench sa Laude Institute at ilang Stanford researchers, kung saan 89 na real world na coding tasks ang pinapagawa tungkol sa system repair, data work, at security.

Respeto pa rin ang second place dito. Napauna pa nga ang Muse Code sa OpenAI Codex (81.8%) at Grok Build (81.6%).

Benchmark comparison chart para sa Muse Spark 1.2
Benchmark comparison chart para sa Muse Spark 1.2, Source: Zuckerberg

Yung sumunod na chart, mas mabigat. Sa DeepSWE 1.1, may 113 coding tasks na hindi na puwedeng mag-internet habang tine-test. Bumaliktad ang tide: pangatlo na lang ang Muse Spark 1.2, scoring 59.3%.

Tapos nag-publish ang Meta ng sarili nilang test — 440 na totoong pull requests galing sa engineers mismo ng Meta. Dito, 70.6% ang nakuha ng Muse Spark 1.2, halos siyam na points ang layo kay Opus 5.

Muse Spark 1.2 nag-run ng kernel optimization task ng 24 na oras sa NVIDIA Hopper — lagpas 1,000 tool calls — at patuloy na nakikita ng real speedups kahit tapos na ang early exploration phase.
Muse Spark 1.2 nag-run ng kernel optimization task ng 24 na oras sa NVIDIA Hopper — lagpas 1,000 tool calls — at patuloy na nakikita ng real speedups kahit tapos na ang early exploration phase.

Mas mataas lang ito ng 2.3 points sa Muse Spark 1.1, yung model ng Meta na nirelease nila nung July pa.

May Model na Hindi Sinasali ng Meta sa Coding Charts Nila

Kinompara ng Meta ang Muse Code nila laban sa GPT-5.6 Terra. Pero, may mas malakas na model ang OpenAI na tinatawag na Sol, at hindi ito isinama ng Meta sa kahit isa sa tatlong coding charts.

Sa independent na Terminal-Bench 2.1 leaderboard, nangunguna si Sol sa 89.5%. Sunod si Opus 5 sa 89.1%.

Tinalo ng dalawang yan yung 86.7% na Opus 5 score na nirereport ng Meta. Pinili pa ng Meta na gamitin yung version ng kalaban nila na medyo mahina, pero talo pa rin sila.

Paglaban kay Sol (yung totoong leader), mas malayo pa ang agwat: 6.6 points behind ang Muse Spark 1.2, hindi lang 3.8 points.

Isinama din ng Meta si Sol sa isang test. Sa GPU kernel task na mahigit 1,000 tool calls, si Sol ay naka-achieve ng 71.2% improvement, samantalang si Muse Spark 1.2 naman ay 68.7% lang — pang-apat sa anim na competitor.

May isang catch dito: hindi pa napapasama si Muse Spark 1.2 sa public leaderboard na ‘yon, kung saan 26 lang ng 183 tested models ang naroon. Yung 82.9% score niya, base pa rin sa mismong Meta.

“Ang Muse Spark 1.2 ang next step namin papunta sa frontier, may mas malalaking at mas powerful na models na parating pa,” sabi ni Zuckerberg sa isang post.

Baka Mismong Si Zuckerberg pa ang Mag-host ng Model na Tumatapos sa Sarili Niyang AI

Usap-usapan na raw na magpapa-lease ng compute si Meta kay Anthropic. Aabot pa raw ng $10 billion ‘yan sa loob ng dalawang taon. Kung mangyari ito, yung mga data center ng Meta mismo makakatulong pa mag-run ng Claude models — na intended sanang tapatan ng Muse Code.

Mahal din ang team sa likod ng Muse Code. Noong June 2025, gumastos si Zuckerberg ng $14.3 billion para kunin ang Scale AI at ang founder nitong si Alexandr Wang, na ngayon tumatayong head ng Meta Superintelligence Labs.

Presyo na lang ang asa ni Wang. Pareho lang yung presyo sa July launch ng developer API ng Meta — $1.25 kada isang milyong input tokens, at $4.25 bawat milyong output tokens.

May contributor tier na higit sampung beses na mas mura. Pwedeng sumali ang mga developer dito basta papayagan nilang gamitin training data ng Meta galing sa code nila. Hindi sinabi ni Wang kung ilang developer na ang gumagamit ng Muse Spark.

Nagpapaliwanag ang Meta kung bakit may discount. Tumaas ng 28% ang revenue nila — $60.8 billion last quarter, pero yung operating profit bumaba ng 8% — $18.8 billion na lang.

Bumagsak din ang operating margin, mula 43% noong nakaraang taon, ngayon 31% na lang. Sa quarter na ‘yan, gumastos ang Meta ng $31.08 billion sa capital projects, at estimate nila baka umabot ng $145 billion ang total gastos sa loob ng isang taon.

Kahit ganun, may mga nagustuhan pa rin sa Muse Code. Meron itong engineering features na wala sa Claude Code: may “background agents” na nago-hold ng context buong session, at sub-agents na nagtatrabaho sa iba’t ibang kopya ng repository.

Maganda pa rin na second-best coder ang Muse Code, at swak kung naghahanap ka ng budget option. Sa beta, malalaman tuloy kung willing magpalit ng accuracy points ang mga developer kapalit ng bill na parang sampung beses na mas mura.


Upang mabasa ang pinakabagong pagsusuri sa merkado ng cryptocurrency mula sa BeInCrypto, i-click dito.

Disclaimer

Ang opinion article na ito ay nagpapahayag ng opinyon ng may-akda at maaaring hindi kumakatawan sa mga pananaw ng BeInCrypto. Nananatiling committed ang BeInCrypto sa transparent na pag-uulat at pagpapanatili ng pinakamataas na pamantayan ng journalism. Pinapayuhan ang mga mambabasa na i-verify ang impormasyon sa kanilang sariling kakayahan at kumonsulta sa isang propesyonal bago gumawa ng anumang desisyon base sa nilalamang ito. Paalala rin na ang aming Terms and Conditions, Privacy Policy, at Disclaimers ay na-update na.