Kaugnay ng paksang itoFuture Tech & AI Council

Mukhang Malapit Nang Pantayan ng Bagong Sonnet Model ng Anthropic ang Opus, Pero Mas Malakas Gumamit ng Tokens

  • Nag-launch ang Anthropic ng Claude Sonnet 5.5—sabi nila, mas mabilis daw ng 30% kumpara sa Sonnet 5.
  • Pumapangalawa ang Artificial Analysis sa Intelligence Index—Opus 5.5 lang ang nauuna.
  • Sa full power, mas marami ng halos 60% na output token si Sonnet 5.5 kumpara kay Opus 5.5.

Inilabas ng Anthropic ang Claude Sonnet 5.5 nong September 28 na may parehong presyo gaya ng Sonnet 5. Sabi ng company, mas mabilis ito nang higit 30% at hanggang 30% mas mura kada task.

Pero may ibang findings ang isang independent benchmarking firm tungkol sa totoong gastos kapag sinagad mo ang paggamit ng model na ito.

I-follow kami sa X para sa mga latest news real-time

Second 5.5 Model ng Anthropic, Sunod Kagad Kasunod ng Opus

Pangalawang model si Sonnet 5.5 sa Claude 5.5 line. Nag-launch ang Anthropic ng Opus 5.5 nong September 22. Sakto namang nag-release din ang OpenAI ng GPT-6 Sol at Luna nong araw na ‘yun.

Pinanatili ng bagong model ang presyo ng Sonnet 5 — $2 per million input tokens at $10 per million output tokens. Nakakuha ng 70.6% score ang Anthropic sa Terminal-Bench 4.0, isang coding test para sa mga AI. Umabot lang sa 10.3% ang Sonnet 5, habang nakuha naman ng Opus 5.5 yung 66.4%.

“Kung ang Opus 5.5 ay para sa mas malalalim at komplikadong task na kailangan ng maingat na judgment, mas bagay naman ang Sonnet 5.5 sa mga pang-araw-araw na task, pag-aayos ng bug, at paggawa ng maganda o pulidong documents, slides, at spreadsheets,” sabi ng team.

Sabi ng Anthropic, hindi nagdadagdag ng bagong kakayahan ang Sonnet 5.5. Kaya yung alignment review nito ay nakafocus sa risk tulad ng panlilinlang sa users at paggamit para sa mga risky na gawain.

May kasamang cyber protections si Sonnet 5.5 at anti-distillation classifiers na nagba-block ng pag-extract ng reasoning niya para hindi magamit sa pag-train ng mga kakumpitensyang system. Malapit na ring i-release ang Claude Haiku 5.5 sa susunod na mga linggo.

Samantala, iniatras ng OpenAI ang launch ng susunod na model, ang GPT-6.1 Astra, dahil sa safety concerns. Kinumpirma ng CNBC nong Lunes na hindi pumasa ang model sa company standards.

Artificial Analysis: Mas Malaki ang Token Gastos Pag Sinagad ang Model

Ang Artificial Analysis, yung benchmarking firm na nag-rank ng Grok 4.7 sa fourth place, binigyan si Sonnet 5.5 ng 56 sa Intelligence Index nila. Pumangalawa siya overall, 2 points lang ang lamang ng Opus 5.5 kung isasagad talaga ang performance.

Naitala ng firm ang 64% score ng Sonnet 5.5 sa Terminal-Bench 4.0, laban sa 60% ng Opus 5.5 at GPT-6 Astra. Sa mga knowledge-work test gaya ng GDPval-AA, halos pantay lang daw si Sonnet 5.5 at Opus 5.5.

Sabi ng firm, mas marami talagang tokens ang ginamit ng Sonnet 5.5 para makuha yung ganyang resulta.

“Pag sinagad ang performance, kung saan halos lumalapit na sa Opus 5.5, umaabot si Claude Sonnet 5.5 ng nasa 193k Output Tokens para sa bawat Intelligence Index Task,” ayon sa isang post.

Mas mataas ‘yan ng mga 60% kumpara sa Opus 5.5 at Sonnet 5 pag sinagad din. At halos 7 beses mas marami pa iyon kaysa sa max-effort count ng GPT-6 Astra.

Ayon naman sa early-access customers na nakausap ng Anthropic, kabaliktaran ang nakita nilang trend kumpara sa Sonnet 5, lalo na sa ibang trabaho. Sa finance tasks ng Balyasny Asset Management, mas konti daw ang nagamit na tokens.

“Sa private suite namin na 2,441 finance tasks—Q&A, extraction, analysis, at forecasting—mas mataas ang score ni Claude Sonnet 5.5 vs. Sonnet 5 at mga 121k tokens lang ang nagamit per answer, samantalang 497k ang nagamit ni Sonnet 5,” ani Joe Poirier, Senior AI Engineer ng Balyasny Asset Management.

Sinubukan ng Artificial Analysis ang pre-release version na may structured-output bug na naayos na daw ng Anthropic. Plano ng firm na ulitin ang mga tests nila soon.

Mag-subscribe sa YouTube channel namin para mapanood ang expert insights ng mga leaders at journalists

Disclaimer

Ang BeInCrypto ay nakatuon sa walang-kinikilingan at transparenteng pag-uulat. Layunin ng artikulong pambalita na ito na magbigay ng tumpak at napapanahong impormasyon. Gayunpaman, pinapayuhan ang mga mambabasa na independiyenteng beripikahin ang mga katotohanan at kumonsulta sa isang propesyonal bago gumawa ng anumang desisyon batay sa nilalamang ito. Pakitandaan na ang aming Mga Tuntunin at Kundisyon, Patakaran sa Privacy, at Mga Disclaimer ay na-update na.