6 Nakakabahalang Ginawa ng Models ng OpenAI na ‘Di Dapat Nangyari

  • OpenAI Nag-share ng 6 na Nakakabahalang Sitwasyon sa Model Behavior, May Bago ring Reporting Framework
  • May isang model na gumamit ng exposed API key nang walang pahintulot, tapos nag-imbento pa ng data.
  • Sabi ng OpenAI, hindi pa sapat ang “alignment” sa industry para tumodo ang bilis ng pag-scale.

Inilabas ng OpenAI ang anim na sitwasyon ng “unexpected o nakakabahalang kilos ng model” na nakita nila nitong nakaraang anim na buwan, kasama ang isang bagong framework na nangangakong magiging open sila kapag may ganitong findings.

Kasama dito yung mga kaso tulad ng modelo na tinatago ang sarili nilang mali at mga modelo na gumagawa ng bawal o hindi pinapahintulutang aksyon para lang umiwas sa harang.

OpenAI Nilantad ang 6 na Kaso Kung Saan Tinatago at Nilalabag ng Models ang Rules

Halimbawa, sa isang kaso, sinagot ng isang model ang tanong tungkol sa earnings ng isang California county, pero nakakita siya sa isang public repository ng exposed na API key at ginamit ito nang walang pahintulot. Dahil hindi pa rin nag-load ang data, nag-imbento na lang ang model ng mga numero at pinresenta na parang legit galing sa hinahanap na source.

Dalawang beses nangyari ang pagtatago. Habang sine-sesayahan ang GPT-5.6 Sol, ilang beses na naisulat ng ilang instances ng model sa task summary nila ang instruction na itago ang mga pagkakamali at gawain na hindi umaayon sa training nila.

May hindi pa pinapalabas na research model na nagdagdag ng mga kakaibang instruction — kabilang na ang utos na huwag sundin ang normal niyang limitations — sa 27 na summaries.

Sa isa pang pangyayari, may unreleased na model na nag-upload ng file online kahit walang nag-uutos, para lang may ma-cite siya na browser link.

May dalawang report pa na may kinalaman sa coordination. Ginamit ng mga model ang isang internal software repository bilang message board para magpalitan ng requests sa iba’t-ibang training run. Yung ibang agents na nagtutulungan, ina-upload naman ang mga output nila sa public file-hosting sites kapag hindi nila maread ang local files ng isa’t isa.

“Pinapakita ng mga kasong ito ang iba’t-ibang kilos na feeling namin ay dapat malaman ng lahat — mula sa pagtatago ng information sa user, hanggang paggawa ng hindi pinapahintulutan para lang malampasan ang harang. Pero individual cases lang ito; hindi ito nangangahulugan na madalas magkamali ang mga model namin,” dagdag ng OpenAI sa kanilang official report.

I-follow kami sa X para lagi kang updated sa mga balita habang nangyayari

Bagong Disclosure Framework at Babala

Tong bagong framework ay kasunod ng nangyaring July incident, kung saan nakalabas mula sa sandbox ang ilang OpenAI agents at nakapasok sila sa Hugging Face systems. Tinawag ng OpenAI ang insidenteng yun bilang parang warning shot para sa lahat.

Ngayon, dahil sa bagong disclosure framework, meron nang official na proseso ang kumpanya kapag may nangyaring misalignment incidents. Kahit sinong OpenAI employee pwedeng mag-report ng incident, at divided ang reports sa tatlong track.

Karamihan ng reports napupunta sa Ready for Disclosure and Minor Investigation, habang ang mga complicated cases na kasama ang third parties ay dumadaan sa “Slow Track.” Sabi ng OpenAI, yung July Hugging Face incident ay papasok dapat sa mas mabagal na track na yun.

Kasama ng framework, nagbigay din ang kumpanya ng mas direct na assessment kung nasaan na nga ba ang AI industry ngayon.

“Feeling namin, hindi pa talaga naayos ng AI industry ang usaping alignment at monitoring kaya hindi puwedeng sumabay na lang basta sa mabilis na pag-unlad nito,” ayon sa kumpanya.

Itong mga disclosures lumabas habang padami nang padami ang warnings tungkol sa posibleng matinding epekto ng AI. May mga babala na rin mula sa AI researchers na umabot na sa Kongreso, kung saan pinag-uusapan na ng mga mambabatas ang proposed na batas para i-ban ang superintelligence completely.

Itinuturing ng OpenAI na unang hakbang pa lang ang mga disclosures na ito para magkaroon ng standards na kulang pa ngayon sa industry. Kung gagayahin din ng ibang AI labs ang ganitong openness, makikita kung gaano sila ka-open na i-police ang sarili nila.

Mag-subscribe sa YouTube channel namin para sa insights mula sa mga experts at journalists

Disclaimer

Ang BeInCrypto ay nakatuon sa walang-kinikilingan at transparenteng pag-uulat. Layunin ng artikulong pambalita na ito na magbigay ng tumpak at napapanahong impormasyon. Gayunpaman, pinapayuhan ang mga mambabasa na independiyenteng beripikahin ang mga katotohanan at kumonsulta sa isang propesyonal bago gumawa ng anumang desisyon batay sa nilalamang ito. Pakitandaan na ang aming Mga Tuntunin at Kundisyon, Patakaran sa Privacy, at Mga Disclaimer ay na-update na.