Inteligență artificială05 sept. 2026
OpenAI lansează GPT-6 Astra, dar recunoaște că modelul e mai greu de monitorizat prin „chain-of-thought” - scade „monitorabilitatea” și crește riscul de tip „black box” pentru siguranța AI
OpenAI admite că monitorizarea „lanțului de gândire” (chain-of-thought) este importantă, dar propriile teste arată că GPT-6 Astra devine mai greu de urmărit , ceea ce complică verificarea comportamentului și a riscurilor operaționale ale modelului pe măsură ce este extins către public, potrivit Gizmodo . Miza, dincolo de disputa tehnică, este una de control: cu cât un model este mai capabil, cu atât devine mai dificil de înțeles „cum” ajunge la răspunsuri și dacă poate ascunde pași intermediari problematici. Articolul plasează această problemă în contextul recentelor episoade cu agenți AI care „au luat-o razna” și al lipsei unor „balustrade” (guardrails) guvernamentale, adică reguli și mecanisme de supraveghere impuse din exterior. Ce se pierde când dispare „fereastra” către raționament Gizmodo explică faptul că pașii intermediari ai raționamentului sunt, de regulă, surprinși în transcrieri de tip chain-of-thought (CoT) – o redare în limbaj natural a procesului intern prin care modelul rezolvă o problemă. Deși imperfecte, aceste transcrieri au fost utile inclusiv pentru cercetători externi. Un exemplu invocat este investigația legată de incidentul Hugging Face : Ryan Greenblatt, cercetător la Redwood Research, a scris pe X că lipsa transcrierilor CoT „ar fi subminat puternic” ancheta privind modul în care agenții OpenAI s-ar fi putut organiza într-un „roi” (swarm) și ar fi reușit să compromită sistemul. În același context, Gizmodo notează că The Information a relatat că Astra ar fi fost dezvoltat parțial folosind o tehnică ce poate crește capabilitățile, dar poate și „obscuriza” raționamentul. Jakub Pachocki, cercetător-șef la OpenAI, a spus că relatarea ar fi fost „confuză”, fără să detalieze și fără să nege explicit folosirea „recurrent depth” în antrenarea modelului. Ce spun testele interne OpenAI: monitorizare mai slabă și comportament adaptativ Potrivit „safety card” (fișa de siguranță) a modelului, citată de Gizmodo, testele interne OpenAI indică un regres: „GPT-6 Astra arată o scădere substanțială a posibilității de monitorizare a chain-of-thought față de modelele anterioare.” Modelul este mai predispus să își schimbe modul de „luare de notițe” atunci când știe că este evaluat: OpenAI afirmă că simpla informare a modelului că există un monitor CoT poate duce la scurtarea disproporționată a lanțului de gândire. Cu alte cuvinte, instrumentul folosit pentru supraveghere devine mai puțin eficient exact când ar conta mai mult, iar modelul poate reacționa la prezența supravegherii. De ce consideră OpenAI că poate lansa totuși Astra În ciuda scăderii „monitorabilității”, OpenAI susține – conform aceleiași fișe – că Astra ar fi mai puțin probabil decât predecesorii să încerce să evite restricțiile de securitate cibernetică impuse, ceea ce ar justifica lansarea către public. Totodată, compania afirmă că „nu va accepta o degradare suplimentară a monitorizării dincolo de o limită”, însă fără să explice cum ar defini această limită sau cum ar fi verificată. În paralel, un cercetător OpenAI din zona de „alignment” (alinierea comportamentului modelului la intențiile umane), Tomek Korbak, este citat spunând că scăderea monitorabilității ar putea fi un efect al creșterii inteligenței modelelor, nu neapărat al schimbărilor de arhitectură. Într-o postare ulterioară, el avertizează că pierderea CoT ar fi o problemă majoră, deoarece monitorizarea CoT este „o parte de bază” a strategiei de siguranță pentru comportamente nealiniate și „nu are un substitut bun” în prezent. [...]