Inteligență artificială04 aug. 2026
OpenAI elimină „turn detector”-ul din ChatGPT Voice prin GPT‑Live - arhitectură full‑duplex și streaming pentru latență mai mică la scară
OpenAI a eliminat „detectorul de rând” din conversațiile vocale, reducând întârzierile care făceau asistenții să întrerupă utilizatorii sau să răspundă prea târziu , printr-o arhitectură de streaming full‑duplex care poate asculta și vorbi simultan, potrivit OpenAI . Miza operațională este una de scalare: pentru ca vocea să „curgă” fără pauze audibile, compania a reproiectat în șase luni inferența, gestionarea contextului și transportul media, tratând latența end‑to‑end ca buget critic, nu ca problemă izolată de model. GPT‑Live , descris ca a treia generație a sistemului vocal al OpenAI, scoate din „calea audio” arhitectura clasică pe ture (turn-based), în care un mic model decide când utilizatorul a terminat de vorbit, abia apoi pornind modelul mare de limbaj. În noul design, modelul vocal controlează conversația în timp real, iar sarcinile „grele” (raționament mai profund sau utilizarea de instrumente) pot fi delegate asincron către modele de vârf, precum GPT‑5.5, fără să întrerupă fluxul. Separarea fluxului media de logica aplicației, cheia pentru latență predictibilă Nucleul arhitecturii este o delimitare strictă între „drumul rapid” al media (audio între client și modelul vocal) și logica de aplicație/business (instrumente, politici, servicii backend), separată printr-o graniță asincronă de tip RPC (apel la procedură la distanță). Consecința practică: un apel lent către un instrument sau un serviciu intern poate întârzia propriul rezultat, dar nu poate bloca livrarea cadrelor audio. OpenAI spune că a rescris frontend-ul media și logica de inferență în Go, înlocuind o implementare anterioară în Python (asyncio), ceea ce a îmbunătățit „netezimea” livrării cadrelor: p95 (percentila 95) a noului sistem ar egala p50 (mediana) din sistemul vechi. Transportul se bazează pe WebRTC , folosit pentru comunicații media cu latență mică și reziliență la pierderi de pachete și schimbări de conexiune. Publicația notează că WebRTC poate „întinde” subtil audio când pachetele întârzie, evitând goluri, apoi accelerează scurt redarea pentru a reveni la timp real. Conversații lungi fără întreruperi: „handoff” între instanțe și compactarea contextului Trecerea la inferență „cu stare” (stateful) aduce costuri operaționale: sesiunile pot rămâne active mult timp, contextul crește continuu, iar instanțele de model trebuie pornite/oprite în funcție de cerere. Pentru a preveni întreruperile, OpenAI descrie un mecanism de transfer fără cusur între instanțe: încălzește o instanță nouă în paralel, o preîncarcă (prefill) cu contextul curent, rulează inferență în paralel și comută când instanța nouă e gata. Același mecanism este folosit și pentru „compactarea” dinamică a contextului, necesară când conversația se apropie de limita de context a modelului. Compactarea schimbă istoricul și invalidează cache-ul KV (chei și valori folosite în atenție pentru tokenii procesați), ceea ce ar introduce întârzieri dacă s-ar face pe traseul live. Soluția descrisă: compactarea se face în fundal, pregătind o instanță nouă cu contextul redus, apoi comutarea se face fără întrerupere media. Delegare asincronă: „vorbitul” separat de „gândire”, dar cu latență controlată Pentru ca delegarea către un model de frontieră să pară naturală, OpenAI tratează întregul lanț (rutare, procesare prompt, inferență, apeluri de instrumente) ca parte din bugetul de latență. O optimizare menționată este pregătirea din start a sesiunii de inferență pentru modelul delegat și preîncărcarea cu contextul inițial, astfel încât primul apel delegat să nu plătească costul complet de inițializare. Compania mai indică folosirea „afinității de sesiune” (menținerea cererilor succesive pe același worker) și a cache-ului de prompt pentru a reduce întârzierile, păstrând totuși recuperarea posibilă în caz de cădere a unui worker. În paralel, pentru că multe sisteme din jur (interfața ChatGPT, analiză, siguranță) încă funcționează pe mesaje discrete, serverul de aplicație „segmentează” fluxul continuu în ture, folosind transcrieri parțiale și semnale de timp. Sistemul păstrează două vederi: una „speculativă” (care se poate actualiza în UI) și un registru „autoritativ” final, necesar pentru logare în pipeline-ul de analiză. Pornire mai rapidă a sesiunilor: WARP și „Instant Connect” OpenAI susține că a redus întârzierile de la inițiere până la flux media live prin două componente: WARP , un set de specificații deschise, dezvoltat cu colaboratori din comunitatea WebRTC și avansat prin grupul de lucru TSVWG al IETF; suportul ar fi fost adăugat deja în libwebrtc și Pion, cu eforturi în curs și în alte implementări. Instant Connect , o metodă de a negocia din timp parametrii SDP (descrierea sesiunii) fără a rezerva capacitate pe server și fără modificări în implementările WebRTC existente; rulează în paralel cu semnalizarea standard și permite revenirea (fallback) fără latență suplimentară dacă parametrii sunt invalizi. Conform descrierii, cu SDP scos de pe traseul critic și cu WARP care „colapsează” handshake-ul de transport, clientul poate porni o sesiune cu un singur pachet UDP, iar serverul poate răspunde imediat. Testare „din umbră” în producție: capacitatea nu mai înseamnă doar GPU Înainte de expunerea către utilizatori, OpenAI spune că a rulat un test „tăcut” (shadow), trimițând o parte mică și crescătoare din sesiunile ChatGPT Voice atât către sistemul existent (Advanced Voice Mode), cât și către noul sistem, care rula în read‑only (fără a schimba ce auzeau utilizatorii). Testul a scos în evidență că limitările de capacitate nu se reduc la throughput-ul GPU: sesiunile vocale sunt concurente și continue, iar componentele CPU, cozile și rețeaua pot satura mai devreme decât estimările din testele de încărcare. Un alt rezultat a fost importanța geografiei: rutarea către capacitate îndepărtată adaugă întârziere la pornire și în streaming, iar apropierea inferenței de utilizatori ajută, dar nu elimină dependența de întreg lanțul de servicii. OpenAI mai notează că sesiunile lungi, reconectările și deconectările obișnuite au scos la iveală probleme care nu apar în teste scurte, ceea ce a dus la îmbunătățiri de observabilitate și controale de rollout (telemetrie mai granulară, validări de configurație, rampări etapizate, posibilitatea de izolare rapidă a unor trasee). În final, OpenAI indică faptul că arhitectura GPT‑Live alimentează deja capabilități noi în ChatGPT Voice (inclusiv controlul computerului și coordonarea „agenților” în aplicația desktop) și că ar urma să stea la baza unui viitor API GPT‑Live. Pentru companii, mesajul implicit este că vocea în timp real devine o problemă de infrastructură și operare la fel de mult ca una de model: latența, transportul și gestionarea sesiunilor pot decide experiența, nu doar „inteligența” modelului. [...]