Inteligență artificială07 aug. 2026
ByteDance antrenează un model AI de până la 10 trilioane de parametri - miză de a ajunge la scara sistemelor de vârf ale Anthropic
ByteDance își crește masiv pariul pe infrastructură și cercetare AI : grupul chinez antrenează un model care ar putea ajunge la 10 trilioane de parametri , într-o încercare de a se apropia de vârful pieței dominat de laboratoare americane precum Anthropic , potrivit Ars Technica . Modelul este, conform a trei persoane familiarizate cu proiectul citate de publicație, într-o fază timpurie de antrenare și ar urma să fie „pre-antrenat” (etapa de bază în care modelul învață din volume mari de date) timp de trei până la șase luni, înainte de ajustarea fină și o eventuală lansare „dacă totul merge bine”. Dimensiunea finală ar urma să fie stabilită mai târziu. Prin comparație, aceeași sursă notează că Anthropic nu publică dimensiunile modelelor sale, însă estimări din industrie indică aproximativ 8 trilioane de parametri pentru Mythos 5 și circa 5 trilioane pentru Fable 5. Ars Technica subliniază că numărul de parametri indică, în linii mari, capacitatea „de memorie” a unui model, dar performanța depinde și de calitatea datelor și de metodele de antrenare. Ce înseamnă operațional: investiții în centre de date, echipe mari și strategie „independentă” ByteDance, compania-mamă a TikTok, și-a ținut relativ discret profilul în AI, în condițiile în care multe dintre modelele sale sunt „închise” (nu sunt publicate deschis), spre deosebire de alți jucători chinezi. Totuși, grupul a investit agresiv în ultimii trei ani, extinzându-și rețeaua de centre de date și recrutând cercetători, în paralel cu dezvoltarea diviziei de cloud Volcano Engine, care vinde soluții AI către companii, potrivit articolului. În plus, ByteDance ar avea ambiții de a dezvolta cipuri AI proprii, o direcție care, dacă se concretizează, ar putea reduce dependența de furnizori externi în condițiile în care antrenarea modelelor de dimensiuni foarte mari este limitată de accesul la hardware performant. Echipa Seed, care dezvoltă modelele, este condusă de Wu Yonghui (fost cercetător Google DeepMind) și ar avea aproximativ 2.000 de membri în China și în afara țării, incluzând cercetători, ingineri de infrastructură, echipe de etichetare a datelor și traducători. De ce contează: cursa pentru modele de „frontieră” se mută și pe terenul Chinei Ars Technica arată că mai multe laboratoare chineze ar antrena modele de dimensiunea Fable 5, însă ByteDance ar fi, în acest moment, cel mai ambițios în încercarea de a împinge dimensiunea spre zona de vârf. În ultimele săptămâni, modele din China dezvoltate de Moonshot și Alibaba ar fi avut rezultate puternice pe teste standardizate, rămânând în anumite zone în urma lui Fable 5. În același timp, Mythos 5 ar fi disponibil doar organizațiilor aprobate, după o interdicție temporară în iunie, invocată pe fondul unor îngrijorări de securitate, conform articolului. Strategie: fără „distilare”, cu ritm posibil mai lent Un element-cheie este alegerea ByteDance de a nu folosi „distilarea” altor modele (o tehnică prin care un model mai mic este antrenat să reproducă ieșirile unuia mai mare), optând pentru o dezvoltare mai independentă. Această abordare ar fi în vigoare de peste un an și, potrivit unor opinii din industrie citate de Ars Technica, ar fi putut contribui la un ritm mai lent față de rivali. Fondatorul Zhang Yiming ar fi reiterat într-o întâlnire internă, cu două săptămâni înainte, că echipa Seed ar trebui să urmărească „capabilități de model la nivel de lider mondial” pe termen lung, fără a se concentra excesiv pe faptul că ar putea rămâne temporar în urmă. Comentariile ar fi fost relatate inițial de presa chineză Latepost și de The Information, mai notează articolul. ByteDance nu a răspuns unei solicitări de comentariu. [...]