Inteligență artificială11 oct. 2026
CEO-ul Qualcomm spune că telefoanele ar putea rula local modele LLM de 100 de miliarde de parametri până în 2028 - limita practică rămâne memoria DRAM (capacitate, cost și disponibilitate)
Șeful Qualcomm estimează că telefoanele ar putea rula local modele LLM de 100 de miliarde de parametri până în 2028, dar pragul de memorie necesar riscă să facă scenariul neeconomic în actualele condiții de ofertă și preț pentru DRAM, potrivit Wccftech . Cristiano Amon , CEO-ul Qualcomm, a spus într-o discuție cu Fireside Alpha că unele companii de inteligență artificială își doresc smartphone-uri capabile să ruleze „continuu” astfel de modele și că „se construiesc” dispozitive în această direcție, fără a oferi nume sau o foaie de parcurs tehnică. Miza este una de cost și fezabilitate: pe telefoane, principalul blocaj pentru modele mai dense este memoria, iar piața se află deja sub presiune din cauza unei „crize” a memoriei, notează publicația (context: roundup Wccftech despre situația DRAM ). De ce memoria (DRAM) devine problema economică centrală Wccftech argumentează că, dincolo de ambiția de produs, cerințele brute de memorie împing smartphone-ul într-o zonă dificil de susținut comercial: un model de 100 de miliarde de parametri cuantizat la 4 biți ar avea nevoie de cel puțin 50 GB RAM , plus memorie suplimentară pentru sistemul de operare, aplicații și „context cache” (memorie folosită pentru a păstra contextul conversației); chiar și la 2 biți, ar fi necesari circa 25 GB RAM doar pentru model, ceea ce rămâne greu de integrat în telefoane la scară mare. În acest context, publicația amintește că mai mulți producători au făcut un pas înapoi de la variantele cu RAM mai mare, deși cu un an înainte existau modele Android cu 24 GB LPDDR5X . Ce opțiuni tehnice ar putea reduce presiunea pe DRAM Materialul trece în revistă câteva direcții care ar putea face posibilă rularea unor modele foarte mari pe mobil, însă fiecare vine cu compromisuri: rulare prin „streaming” din memoria flash (stocarea internă), nu integral din DRAM; problema este că UFS/NVMe sunt mai lente decât DRAM, ceea ce poate reduce viteza de inferență (generarea răspunsurilor); modele MoE (Mixture of Experts) cu „offloading” al unor componente pe flash: doar o parte din „experți” sunt activi și ținuți în RAM pentru fiecare token, restul stau pe stocare; cuantizare agresivă (inclusiv spre 1 bit), care reduce necesarul de memorie, dar Wccftech notează că scade semnificativ calitatea sub 4 biți, mai ales la sarcini de raționament; modele distilate de 20–30 de miliarde de parametri , care ar putea ajunge aproape de calitatea unui 100B pe smartphone și par, în evaluarea publicației, o strategie mai „vandabilă” și realistă. Separat, articolul menționează că Apple și Qualcomm au încercat să atenueze parțial constrângerile prin schimbări de „împachetare” (packaging) a cipurilor, făcând trimitere la A20 Pro și Snapdragon 8 Elite Extreme Gen 6 , însă „gâtul de sticlă” al memoriei rămâne. Costul ascuns: căldură și limitări termice Chiar dacă problema DRAM ar fi rezolvată, Wccftech subliniază un al doilea obstacol: rularea continuă a modelelor dense crește puternic consumul și temperatura, ceea ce poate duce la limitare termică (thermal throttling) — reducerea automată a performanței pentru a controla încălzirea. În lipsa unor detalii despre cum ar fi depășite aceste constrângeri (memorie, cost, termică), afirmația CEO-ului Qualcomm rămâne, în lectura publicației, mai degrabă o proiecție ambițioasă decât un plan verificabil pentru piața de masă până în 2028. (Postarea citată: Fireside Alpha pe X .) [...]