Inteligență artificială27 aug. 2026
AWS și NVIDIA vor adăuga 2 milioane de GPU-uri NVIDIA în infrastructura globală AWS în 2027-2028 - extind parteneriatul pentru capacitate AI și integrare pe întregul stack (GPU, CPU, rețea, modele)
AWS își extinde masiv capacitatea de calcul pentru AI printr-un plan de a adăuga 2 milioane de GPU-uri NVIDIA în 2027–2028 , într-o mișcare care vizează direct blocajul de infrastructură pe fondul trecerii accelerate a clienților de la proiecte-pilot la producție, potrivit NVIDIA News . Extinderea face parte dintr-o colaborare mai amplă AWS–NVIDIA, care acoperă nu doar GPU-uri, ci și procesoare, rețelistică, modele deschise și tehnologii pentru robotică. Planul vine după ce AWS a anunțat la NVIDIA GTC 2026 intenția de a adăuga peste 1 milion de GPU-uri începând din 2026, însă cererea ar fi depășit estimările inițiale. Conform sursei, noile livrări ar include GPU-uri din generațiile NVIDIA Blackwell Ultra, Rubin și Rubin Ultra, integrate în infrastructura globală AWS, inclusiv în „fabrici de AI” (centre de date optimizate pentru antrenarea și rularea modelelor). Ce se schimbă operațional: mai multă capacitate și integrare pe „întregul stack” AI Dincolo de volum, colaborarea urmărește să reducă fricțiunile de implementare pentru clienți, prin integrarea mai strânsă între componentele NVIDIA și serviciile AWS. În lista de inițiative menționate se regăsesc: implementarea a 2 milioane de GPU-uri NVIDIA suplimentare în infrastructura AWS în 2027–2028 ; aducerea pe AWS a infrastructurii bazate pe NVIDIA Vera (CPU), ca opțiune pentru sarcini de tip „agentic AI” (sisteme care pot planifica și executa acțiuni în lanț, nu doar genera răspunsuri); extinderea NVLink Fusion și colaborarea pe o memorie cu lățime mare de bandă, NVHBM (high-bandwidth memory personalizată), în contextul interoperabilității cu cipurile Trainium ale AWS; integrarea platformei NVIDIA cu AWS Nitro System și Elastic Fabric Adapter (EFA) , pentru securitate, fiabilitate și conectivitate în clustere mari; continuarea suportului pentru modelele deschise NVIDIA Nemotron în Amazon Bedrock și Amazon SageMaker; accelerarea procesării de date și a indexării vectoriale (operațiuni-cheie pentru căutare semantică și aplicații cu baze de date vectoriale) pe Amazon EMR și Amazon OpenSearch, cu biblioteci NVIDIA. Performanță și cost: ce cifre invocă AWS și NVIDIA Sursa indică mai multe repere de performanță, relevante pentru companiile care urmăresc costul de rulare (inferență) și viteza de procesare: pentru instanțele Amazon EC2 G7 , AWS menționează 4,6 ori performanță mai mare la inferență AI și 2,1 ori performanță grafică față de generația G6; AWS afirmă că este primul furnizor major de cloud care oferă instanțe accelerate de RTX PRO 4500 Blackwell ; pentru procesarea de date pe Amazon EMR cu instanțe G7 și biblioteca NVIDIA cuDF , colaborarea ar livra până la 3,7 ori procesare mai rapidă și o îmbunătățire de 30% a raportului preț/performanță față de configurații bazate pe CPU; pentru indexarea vectorială accelerată pe GPU în Amazon OpenSearch Service, este menționată o viteză de până la 9 ori mai mare, la un sfert din cost , prin mutarea construcției indexului pe GPU-uri dedicate. Componenta guvernamentală: „fabrici de AI” pentru SUA și 100.000 de GPU-uri Un element distinct al planului este orientarea către sectorul public american: AWS și NVIDIA spun că vor construi „fabrici de AI” pentru guvernul SUA și au în plan livrarea a 100.000 de GPU-uri pe infrastructură AWS securizată, pentru sarcini federale și de securitate națională. Sursa menționează rularea de sarcini clasificate la Impact Level 6 (IL6) și peste . De ce contează În termeni de piață, anunțul semnalează că AWS mizează pe extinderea agresivă a ofertei de calcul accelerat pentru a susține valul de cerere pentru AI „agentic” și „fizic” (robotică), într-un moment în care capacitatea de GPU a devenit un factor limitativ pentru multe organizații. În același timp, accentul pe integrare (Nitro/EFA, modele, pipeline-uri de date, rețelistică) sugerează o competiție care nu se mai poartă doar la nivel de „câte GPU-uri ai”, ci și la cât de repede pot clienții să treacă în producție și să opereze la scară, cu costuri controlabile. [...]