Știri
Știri din categoria Inteligență artificială

Google își mută accentul pe „agenți” și automatizare, cu modele Gemini mai eficiente și instrumente care pot acționa în conturile utilizatorilor, potrivit Google AI Blog, într-un rezumat al principalelor anunțuri din iulie 2026. Miza operațională este reducerea costurilor și a timpilor de răspuns pentru aplicații AI rulate în producție, dar și extinderea capabilităților către sarcini concrete, inclusiv în lumea fizică (robotică) și pe web.
Google spune că a lansat trei modele noi din familia Gemini – Gemini 3.6 Flash, 3.5 Flash-Lite și 3.5 Flash Cyber – orientate către dezvoltatori și companii care construiesc „agenți” AI (sisteme care pot planifica și executa sarcini). Argumentul central este eficiența: mai bună utilizare a „tokenilor” (unități de text procesate de model), latență mai mică și performanță mai predictibilă, pentru a putea scala fluxuri de lucru „agentice” în producție. Detaliile sunt prezentate în materialul dedicat despre modele: Gemini 3.6 Flash, 3.5 Flash-Lite și 3.5 Flash Cyber.
O schimbare cu impact direct asupra modului de utilizare este extinderea Gemini Spark către mai mulți utilizatori la nivel global și adăugarea unei funcții prin care, cu permisiunea utilizatorului, Spark poate folosi conturi autentificate și parole salvate pentru a rezolva „comisioane” pe web (de exemplu, programarea unor vizionări pentru apartamente sau căutarea opțiunilor de zbor și inițierea rezervării). Google descrie aceste actualizări aici: Gemini Spark.
În paralel, compania anunță că extinde conectarea aplicațiilor la Search, astfel încât utilizatorii să poată lega în mod securizat servicii uzuale (exemplul menționat este YouTube Music) și să interacționeze cu ele direct în „AI Mode”. Contextul este prezentat în: Connected apps.
Pe zona de automatizare în lumea fizică, Google anunță Gemini Robotics ER 2, pe care îl numește cel mai capabil model de „embodied reasoning” (raționament întrupat) de până acum – adică un model proiectat să lege „inteligența” digitală de percepția și acțiunea în mediul real. Conform descrierii, ER 2 ar permite sistemelor să converseze natural, să înțeleagă mediul și să ducă la capăt sarcini complexe, în mai mulți pași. Detalii: Gemini Robotics ER 2.
În ecosistemul Google, compania poziționează „Gemini Notebook” ca produs de sine stătător (același cu NotebookLM), dar extins „în ecosistem”, inclusiv în aplicația Gemini și în Google Search, și actualizat cu un „computer cloud securizat”. Prezentarea este aici: Gemini Notebook.
Pentru clienții Google Cloud, Google spune că a făcut disponibil în regim general AlphaEvolve, un agent de optimizare a codului „alimentat de Gemini”, pe Gemini Enterprise Agent Platform. Logica de utilizare: utilizatorul oferă un algoritm de bază și obiectivele, iar sistemul caută soluții mai bune și returnează cod optimizat, „ușor de înțeles” pentru oameni. Detalii: AlphaEvolve pe Google Cloud.
În același rezumat, Google mai indică:
Separat, fondatorul Google DeepMind, Demis Hassabis, își prezintă viziunea într-un material publicat pe LinkedIn: Demis Hassabis.
Pentru piață, mesajul principal al pachetului de anunțuri este că Google împinge AI-ul din zona de asistență conversațională către sisteme mai eficiente și mai „executive” (agenți), cu implicații directe pentru companii: costuri de rulare, timpi de răspuns, integrare cu aplicații și, în unele cazuri, automatizare care poate opera efectiv în conturile utilizatorilor – ceea ce ridică, inevitabil, miza pe controlul permisiunilor și securitate, chiar dacă rezumatul nu intră în detalii de reglementare.
Recomandate

Gemini Spark primește integrare directă cu Chrome , ceea ce îi permite să folosească (cu acordul utilizatorului) conturile autentificate și parolele salvate pentru a automatiza sarcini pe web , potrivit Google Blog . Funcția vizează „comisioane” online mai complexe — de la programarea unor vizionări pentru apartamente salvate până la căutarea opțiunilor de zbor și inițierea procesului de rezervare — dar păstrează utilizatorul în control pentru acțiuni sensibile, precum plățile. Integrarea cu Chrome extinde capabilitățile de navigare ale Spark prin acces la sesiunea de autentificare din browser, ceea ce poate reduce pașii manuali în fluxuri care, în mod normal, cer completări repetate și logări. Google precizează că aceste acțiuni se fac „cu permisiunea” utilizatorului și că, pentru operațiuni sensibile, sarcina este returnată utilizatorului pentru confirmare și finalizare. Securitate și limitări de lansare Google menționează că noua funcționalitate este construită cu protecții împotriva unor amenințări precum „prompt injection” (o tehnică prin care un atacator încearcă să manipuleze instrucțiunile unui model de inteligență artificială pentru a-l determina să execute acțiuni nedorite). În același timp, compania subliniază că utilizatorul rămâne „în buclă” pentru decizii critice, în special cele legate de plăți. Capabilitățile de „auto browse” prin Chrome sunt, în primă fază, în curs de lansare în SUA, cu planuri de extindere în alte regiuni ulterior. Google nu oferă un calendar pentru extinderea internațională. Extinderea accesului: peste 160 de țări, pentru abonații Google AI Pro Separat de integrarea cu Chrome, Google anunță extinderea accesului la Spark pentru abonații Google AI Pro în „peste 160 de țări” suplimentare, începând de astăzi. Miza operațională este creșterea bazei de utilizatori care pot folosi Spark pentru automatizarea sarcinilor zilnice, însă articolul nu detaliază ce piețe sunt incluse sau dacă există diferențe de funcționalitate între regiuni. Pentru lista țărilor, Google indică o pagină de suport. [...]

Google suspendă funcția de generare de imagini cu AI din Google Earth , după ce au apărut utilizări care ar încălca politicile companiei, o decizie cu impact operațional direct pentru utilizatorii și profesioniștii care o foloseau în fluxuri de lucru, potrivit Economica . Funcția, bazată pe modelul de inteligență artificială Nano Banana 2 , permitea crearea de imagini fotorealiste pornind de la imaginile satelitare, aeriene și 3D din Google Earth, prin introducerea unei descrieri text pentru orice locație de pe glob, relatează News.ro (care citează poziția Google). De ce a retras Google funcția: risc de dezinformare și încălcări ale politicilor Instrumentul a fost criticat pentru riscul de dezinformare, deoarece putea genera scene fictive suprapuse peste imagini reale ale unor monumente și obiective turistice. Google a transmis pe platforma X că a observat atât utilizări „în scopuri utile” în zona geospațială, cât și distribuirea unor imagini generate care „par să încalce politicile” companiei. În consecință, funcția este suspendată „până la introducerea unor măsuri de protecție suplimentare”. „Am văzut profesionişti din domeniul geospaţial folosind această funcţie în scopuri utile, însă am observat şi utilizatori care au distribuit imagini generate ce par să încalce politicile noastre.” Ce știm și ce rămâne neclar Compania nu a precizat ce tipuri de imagini au încălcat regulile sale, dar a subliniat că acestea nu apăreau în experiența principală Google Earth și erau marcate vizibil ca fiind generate cu ajutorul inteligenței artificiale. Context: limitări repetate ale funcțiilor AI în marile platforme Reuters notează că marile companii de tehnologie au fost nevoite în repetate rânduri să limiteze sau să dezactiveze funcții bazate pe inteligență artificială, pe fondul problemelor legate de dezinformare, utilizarea abuzivă și protecția vieții private. Ca exemplu recent, la începutul lunii, Meta a renunțat la funcția Muse Image, care genera imagini folosind fotografii publice de pe Instagram, după critici privind confidențialitatea. Pentru utilizatori, suspendarea din Google Earth înseamnă, practic, indisponibilitatea temporară a unei funcții de generare vizuală, până când Google va anunța măsuri suplimentare de protecție și, eventual, relansarea acesteia. [...]

Google a retras rapid o funcție de generare de imagini în Google Earth , după ce a fost criticată pentru riscul de dezinformare , iar compania spune că lucrează la „bariere” mai puternice înainte de o eventuală revenire, potrivit The Jerusalem Post . Funcția, prezentată inițial joi, permitea utilizatorilor să suprapună peste imaginile reale din hărțile satelitare Google Earth imagini false, dar cu aspect realist. În anunțul de lansare, Google a susținut că instrumentul poate „aduce istoria la viață” sau poate „transforma” un loc și a indicat utilizări precum planuri imobiliare sau infografice personalizate. La o zi după, compania a făcut pasul înapoi și a anunțat că lucrează la întărirea măsurilor de protecție pentru generarea de imagini. Google a motivat decizia și prin nivelul ridicat de încredere asociat produsului: „Știm că oamenii au în mod special încredere în Google Earth pentru o vedere fiabilă asupra lumii”, se arată în declarația citată de publicație. Compania spune că a văzut profesioniști din zona geospațială folosind funcția în scopuri utile, dar și distribuirea de capturi de ecran cu imagini generate care „par să încalce politicile” sale. De ce nu ajunge un filigran Google a precizat că imaginile generate de inteligența artificială erau marcate (watermark/filigran) ca atare. Totuși, Hank van Ess , expert în metode de cercetare online, a scris într-o postare pe blog că filigranul ar funcționa doar în ecosistemul Google — de exemplu, când o imagine este analizată cu Gemini. În același sens, Emmanuelle Saliba, director de investigații la compania de detecție a conținutului generat de AI GetReal, a declarat pentru The Washington Post (citată de The Jerusalem Post) că astfel de măsuri sunt insuficiente pentru a preveni dezinformarea, deoarece nu schimbă modul în care oamenii consumă informația: imaginile sunt văzute și redistribuite în câteva secunde, în timp ce verificarea autenticității cere timp și context, „punând povara pe consumator”. Un risc suplimentar: „alibiul” pentru negarea realității Van Ess a semnalat și un risc din direcția opusă: nu doar ca publicul să fie indus în eroare de imagini false, ci ca existența unui astfel de instrument să ofere autorităților un pretext pentru a respinge imagini reale drept fabricate. „Un oficial poate acum să se uite la o fotografie autentică a unei atrocități reale și să spună: AI.” Ce urmează Din informațiile prezentate, Google nu a indicat un calendar pentru reintroducerea funcției, ci doar că lucrează la „guardrails” (măsuri de limitare și control) mai puternice pentru generarea de imagini. Retragerea rapidă sugerează că, în cazul produselor cu reputație de sursă „de încredere”, riscul de utilizare abuzivă poate cântări mai mult decât potențialele utilizări legitime. [...]

Google DeepMind deschide accesul dezvoltatorilor la Gemini Robotics ER 2 , un model de „raționament întrupat” gândit ca un „creier” de nivel înalt pentru roboți, care urmărește fluxuri video continue, orchestrează sarcini în mai mulți pași și poate coordona mai mulți roboți în același spațiu, potrivit Google Blog . Miza practică este reducerea blocajelor operaționale din robotică (pauze de tip „oprește-te și gândește”) și creșterea fiabilității în execuție, inclusiv prin latență sub-secundă pentru scenarii sensibile la timp. Ce se schimbă operațional: video continuu, autocorecție și colaborare între roboți Google descrie Gemini Robotics ER 2 ca un model care poate conversa cu oamenii, înțelege mediul fizic și planifica sarcini în mai mulți pași, apoi „predă” execuția motorie către un model de tip VLA (vision-language-action – modele care leagă percepția vizuală și limbajul de comenzi de acțiune). În plus, modelul poate apela nativ instrumente precum Google Search sau funcții definite de utilizator. Upgrade-ul față de versiunea anterioară (Gemini Robotics ER 1.6) este legat de utilizarea fluxurilor video continue: robotul își poate urmări progresul, se poate adapta când apar erori și știe când să treacă la pasul următor. O noutate separată este „multi-robot collaboration”, adică posibilitatea ca roboți diferiți să lucreze împreună în spații comune pentru fluxuri de lucru pe care un singur robot nu le-ar putea duce la capăt. Acces pentru dezvoltatori: API, AI Studio și preview pentru companii Modelul este disponibil public dezvoltatorilor prin: Gemini API Google AI Studio Pentru zona enterprise, Google spune că ER 2 este disponibil în „private preview” pe Gemini Enterprise Agent Platform . Compania publică și exemple de configurare și „prompting” (instrucțiuni pentru model) în notebook-uri, inclusiv pe GitHub . De ce contează latența: integrare cu Gemini Live API și demo pe Spot În robotică, viteza de execuție influențează direct siguranța și utilitatea. Google afirmă că ER 2 se integrează în Gemini Live API , printr-un endpoint de streaming bidirecțional optimizat pentru sarcini sensibile la latență, pentru a evita pauzele vizibile în orchestration. Ca exemplu, Google a construit un demo cu robotul Spot de la Boston Dynamics , în care ER 2 orchestrează Spot APIs (navigație și mișcarea manipulatorului) pentru a aduce obiecte la comandă în limbaj natural. Există și un set de exemple suplimentare pe GitHub . Măsurători publicate: progres în timp și „moment finding” Google susține că ER 2 aduce un salt în „înțelegerea video” și urmărirea progresului, pentru a verifica dacă sarcini precum strângerea unui bec sau legarea unui sac de gunoi sunt finalizate corect înainte de a trece mai departe. În evaluările descrise: la „progress classification” (încadrarea fiecărui cadru video într-un nivel de progres 0–20%, 20–40%, 40–60%, 60–80%, 80–100%), modelul atinge 57,4% acuratețe ; la „moment finding” (identificarea exactă a cadrului în care are loc un eveniment critic, de exemplu când trebuie oprit turnatul cafelei), Google indică 91,3% acuratețe și 0,96 secunde distanță medie absolută; compania afirmă și 4x viteză de execuție și „o fracțiune” din costul de calcul față de categorii mai mari de modele, fără a detalia baza de comparație. Siguranță: oprire lângă oameni și un nou benchmark Google afirmă că ER 2 este „cel mai sigur” model al său în această categorie, cu îmbunătățiri pe benchmark-uri de „Safety Instruction Following” și „Human Proximity”. Un exemplu menționat este oprirea unui robot umanoid când o persoană este în apropiere și reluarea autonomă a activității doar după eliberarea zonei. Compania anunță și introducerea unui benchmark care evaluează capacitatea unui model de bază de a acționa ca orchestrator VLA „sigur”, inclusiv prin impunerea constrângerilor de siguranță, monitorizarea mediului, evaluarea fezabilității fizice și solicitarea de clarificări umane. Ce urmează Google spune că intenționează să împingă aceste modele către sarcini și mai complexe, cu obiectivul de a accelera dezvoltarea roboților „utili” și de a sprijini comunitatea de robotică. Pentru detalii tehnice, compania trimite la pagina de model: Gemini Robotics ER 2 și la contextul versiunii anterioare: Gemini Robotics ER 1.6 . [...]

Google extinde generarea de muzică cu IA în Flow Music prin lansarea Lyria 3.5 , un model care aduce utilizatorilor mai mult control asupra rezultatului (inclusiv tempo și durată) și promite îmbunătățiri la nivel de muzicalitate, versuri și voci, potrivit Google Blog . Actualizarea este disponibilă „de astăzi” în Google Flow Music , ceea ce mută accentul de pe simple demonstrații de tehnologie pe utilizare practică, direct într-un produs. Ce se schimbă, concret, în Flow Music Google spune că Lyria 3.5 aduce patru direcții principale de îmbunătățire: Muzicalitate îmbunătățită : modelul ar genera structuri melodice mai bogate și mai complexe, cu un sunet mai natural. Versuri mai bune : calitatea versurilor ar crește, cu o respectare mai bună a instrucțiunilor din prompt (cererea utilizatorului) și cu „conștientizare” mai bună a structurii. Voci îmbunătățite : vocile ar fi mai realiste și mai nuanțate emoțional, cu pronunție mai bună. Control creativ : utilizatorii pot controla mai ușor tempo-ul și durata rezultatelor generate. De ce contează pentru utilizatori și pentru produs Dincolo de promisiunea unei calități mai bune, elementul cu impact operațional este controlul mai fin asupra parametrilor (tempo și durată), care poate reduce numărul de iterații necesare până la un rezultat utilizabil. Google poziționează lansarea ca o extindere a capacității de a crea „piese mai bogate”, direct în Flow Music, unde utilizatorii pot testa modelul imediat. Google nu oferă, în materialul citat, detalii despre disponibilitate pe regiuni, prețuri sau condiții comerciale pentru accesul la Flow Music. [...]

Gemini pentru macOS primește dictare „inteligentă” și opțional acces la contextul de pe ecran , o schimbare care poate reduce timpul de redactare și editare direct în aplicațiile folosite zilnic, potrivit Google Blog . Noua funcție permite utilizatorilor să vorbească „natural” către Gemini prin apăsarea prelungită a tastei Fn, din orice fereastră de pe desktop. În modul implicit, aplicația face transcriere și „curățare” automată a textului dictat: elimină interjecții de tip „ăă”/„îî”, surprinde corecțiile făcute la mijlocul frazei și inserează textul formatat direct la cursor. Ce se schimbă operațional pentru utilizatori Pe lângă dictare, Google introduce o opțiune separată în setări, numită „ Gemini reasoning ”, care extinde funcționalitatea de la transcriere la executarea de sarcini mai complexe, pe baza contextului de pe ecran (adică înțelegerea a ceea ce este evidențiat sau vizibil în lucru). Exemplele oferite de companie includ: Extragere și rezumare de informații din fișiere locale, imagini sau documente evidențiate (de exemplu, rezumarea unor documente într-un e-mail). Compunere și rescriere de text oriunde pe ecran, cu ajustarea tonului și inserarea rezultatului în locul dorit (inclusiv formate de tip rezumat executiv cu „TL;DR”). Generare și editare de imagini prin comenzi vocale, inclusiv iterarea pe un design existent (de exemplu, o variantă „dark mode”). Disponibilitate și distribuție Funcția vocală nouă este în curs de lansare la nivel global pentru toți utilizatorii aplicației Gemini pentru macOS, în limba engleză , iar Google spune că vor urma și alte limbi. Aplicația poate fi descărcată de la https://gemini.google/mac/ . Google menționează și politica sa de confidențialitate, disponibilă la https://policies.google.com/privacy , fără a detalia în acest material condiții suplimentare legate de date pentru această funcție. [...]