Inteligență artificială24 sept. 2026
Google lansează modelele Gemini 3.8 Flash TTS și Flash-Lite TTS - generare vocală personalizată și replicare de voce cu verificare de consimțământ și watermark SynthID
Google extinde Gemini cu două modele TTS care mută generarea de voce spre producție la scară și control fin , cu implicații directe pentru costuri și fluxuri de lucru în dublaj, conținut audio și agenți vocali, potrivit Google Blog . Noile modele — Gemini 3.8 Flash TTS și Gemini 3.8 Flash-Lite TTS — sunt poziționate ca instrumente pentru „regie” vocală (inclusiv dialoguri) și pentru volume mari, cu accent pe personalizare și consistență. Două modele, două utilizări: control creativ vs. volum mare Google separă explicit cazurile de utilizare: Gemini 3.8 Flash TTS : orientat spre „direcție creativă” și design de personaje, cu posibilitatea de a crea voci noi prin instrucțiuni în limbaj natural și de a controla livrarea „linie cu linie” (indicii de actorie, ritm, schimbări de dialect, „backchanneling” – interjecții de tip „mhm/yeah” care fac dialogul să sune natural). Gemini 3.8 Flash-Lite TTS : orientat spre scalare eficientă ca preț și volume mari (dublaj, creare de conținut audio, agenți vocali), păstrând controlul asupra tonului și ritmului. Ambele sunt integrate în ecosistemul Gemini: Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook și Google Vids . Ce aduce nou operațional: bibliotecă mare, replicare și „scenă” cu doi vorbitori Dincolo de generarea de voce, Google descrie funcții care țintesc direct producția: „De la 30 de voci originale la o bibliotecă infinită” : modelul Flash TTS poate genera voci „de la zero”, cu rol, accent și caracteristici ale vocii în peste 100 de limbi și dialecte . Bibliotecă de peste 2.000 de voci „gata de producție” , inclusiv varietăți regionale (exemple date: spaniolă mexicană, franceză din Quebec, engleză scoțiană). Replicare de voce dintr-un eșantion de 30 de secunde , cu condiția ca utilizatorul să aibă dreptul de utilizare; Google spune că include verificare de consimțământ, „watermarking” (marcare invizibilă) cu SynthID și acreditări C2PA. Generare pe termen lung : menținerea calității și a „timbrelor” pe ore de audio, cu „drift” minim (degradarea consistenței vocii în timp), util pentru podcasturi și audiobookuri. „Staging” nativ pentru două voci : scenarii de conversație dintr-un singur script, cu alternanță naturală a replicilor. Google menționează și o funcție „voice remixing” (remixare de voce) ca fiind „în curând”, pentru ajustări de timbru, înălțime, ritm și accent pornind de la o voce din bibliotecă. Performanță și comparații: benchmarkuri externe invocate de Google Pentru a susține poziționarea, compania citează rezultate în evaluări externe: #1 pe „Voice Design Benchmark” al Hume AI (71,4) și lider la „accent modeling” (60,8), conform Hume AI . #1 și #2 pe „Overall Quality Index” (tot Hume AI) pentru Flash TTS, respectiv Flash-Lite TTS. În evaluări „blind” de preferință umană pe Voice Arena , modelele ar obține poziții de top în mai multe limbi (inclusiv japoneză, portugheză braziliană, vietnameză, arabă standard modernă, spaniolă mexicană și hindi). Publicația afirmă și îmbunătățiri față de Gemini 3.1 Flash TTS pentru utilizări precum conținut „long-form” și controlul scenariilor cu doi vorbitori, fără a detalia valori comparative. Garduri de siguranță: consimțământ și marcaj SynthID Pe zona de risc (impersonare, dezinformare), Google spune că: pentru replicarea vocii este necesară verificarea consimțământului , printr-o înregistrare verbală a proprietarului vocii care trebuie să corespundă cu vorbitorul de referință; fiecare clip audio generat de modelele Gemini Audio este marcat cu SynthID (watermark imperceptibil) pentru detectabilitate; detalii suplimentare sunt disponibile în model card și pe pagina SynthID . Disponibilitate: unde intră în producție, de azi și „în curând” Google indică un calendar de lansare în valuri: Gemini 3.8 Flash TTS : începe „de azi” pentru dezvoltatori: în Gemini API și Google AI Studio (documentație: speech generation ); pentru companii: „în curând” prin API în Gemini Enterprise; pentru toți: în Gemini Notebook. Gemini 3.8 Flash-Lite TTS : începe „de azi” pentru dezvoltatori: în Gemini API și Google AI Studio; pentru companii: „în curând” prin API în Gemini Enterprise; pentru toți: în Google Vids. În zona de integrare, Google spune că platforme precum Agora (documentație: Agora ), LiveKit, Pipecat și Vercel pot folosi Gemini API pentru a construi interfețe vocale, iar parteneriatele menționate includ Figma, HeyGen, Linguana, Wondercraft, 99.co și Ollang, cu obiective precum dublaj global, localizare și agenți conversaționali la scară. [...]