Gemini 3.8 Flash TTS: Δυναμική φωνογένεση με φυσική γλώσσα και έλεγχο απόδοσης
Πρωτότυπος τίτλος: "Gemini 3.8 text-to-speech" (από swolpers)
Το Google ανακοίνωσε τα Gemini 3.8 Flash TTS και Flash-Lite TTS, δύο μοντέλα text-to-speech που επιτρέπουν δημιουργία προσαρμοσμένων φωνών και ακριβή έλεγχο της απόδοσης scène μέσω φυσικής γλώσσας. Τα μοντέλα υποστηρίζουν πάνω από 100 γλώσσες, προσφέρουν φωνοπλοκή, reproducing και watermarking SynthID για ασφαλή και διαφανή χρήση.
Φωνογένεση και προσαρμογή φωνών
Τα Gemini 3.8 Flash TTS και Flash‑Lite TTS μετατρέπουν τη φωνογένεση από στατικά presets σε δυναμικό creative studio. Με φυσική γλώσσα prompting μπορείτε να ορίσετε ρόλο, προφορά και χαρακτηριστικά φωνής σε περισσότερες από 100 γλώσσες και διαλέκτους, δημιουργώντας από το μηδέν φωνές για χαρακτήρες, νarraτores ή brand ambassadors. Η πλατφόρμα προσφέρει además μια βιβλιοθήκη 2 000+ ετοιμών φωνών με υποστήριξη περιοδικών παραλλαγών (π.χ. Mexican Spanish, Quebec French, Scots English).
Έλεγχος απόδοσης scène γραμμή‑γραμμή
Μετά την επιλογή φωνής, τα μοντέλα δίνουν λεπτομερή έλεγχο του τρόπου παράδοσης κάθε γραμμής. Μπορείτε να γράψετε stage directions ή να αφήσετε το Gemini να καθοδηγήσει την παρουσίαση με φυσικά σενια cues. Υποστηρίζονται long‑form generation με ελάχιστο speaker drift, native two‑speaker scene staging για διαλόγους, καθώς και scripted vocal bursts & backchanneling (π.χ. <laughs>, |mhm|) για realistiki conversaciónale υφή.
Ασφάλεια, συγκατάθεση και διαφάνεια
Η δημιουργία φωνών μέσω replication απαιτεί spoken consent από τον ιδιοκτήτη της φωνής, ενώ κάθε εξαγωγή είναι watermarked με SynthID, ένα αόρατο σήμα που ενσωματώνεται στο ήχο και επιτρέπει ανίχνευση AI‑generated περιεχομένου. Τα μοντέλα συμμορφώνονται με το model card του Gemini 3.8 audio για προστασία φωνητικού ταλέντο και avoidance of misinformation.
Ενσωμάτωση και ανάπτυξη
Οι προγραμματιστές μπορούν να δοκιμάσουν τα μοντέλα στο Google AI Studio audio playground ή να τα ενσωματώσουν μέσω του Gemini API. Υπάρχουν έτοιμες ενσωματώσεις σε πλατφόρμες όπως Agora, LiveKit, Pipecat και Vercel, επιτρέποντας την γρήγορη ανάπτυξη high‑performance voice interfaces σε προϊόντα όπως το Gemini Notebook και το Google Vids.
Ανακαλύψτε καινοτόμα open-source εργαλεία και κρυμμένα διαμάντια ανοιχτού κώδικα.