Gemini 3.8 텍스트 음성 변환

2 hours ago 1

Google이 맞춤형 목소리 설계와 세밀한 연출에 초점을 맞춘 Gemini 3.8 Flash TTS, 대규모 음성 생성의 비용 효율성에 최적화한 Gemini 3.8 Flash-Lite TTS를 출시함 Flash TTS는 자연어로 새로운 목소리를 만들고, 2,000개 이상의 준비된 음성을 활용하거나 사용 권한이 있는 목소리를 30초 샘플로 복제할 수 있음 두 모델 모두 대사별 연출을 지원하며, 장시간 음성의 일관성 유지, 두 화자의 자연스러운 대화, 웃음과 한숨 및 맞장구까지 제어할 수 있음 100개 이상의 언어를 지원하며, Hume AI의 Overall Quality Index에서 Flash TTS와 Flash-Lite TTS가 각각 1위와 2위를 기록함 음성 복제에는 목소리 소유자의 구두 동의 검증이 필요하며, Gemini Audio 모델이 생성하는 모든 오디오에는 SynthID 워터마크가 삽입됨 창작용 Flash TTS와 대규모 생성용 Flash-Lite TTS Gemini 3.8 Flash TTS는 게임, 몰입형 오디오북, 팟캐스트, 인터랙티브 미디어의 캐릭터 설계와 세밀한 음성 연출에 초점을 맞춤 자연어 프롬프트로 새로운 목소리를 만들고, 대사마다 연기 지시, 말의 속도와 호흡, 방언 전환, 맞장구를 제어할 수 있음 Gemini 3.8 Flash-Lite TTS는 대규모 더빙, 오디오 콘텐츠 제작, 표현력 있는 음성 에이전트를 비용 효율적으로 운영하도록 최적화됨 어조, 속도, 표현의 미묘한 차이를 세밀하게 조절할 수 있음 두 모델은 3.5 Live Translate, 3.5 Transcribe, 3.8 Live 및 3.8 Live Extended Thinking에 이어 Gemini Audio 제품군에 추가됨 목소리 생성, 복제, 저장과 리믹스 Flash TTS의 생성형 음성 설계는 기존 30개 목소리에서 출발해 사실상 무제한의 맞춤형 음성 라이브러리로 확장할 수 있게 함 100개 이상의 언어와 방언에서 역할, 억양, 목소리 특성을 자연어로 지정할 수 있음 불을 뿜는 극적인 용이나 지역 특유의 운율을 지닌 내레이터처럼 독창적인 캐릭터와 일관된 브랜드 목소리를 만들 수 있음 시연에는 활기찬 멜버른 DJ, 매우 가늘고 단조로운 로봇, 일본어로 말하는 용의 목소리가 포함됨 2,000개 이상의 제작용 음성을 제공하며, 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 같은 지역별 변형도 지원함 음성 복제는 본인 ...

Read Entire Article