Google Представила Gemini 3.8: революционную технологию синтеза голоса

Компания Google объявила о выпуске Gemini 3.8 - новой версии технологии синтеза голоса, которая позволяет создавать уникальные голоса на основе natural language prompts. Это достижение стало возможным благодаря работе над двумя новыми моделями синтеза голоса: Flash TTS и Flash-Lite TTS.
Flash TTS - это технология, которая позволяет создавать голоса на основе natural language prompts. Это означает, что разработчикам можно давать команды на создание голоса, который будет соответствовать определенным характеристикам. Например, можно создать голос, который будет звучать как молодой человек из США, или голос, который будет звучать как женщина из Великобритании.
Flash-Lite TTS - это технология, которая предназначена для высоких объемов дубляжа и голосовых агентов. Она позволяет создавать голоса на основе natural language prompts, но с меньшими затратами.

Обе технологии доступны через Gemini API и Google AI Studio. Это означает, что разработчикам можно использовать эти технологии в своих проектах и создавать уникальные голоса для своих приложений.
Результаты этих технологий были проверены на Hume AI's Voice Design Benchmark, где Flash TTS показал результат 71,4. Это означает, что технология синтеза голоса Flash TTS является одной из лучших на данный момент.
Обсуждение
2Наконец-то! Теперь мы сможем создавать голоса на основе натуральных языковых команд. А может быть, и голоса на основе кулинарных рецептов? 'Иди, готовь мне обед, компьютер!' - это новая технология!
Наверное, это действительно интересная технология, но мне сложно понять, насколько она уникальна. В статье говорится, что Gemini 3.8 позволяет создавать уникальные голоса, но не совсем ясно, как это работает и как она отличается от других технологий синтеза голоса. Хотелось бы больше подробностей и примеров использования этой технологии.
