Alibaba выпустила открытую модель CosyVoice 3 для клонирования голоса
Ключевые факты
- 1 Alibaba выпустила открытую модель CosyVoice 3.
- 2 Модель имеет 0,5 млрд параметров.
- 3 Клонирует голос за 3 секунды с сохранением всех особенностей.
- 4 Поддерживает клонирование в реальном времени с задержкой 150 мс.
- 5 Понимает и воспроизводит эмоции и речевые дефекты.
- 6 Доступна для коммерческого использования по лицензии Apache 2.0.
Alibaba выпустила CosyVoice 3, передовую модель для синтеза и клонирования голоса, доступную в open source. Модель, несмотря на относительно небольшое количество параметров (0,5 млрд), демонстрирует высокое качество, превосходящее более крупные аналоги. CosyVoice 3 способна точно клонировать голос всего за 3 секунды, воспроизводя акцент, тембр, скорость, ударения и даже речевые дефекты. Она также понимает и воспроизводит эмоциональные нюансы и особенности речи, включая невербальные звуки. Модель поддерживает клонирование голоса в реальном времени с минимальной задержкой около 150 мс и предоставляет возможность ручного редактирования произношения отдельных слов. Разработчики сразу предоставили лицензию на коммерческое использование, что делает CosyVoice 3 применимой в различных проектах.