Голос и речь: опенсорс-модели для распознавания и синтеза
Обновлено · 7 проектов · часть каталога из 164 опенсорс-решений
Распознавание речи, синтез и клонирование голоса — от Whisper для транскрибации до лёгких TTS-моделей, которые работают локально.
Голос и речь
7 проектов в категории
-
Голос и речь
Whisper
openai/whisperРаспознавание речи на 99 языках. Чем ценно: превращаешь любое аудио и видео в текст — субтитры, расшифровки, поиск.
Открыть на GitHub -
Голос и речь
Faster Whisper
SYSTRAN/faster-whisperБыстрая локальная версия Whisper. Чем ценно: те же расшифровки в разы быстрее и без облака.
Открыть на GitHub -
Голос и речь
OpenVoice
myshell-ai/OpenVoiceКлонирование голоса. Чем ценно: озвучиваешь контент своим голосом на любом языке.
Открыть на GitHub -
Голос и речь
VoxCPM
OpenBMB/VoxCPMСинтез речи, 30 языков, с клонированием. Чем ценно: локальная озвучка для видео, ботов и приложений.
Открыть на GitHub -
Голос и речь
Pocket TTS
kyutai-labs/pocket-ttsЛёгкая TTS-модель для CPU. Чем ценно: голос в приложении без мощного железа и подписок.
Открыть на GitHub -
Голос и речь
Kokoro
hexgrad/kokoroЛокальный синтез речи. Чем ценно: качественная озвучка бесплатно и приватно.
Открыть на GitHub -
Голос и речь
Amphion
open-mmlab/AmphionОпенсорс-тулкит для генерации аудио, музыки и речи. Чем ценно: набор готовых моделей для TTS и смены голоса в одном месте — удобно для исследований и продакшена.
Открыть на GitHub
Подборка отражает находки на момент обновления страницы. Опенсорс-проекты быстро развиваются и иногда переезжают — если ссылка изменилась, найдите репозиторий по названию на GitHub. Проверяйте лицензию и актуальность перед использованием в продакшене.