ForwardTacotron и HiFi-GAN поддержка NVDA Screen reader
**Примечание: данное дополнение, а также документация находятся в стадии разработки. Ваш вклад приветствуется!
Напомним, что ForwardTacotron - это модель синтеза речи в pytorch, которая использует предиктор длительности для выравнивания текста и генерируемых mel-спектрограмм. Модель обладает такими преимуществами, как робастность, скорость, возможность работы с питчем и энергией, а также эффективность.
Итак, данный плагин является попыткой реализовать поддержку ForwardTacotron в открытом скринридере NVDA через клиент/сервер, поскольку библиотеки, используемые в качестве torch, невозможно включить в NVDA напрямую.
Работа в этом направлении продолжается, и поэтому предстоит еще многое сделать.
Тем временем вы можете послушать, что уже сделано.
| Язык | Голос | Образец | |
|---|---|---|---|
| English | LJSpeech (с вокодером griffinLim) | ||
| English | LJSpeech (с вокодером HiFi-GAN) | ||
| Spanish | Ald Dataset (с HiFi-GAN вокодером) | ||
| Spanish | Odal (с вокодером HiFi-GAN, универсальная модель) |