Это дополнение реализует драйвер синтезатора речи для NVDA, используя Piper.
Piper - это быстрая, локальная нейронная система преобразования текста в речь, которая отлично звучит и оптимизирована для устройств низкого класса, таких как Raspberry Pi.
Образцы речи можно послушать здесь: Piper voice samples.
В данном дополнении используется Rust-порт Piper, который разрабатывается Мушаррафом Омером.
Пакет дополнения можно найти в разделе assets на странице release page
Дополнение представляет собой только драйвер, по умолчанию оно не содержит голосов. Вам необходимо скачать и установить нужные голоса вручную.
После установки дополнения и перезапуска NVDA, дополнение попросит вас загрузить и установить хотя бы один голос. Также будет предложено открыть веб-страницу загрузки голосов.
Вы также можете открыть веб-страницу загрузки голосов из категории Piper в настройках NVDA.
Каждый голос доступен в виде файла .tar.gz, который представляет собой архивный формат, аналогичный архивам .zip и .rar. Архив содержит модель голоса и его конфигурации.
Обратите внимание, что мы рекомендуем выбирать голоса с качеством low или x-low для вашего целевого языка (языков), поскольку они обычно обеспечивают лучшую производительность.
После загрузки голоса зайдите в настройки NVDA и выберите категорию Piper, а затем нажмите кнопку Установить из файла. Выберите загруженный файл, подождите, пока голос установится, и перезапустите NVDA, чтобы обновить список голосов.
Имеющиеся в настоящее время голоса обучены на основе свободно распространяемых наборов данных TTS, которые, как правило, имеют низкое качество (в основном это аудиокниги, находящиеся в открытом доступе, или записи исследовательского качества).
Кроме того, эти наборы не являются полными, поэтому некоторые голоса могут демонстрировать неправильное или странное произношение. Обе проблемы можно решить, если использовать для обучения более качественные наборы данных.
К счастью, разработчик Piper и некоторые разработчики из сообщества слепых и слабовидящих работают над обучением более качественных голосов.
Copyright(c) 2023, Мушарраф Омер. Данное программное обеспечение лицензируется на условиях GNU GENERAL PUBLIC LICENSE Version 2 (GPL v2).