Когда выбираете Gemini, можно сделать обычную озвучку текста или подкаст с двумя голосами.
Для обычной озвучки — выпадающий список, где выбираете голос, и рядом список "Фильтр по полу" — все голоса, только мужские или только женские. Рядом кнопка для эмоциональных тегов: нажимаете, выбираете тег, потом пишете текст. Если дальше по тексту хочется ещё одну эмоцию — снова нажимаете кнопку, выбираете следующий тег, пишете дальше. Так можно чередовать сколько угодно раз.
Для подкаста появляются два выпадающих списка голосов — свой для первого собеседника, свой для второго. У каждого голоса можно, по желанию, задать своё имя (по умолчанию "Спикер1" и "Спикер2"). Дальше — одно поле ввода, куда пишете саму реплику, без имени. Под ним — две кнопки, подписанные именами ваших собеседников. Написали реплику, нажали нужную кнопку — она добавляется в общий сценарий уже с именем говорящего, а поле ввода очищается для следующей фразы. Так по очереди строите весь диалог.
Ниже — необязательное поле для названия файла. Дальше кнопки: "Создать Аудио", "Воспроизвести", "Сохранить" и "Открыть папку" — чтобы сразу найти готовый файл на диске.
Кнопка настроек открывает окно, где вставляете ключ API Gemini, сохраняете, сбрасываете, переходите на сайт за новым ключом, и выбираете одну из моделей озвучки. Моделей три: одна точно бесплатная (Gemini 3.1 Flash TTS Preview), и ещё две — Gemini 2.5 Flash Preview TTS и Gemini 2.5 Pro Preview TTS — на платном тарифе, качество озвучки у них выше.
Когда выбираете ElevenLabs, точно так же можно сделать обычную озвучку текста или подкаст с двумя голосами.
Вверху окна — список "Режим генерации": "Текст в Аудио" или "Подкаст (два голоса)". От выбора зависит, какие поля видны ниже.
В списке моделей каждая сама описывает, что умеет. Например: "Eleven v3 — самая выразительная. Поддерживает подкаст, не поддерживает регулировку скорости речи и сходства голоса." Остальные модели, наоборот, поддерживают ползунки скорости и сходства, но не поддерживают подкаст.
Качество итогового аудио подбирается автоматически, без какого-либо участия — по тарифу вашего ключа ElevenLabs. На тарифах Creator и выше используется более высокое качество (192 кбит/с), на бесплатном и начальном тарифе — обычное (128 кбит/с). Действует и для обычной озвучки, и для подкаста.
Для обычной озвучки — фильтр по полу, список голосов (тянется прямо из вашей личной библиотеки ElevenLabs, а не из фиксированного набора, как у Gemini), поле для текста со счётчиком символов под ним, и кнопка "Прослушать голос" — можно заранее услышать выбранный голос до самой генерации. Список "Режим" — Стабильный, Сбалансированный или Креативный — виден и работает в обоих режимах генерации, и в обычной озвучке, и в подкасте.
Для подкаста экран делится на две одинаковые половины — для первого собеседника и для второго. У каждого свои: фильтр по полу голоса, список голосов, кнопка "Прослушать голос", и поле для имени.
Ниже — общее поле для одной реплики и две кнопки с именами собеседников. Что вписано в поле имени, так и называется кнопка, и ровно это имя попадает в сценарий. Пустое поле имени — кнопка называется "Спикер 1" или "Спикер 2". Эти же две кнопки позволяют получить куда больше двух голосов — до десяти: если между нажатиями менять имя, каждое новое имя получает свой собственный голос, а повтор уже использованного имени всегда возвращает тот же голос, что был закреплён за ним раньше.
Второй способ — написать или вставить весь готовый сценарий сразу, без пошагового нажатия кнопок. Пишете: имя, например Катя, двоеточие, и сразу текст, который должна произнести Катя. Потом — новая строка, снова имя, например Антон, снова двоеточие, и его текст. И так по кругу, сколько нужно реплик. Такой сценарий, кстати, легко попросить составить любую нейросеть, просто объяснив ей этот же формат.
Когда сценарий готов, нажимается кнопка "Голоса по сценарию". Плагин находит в тексте все разные имена и показывает список — каждое имя отдельной кнопкой, одна под другой. Нажимаете на имя — открывается окно выбора голоса именно для него: список фильтра по полу (по умолчанию мужской), под ним список голосов, ниже кнопка "Прослушать", и ниже неё "Готово". Выбрали голос, нажали "Готово" — окно закрывается, а кнопка этого имени в общем списке сразу показывает, какой голос выбран. Проходите так по каждому найденному имени. Когда все имена разобраны, внизу общего списка — "Назад" и общее "Готово", которое сохраняет разом все выбранные голоса.
Счётчик символов под сценарием считает только сами реплики, без имён, лимит — две тысячи символов. Работает подкаст только с моделью Eleven v3.
Голоса можно не только выбирать готовые, но и клонировать: кнопка "Мои голоса" открывает список ваших клонированных голосов с возможностью выбрать любой или удалить, и кнопку, чтобы клонировать новый — выбираете аудиофайл с образцом, даёте имя. Важно: клонирование недоступно на бесплатном тарифе ElevenLabs, на нём работают только готовые голоса из библиотеки.
Дальше — общие кнопки, как у Gemini: имя файла, "Создать Аудио", "Воспроизвести", "Сохранить", "Открыть папку", "Очистить", "Настройки API", "Закрыть".
В окне настроек, рядом с кнопками "Сохранить" и "Сбросить", есть кнопка "Узнать лимит". Она открывает состояние вашего аккаунта ElevenLabs: сколько кредитов потрачено, сколько кредитов доступно всего, сколько кредитов осталось, и дату, когда лимит обнулится.
Вверху окна есть список "Провайдер". Открыли список, выбрали нужную нейросеть — окно перестраивается под неё, а выбор запоминается: в следующий раз откроете дополнение — там уже будет стоять та нейросеть, с которой вы закончили работать в прошлый раз.
Переключаться можно и не открывая список: Ctrl+Tab — на следующую нейросеть по кругу, Ctrl+Shift+Tab — на предыдущую. Работают из любого места окна.
У этого дополнения нет горячей клавиши для открытия окна по умолчанию — назначьте свою через меню NVDA: "Настройки" — "Жесты ввода...", найдите там пункт "Открыть конвертер текста в речь" в категории "Конвертер Текст-в-Речь", и назначьте удобное вам сочетание клавиш.
Чтобы отблагодарить меня или со мной связаться — Telegram. @Kvarkovyj_Zvuk
Почта Gmail. a45951011@gmail.com