# Маркери польської мови для автоматичного визначення в парах голосів
# NeuralVoicesUA (англійсько-польські пари, де англійська має пріоритет
# за замовчуванням -- див. розділ "Автоматичне визначення мови" в readme).
#
# Це просто текстовий файл: можна редагувати будь-яким текстовим редактором.
# Зміни діють після перезапуску NVDA (або перезавантаження плагінів,
# NVDA+Ctrl+F3).
#
# Рядки, що починаються з "#", і порожні рядки ігноруються.
#
# Файл складається з п'яти розділів -- та сама структура, що й у
# russianMarkers.txt (uk/ru пара), і той самий сенс категорій:
#
# [substrings] -- шукається будь-де в реченні. Використовуйте лише для
#   послідовностей літер, яких гарантовано (чи майже гарантовано) не
#   буває у справжніх англійських словах.
#
# [prefixes] -- шукається лише на самому початку слова.
#
# [suffixes] -- шукається лише в самому кінці слова.
#
# [words] -- шукається лише як окреме слово цілком. Обов'язково для
#   коротких послідовностей, що інакше збігалися б із частиною
#   англійського слова.
#
# ВАЖЛИВА ВІДМІННІСТЬ від пари уk/ru: там обидві мови пишуться
# кирилицею, тому жоден маркер не ризикує збігтися зі словом ІНШОГО
# алфавіту -- гірше, що могло статись, це переплутати українське й
# російське слово між собою. Тут же польська й англійська -- ОБИДВІ
# латиницею, тому кожен маркер нижче міг у принципі збігтися зі
# справжнім англійським словом чи його частиною. Це врахано при виборі
# кожного пункту нижче (є коментар щодо перевірених колізій), але
# гарантії тут слабші за природою задачі -- якщо ви побачите, що
# якийсь маркер хибно спрацьовує на реальний англійський текст,
# найпростіше -- прибрати цей рядок звідси (чи звузити його до
# [words]/[suffixes], якщо збіг стосується лише частини слова).
#
# На відміну від уk/ru, тут НЕМАЄ "вето"-літер -- літер, наявність яких
# ГАРАНТОВАНО означає англійську (бо латиниця й так уже "типово"
# англійська, а не польська). Натомість є зворотне: польські літери
# ą/ć/ę/ł/ń/ó/ś/ź/ż відсутні в англійській абетці ВЗАГАЛІ -- це
# перевіряється прямо в коді (languageDetection._POLISH_ONLY_LETTERS),
# не через цей файл, і саме тому в списку нижче НЕМАЄ жодного маркера,
# що містить одну з цих літер: такі слова й так уже безумовно
# розпізнаються як польські на рівні літер, ще до перевірки маркерів.
# Отже, цей файл потрібен лише для польських слів, написаних ВИКЛЮЧНО
# "звичайними" латинськими літерами (без жодної з дев'яти вище).
#
# Свідомо ВИКЛЮЧЕНІ з файлу (перевірені колізії зі справжніми
# англійськими словами -- додавати їх сюди означало б регулярно хибно
# розпізнавати англійський текст як польський):
# - to, on, one, ale, jest, pod -- кожне ідентичне за написанням
#   справжньому англійському слову ("to", "on", "one", "ale" (пиво),
#   "jest" (жарт), "pod").
# - ich -- польський родовий відмінок множини, але ЗБІГАЄТЬСЯ з
#   закінченням англійських "which"/"rich"/"much" тощо.
# - wy/za/pod як префікси -- надто короткі (2-3 літери) і збігаються з
#   початком реальних англійських слів ("zany", "zap", "pod", "pods").
# - ego (польське закінчення родового відмінка прикметників чоловічого
#   роду, напр. "dobrego") -- САМЕ ПО СОБІ є англійським словом
#   ("ego" в психології), тому небезпечне навіть як [suffixes]
#   (де воно однаково збіглося б із самим словом "ego").
#
# Кілька слів про менш очевидні маркери нижче:
# - cz -- як [prefixes] (лише на початку слова), а не проста підрядка:
#   польське "cz" (czy, czysty, czynić, człowiek) на початку слова
#   безпечне майже завжди, але як підрядка воно збігається зі
#   справжнім англійським словом "eczema" (medical term). Лишається
#   дрібний ризик хибного спрацювання на рідкісні запозичення "czar"/
#   "Czech" (обидва самі починаються на "cz") -- прийнятний виняток,
#   той самий рівень толерантності, що й "рр"/"мм" у russianMarkers.txt.
# - sz, rz, dz -- як [substrings]: ці буквосполучення практично не
#   трапляються в англійській орфографії взагалі (перевірено -- жодних
#   поширених англійських слів з "sz" чи "rz"; "dz" трапляється хіба
#   що в рідкісному "adze" (сокира теслі) -- прийнятний виняток).
# - anie -- польське закінчення віддієслівних іменників (czytanie,
#   pisanie, słuchanie), але ЯК ПІДРЯДКА небезпечне: "companies"
#   містить "anie" всередині. Тому лише [suffixes] (на кінці слова) --
#   "companies" закінчується на "nies", а не "anie", тому це вже
#   безпечно. Свідомо ВИКЛЮЧЕНО "enie" (та сама польська позиція,
#   напр. "czytenie" не існує, але аналогічні форми як "pisanie"
#   якраз на "anie") -- навіть як [suffixes] воно збігається зі
#   справжнім англійським словом "genie" (джин із казки), яке САМЕ
#   закінчується на "enie".
# - ych -- родовий відмінок множини прикметників (dobrych, tych),
#   лише [suffixes]. Свідомо НЕ включено "ich" (та сама позиція) --
#   див. список винятків вище.
# - tak, nie, tam, tu, lub -- лише [words] (не підрядка): "tak"
#   трапляється всередині "attack"/"stake"/"mistake", "nie" -- всередині
#   "genie"/"lenient", "tam" -- всередині "stamp"/"stamina", "lub" --
#   всередині розмовного англійського "lube". Як окреме слово кожне з
#   них безпечне.
# - ona, ono, oni -- польські займенники (вона/воно/вони), лише
#   [words]: "ona" підрядком трапляється в "personal"/"monastery",
#   "ono" -- в "economic"/"monopoly". "one" (вони, чоловічо-особові)
#   свідомо НЕ включено -- це готове англійське слово (див. виняток).
# - jak -- лише [words]: коротке (3 літери), нема гарантії проти
#   випадкового збігу деінде.

# Диграфи: дуже короткі сполучення, типові для польської, але здатні
# випадково трапитись і в англійському слові (adze, kudzu, midzone, Schwarz).
# Тому тут ОДНОГО влучання замало -- потрібно щонайменше два по всьому
# реченні. У справжньому польському тексті вони трапляються по кілька разів.
#
# ДЕ РЕДАГУВАТИ СВОЇ МАРКЕРИ (важливо)
#
# Цей файл -- КОМПЛЕКТНИЙ список, він оновлюється разом з адоном, і теку
# адону при оновленні замінюють цілком. Тому зміни, внесені сюди, зникнуть.
#
# Свої маркери додавайте у файл-накладку в теці конфігурації NVDA:
#     %APPDATA%
vda
euralVoices_<ім'я цього файлу>
# Він створюється автоматично і має ті самі розділи. Там же можна ПРИБРАТИ
# маркер із цього списку, написавши його зі знаком мінус (наприклад, -тоже).
# Так ваші зміни переживають оновлення, а покращення цього списку й далі
# до вас доходять.
#

[digraphs]
sz
rz
dz

[substrings]
gdzie
kiedy
dlaczego
dobrze
bardzo
chyba
przepraszam
teraz
wczoraj
jutro
gdy
jaki
jaka
jakie
gdyby
oraz
albo
jednak
witam

[prefixes]
cz
prze
przy
roz

[suffixes]
anie
ych

[words]
tak
nie
tam
tu
lub
ona
ono
oni
jak
moja
moje
twoja
twoje
swoja
swoje

# Додано у v1.3.5. Кожне слово вивірено проти АНГЛІЙСЬКОЇ автоматично.
# Відсіяно: "pan" (англ. сковорода), а також "cos" (косинус) і "dom"
# (DOM у веброзробці) -- часті в технічній англійській.
tylko
wiem
jestem
dobry
dobra
praca
mamy
macie
ludzie
rzecz
czas
wszystko
jeszcze
zawsze
dzisiaj
kto
nic
juz
tez
bez
pani
rok
