وثائق Vision Assistant Pro
إجمالي التنزيلات: 61,000+
Vision Assistant Pro هو مساعد ذكاء اصطناعي متقدم ومتعدد الوسائط لنظام NVDA. يستفيد من محركات ذكاء اصطناعي من الطراز العالمي لتوفير قراءة ذكية للشاشة، وترجمة، وإملاء صوتي، وتحليل المستندات.
تم إصدار هذه الإضافة للمجتمع تكريماً لليوم الدولي للأشخاص ذوي الإعاقة.
1. الإعداد والتكوين
انتقل إلى قائمة NVDA > تفضيلات > الإعدادات > Vision Assistant Pro. نافذة الإعدادات منظمة في 8 تبويبات يسهل الوصول إليها: الاتصال، سلوك الذكاء الاصطناعي، لغات الترجمة، قارئ المستندات، الفيديو، الكابتشا، الموجهات، والمتقدم.
1.1 تبويب الاتصال
- المزود (Provider): اختر خدمة الذكاء الاصطناعي المفضلة لديك. المزودون المدعومون يشملون Google Gemini و OpenAI و Mistral و Groq و MiniMax و مخصص (Custom) (خوادم متوافقة مع OpenAI مثل Ollama و LM Studio و Jan.ai أو KoboldCPP).
- مفتاح API: أدخل مفتاحاً واحداً أو عدة مفاتيح (مفصولة بفواصل أو أسطر جديدة) للتدوير التلقائي.
- جلب النماذج (Fetch Models): اضغط على هذا الزر بعد إدخال مفتاح API لتنزيل أحدث قائمة بالنماذج المتاحة من المزود.
- نموذج الذكاء الاصطناعي: اختر النموذج الرئيسي المستخدم للدردشة والتحليل العامة.
- إعدادات المزود المخصص: قم بتكوين نقاط اتصال محلية أو مخصصة. يتضمن إعداد الذكاء الاصطناعي المحلي (إعداد بنقرة واحدة لـ Ollama و LM Studio و Jan.ai أو KoboldCPP) و تكوين نقطة الاتصال المتقدم.
- التوجيه المتقدم للنماذج (حسب المهمة): اختر اختيارياً نماذج مخصصة من القوائم المنسدلة لمهام OCR و STT و TTS ومشغل الذكاء الاصطناعي والفيديو والمساعد المباشر.
- خيارات الاتصال والإخراج: قم بتكوين رابط البروكسي، والتحقق من التحديثات عند بدء التشغيل، وتنظيف Markdown في الدردشة، ونسخ ردود الذكاء الاصطناعي إلى الحافظة، والإخراج المباشر (بدون نافذة دردشة)، والإخراج المباشر للمساعد المباشر.
1.2 تبويب سلوك الذكاء الاصطناعي
- الإبداع (درجة الحرارة): يتحكم في عشوائية وإبداع الذكاء الاصطناعي (من 0.0 إلى 2.0). القيم الأقل تنتج نتائج ترجمة/OCR أكثر تحديداً ودقة.
1.3 تبويب لغات الترجمة
- لغة المصدر: اختر لغة الإدخال الافتراضية الخاصة بك.
- اللغة الهدف: اختر اللغة الهدف الأساسية للترجمة.
- لغة رد الذكاء الاصطناعي: اختر اللغة للردود العامة للذكاء الاصطناعي.
- التبديل الذكي: يبدل تلقائياً بين لغتي المصدر والهدف بناءً على الإدخال المكتشف.
1.4 تبويب قارئ المستندات
- محرك OCR: اختر بين كروم (سريع) للحصول على نتائج سريعة أو الذكاء الاصطناعي (متقدم) للحفاظ على التنسيق بشكل أفضل.
- حجم دفعة OCR: حدد عدد الصفحات لكل طلب (اضبطه على 0 للمعالجة بطلب واحد).
- وصف الصور ضمن النص: بدّل وصف الصور المضمن أثناء استخراج نص المستند.
- أرقام الصفحات عند التصدير: بدّل أرقام الصفحات والفواصل في مخرجات المستندات متعددة الصفحات.
- صوت TTS: اختر أسلوب الصوت الافتراضي لتوليد الصوت.
1.5 تبويب الفيديو
- حجم شريحة الفيديو: مدة المقطع بالدقائق لتوليد الوصف الصوتي (اضبطه على 0 لمعالجة الملف بأكمله).
- إضافة قائمة الشخصيات: خيار لإضافة قاموس الشخصيات كأول إدخال في الترجمة.
- إضافة إخلاء مسؤولية عن الذكاء الاصطناعي: خيار لإدراج إخلاء مسؤولية عن الذكاء الاصطناعي في بداية ترجمات SRT الخاصة بالفيديو.
1.6 تبويب الكابتشا
- تفعيل حل الكابتشا المرئية: بدّل الحل التلقائي للتحديات المرئية (hCaptcha، reCAPTCHA).
- طريقة كابتشا النص: اختر بين التقاط كائن التوجيه أو الشاشة الكاملة.
1.7 تبويب الموجهات
- إدارة الموجهات: يفتح نافذة مخصصة لتخصيص الموجهات الافتراضية للنظام أو لإنشاء وتعديل وإعادة ترتيب ومعاينة الموجهات المخصصة للمستخدم مع متغيرات ديناميكية (مثل
[selection]، [screen_fg_obj]).
1.8 التبويب المتقدم والتسجيل العام
انتقل إلى التبويب المتقدم لتكوين تسجيل الإضافة العام:
- تفعيل ملف سجل مخصص: يبدّل تسجيل جميع الأحداث التشغيلية وحركة مرور API والأخطاء عبر جميع وحدات الإضافة في ملف منفصل (vision_assistant.log).
- مستوى التسجيل: اختر مستوى التفصيل بين تصحيح (كل التفاصيل)، معلومات (معلومات عامة)، تحذير (التحذيرات فقط)، وخطأ (الأخطاء فقط).
- الاحتفاظ بالسجلات لمدة: اضبط فترات الاحتفاظ التلقائية لتنظيف إدخالات السجل الأقدم تلقائياً (تتراوح من ساعة واحدة إلى 90 يوماً).
- عناصر التحكم في إدارة السجلات: استخدم فتح ملف السجل أو فتح مجلد السجل أو مسح ملف السجل لفحص بيانات السجل أو مسحها مباشرة دون إعادة تشغيل NVDA أو التداخل مع سجلات NVDA القياسية.
2. طبقة الأوامر والاختصارات
لتجنب تضارب لوحة المفاتيح، تستخدم هذه الإضافة طبقة أوامر.
1. اضغط NVDA + Shift + V (المفتاح الرئيسي) لتفعيل الطبقة (ستسمع صوت تنبيه).
2. حرر المفاتيح، ثم اضغط على أحد المفاتيح التالية:
| المفتاح |
الوظيفة |
الوصف |
| Shift + A |
مشغل الذكاء الاصطناعي |
تشغيل مستقل: أخبر الذكاء الاصطناعي بتنفيذ مهمة على شاشتك. الضغط عليه مرة أخرى يلغي العمليات النشطة فوراً. |
| E |
مستكشف واجهة المستخدم |
نقر تفاعلي: يحدد وينقر عناصر واجهة المستخدم في أي تطبيق. |
| T |
المترجم الذكي |
يترجم النص تحت مؤشر التوجيه أو النص المحدد. |
| Shift + T |
مترجم الحافظة |
يترجم المحتوى الموجود حالياً في الحافظة. |
| R |
محسن النص |
لخص، صحح القواعد، اشرح، أو شغل الموجهات المخصصة. |
| V |
رؤية الكائن |
يصف كائن التوجيه الحالي. |
| O |
رؤية الشاشة بالكامل |
يحلل تخطيط ومحتوى الشاشة بأكملها. |
| Shift + V |
تحليل الفيديو |
حلل ملفات فيديو محلية أو فيديوهات YouTube و Instagram و TikTok و Twitter (X) عبر الإنترنت. |
| Control + V |
تسجيل الفيديو المحلي |
يسجل فيديو صامتاً لشاشتك ويحلل الإجراءات والتخطيط. |
| D |
قارئ المستندات |
قارئ متقدم لملفات PDF والصور مع اختيار نطاق الصفحات. |
| F |
إجراء الملف الذكي |
تعرف ذكي على السياق من ملف صورة أو PDF أو TIFF محدد. |
| M |
تفريغ الوسائط والدبلجة |
فرغ أو دبلج ملفات الصوت/الفيديو (MP3، WAV، MP4، وغيرها) إلى لغتك الهدف. |
| C |
حل الكابتشا |
يلتقط ويحل رموز الكابتشا. |
| Shift + C |
دردشة مباشرة |
يفتح واجهة دردشة نصية مباشرة مع الذكاء الاصطناعي. |
| S |
الإملاء الذكي |
يحول الكلام إلى نص. اضغط لبدء التسجيل، اضغط مرة أخرى للإيقاف/الكتابة. |
| Control+T |
الترجمة الصوتية |
يفرغ النص ويترجمه ويكتب النتيجة بناءً على إعدادات لغتك. |
| Control+L |
المساعد المباشر |
مساعد فوري (Gemini فقط): يبدأ أو ينهي محادثة صوتية وبصرية مباشرة مع المساعد الذكي. |
| I |
الإبلاغ عن الحالة |
يعلن عن التقدم الحالي (مثل "جارٍ المسح..."، "خامل"). |
| L |
تسمية الكائن |
التسمية بالذكاء الاصطناعي الدلالي: يسمي العنصر/الأيقونة المركزة حالياً بشكل دائم. |
| Shift + L |
إدارة/مسح التسميات |
يفتح مدير التسميات (إذا كانت هناك تسميات) أو يمسح التطبيق بحثاً عن العناصر غير المسماة. |
| U |
التحقق من التحديث |
تحقق يدوياً من GitHub للحصول على أحدث إصدار من الإضافة. |
| Space |
استدعاء النتيجة الأخيرة |
يعرض آخر رد من الذكاء الاصطناعي في مربع حوار الدردشة للمراجعة أو المتابعة. |
| H |
تعليمات الأوامر |
يعرض قائمة بجميع الاختصارات المتاحة. |
| Alt + S |
الإعدادات |
يفتح نافذة إعدادات Vision Assistant Pro. |
| Alt + Q |
الإبلاغ عن المفاتيح المستنفدة |
يعلن عن عدد مفاتيح Gemini API التي تجاوزت حصتها اليومية ووقت إعادة تعيينها. |
| Alt + M |
مراجعة التوجيه |
يعلن عن نماذج الذكاء الاصطناعي المحددة حالياً في التوجيه المتقدم. |
| أعلى / أسفل |
التنقل في الإعدادات السريعة |
يتنقل بين فئات الإعدادات السريعة (المزود، النموذج، وغيرها) في الطبقة. |
| يسار / يمين |
تغيير الإعداد السريع |
يغير قيمة الإعداد السريع المحدد حالياً. |
3. مشغل الذكاء الاصطناعي - التحكم المستقل بالكمبيوتر
يحوّل مشغل الذكاء الاصطناعي Vision Assistant Pro من قارئ سلبي إلى مساعد نشط يمكنه التفاعل مع جهاز الكمبيوتر الخاص بك نيابة عنك. يمكنك أن تطلب منه وصف الشاشة، أو الإجابة عن أسئلة حول ما يراه، أو حتى التحكم الكامل — النقر على الأزرار، وسحب العناصر، وكتابة النص، والتنقل بين التطبيقات باستخدام أوامر اللغة الطبيعية.
أكبر ميزة؟ إنه يعمل بشكل مثالي في البرامج غير القابلة للوصول تماماً. إذا كنت عالقاً في تطبيق مخصص، أو سطح مكتب بعيد، أو موقع ويب حيث يظل قارئ الشاشة الخاص بك صامتاً تماماً، فلن يمانع المشغل. لأنه "يرى" الشاشة بصرياً، يمكنه العثور على العناصر التي لا تحتوي على أي تسميات وصول وقراءتها والتفاعل معها.
كيف يعمل
- اضغط NVDA + Shift + V، ثم اضغط Shift + A (أو استخدم الاختصار المباشر) لفتح نافذة مشغل الذكاء الاصطناعي.
- اكتب ما تريد القيام به بلغة واضحة (مثل "انقر على زر الحفظ"، "ماذا تقول رسالة الخطأ؟"، أو "أعد تسمية الملف إلى final.pdf").
- سيقوم الذكاء الاصطناعي بتحليل شاشتك، وتحديد العناصر ذات الصلة، وتنفيذ الإجراء أو تقديم الإجابة. إذا كانت المهمة تتطلب عدة خطوات، فسيستمر المشغل في العمل حتى اكتمالها.
- اضغط Shift + A مرة أخرى في أي وقت لإلغاء عملية جارية فوراً.
الإجراءات المدعومة
يفهم المشغل مجموعة واسعة من الأوامر:
- الوصف والإجابة: "صف تخطيط الشاشة" أو "ماذا تقول رسالة الخطأ؟"
- النقر: "انقر على زر الحفظ"
- النقر بزر الفأرة الأيمن: "انقر بزر الفأرة الأيمن على الملف"
- النقر المزدوج: "انقر نقراً مزدوجاً على المستند"
- السحب والإفلات: "اسحب المستند إلى مجلد الأرشيف"
- الكتابة: "اكتب 'Hello World' في مربع البحث"
- التمرير: "مرر لأسفل ثلاث مرات"
- الضغط على المفاتيح: "اضغط Enter"، "اضغط Tab"، "اضغط Escape"
- المهام متعددة الخطوات: "افتح مستكشف الملفات، وابحث عن التقرير، وأعد تسميته إلى final.pdf"
ملاحظات هامة
- ⚠️ تحذير استخدام API: نظراً لأن المشغل يحتاج إلى "رؤية" ما يحدث على الشاشة بالضبط، فإنه يرسل لقطة شاشة عالية الدقة مع كل خطوة. الاستخدام المتكرر سيستهلك حصة API الخاصة بك بشكل أسرع بكثير من الميزات النصية القياسية.
- التطبيقات بصلاحيات المسؤول: إذا لم يكن NVDA يعمل بصلاحيات المسؤول، فقد لا يتمكن المشغل من التفاعل مع النوافذ التي تتطلب أذونات مرتفعة. هذا قيد أمني في Windows وليس خطأً في الإضافة.
- أفضل الممارسات: للحصول على أفضل النتائج، أعطِ أوامر واضحة ومحددة. "انقر على زر الإرسال الأزرق في أسفل النموذج" سيعمل دائماً تقريباً بشكل أفضل من مجرد "انقر على الزر".
4. تحليل الفيديو والوصف الصوتي
ملاحظة: تعمل ميزات تحليل الفيديو والوصف الصوتي حصرياً بواسطة مزود Google Gemini. تأكد من أن المزود النشط في إعدادات الإضافة مضبوط على Google Gemini.
يقدم Vision Assistant Pro إمكانات معالجة فيديو قوية مصممة خصيصاً للمستخدمين المكفوفين. يمكنه تحليل الفيديوهات عبر الإنترنت وتسجيلات الشاشة المحلية لتوفير أوصاف بصرية مفصلة للغاية وتوليد نصوص وصف صوتي احترافية (SRT).
4.1 تسجيل الشاشة المحلي (Control + V)
إذا واجهت فيديو صامتاً أو رسماً متحركاً أو برنامجاً تعليمياً على شاشتك، يمكنك التقاطه مباشرة:
1. اضغط NVDA + Shift + V للدخول إلى طبقة الأوامر، ثم اضغط Control + V.
2. ستقوم الإضافة بتسجيل شاشتك بصمت في الخلفية.
3. اضغط Control + V مرة أخرى لإيقاف التسجيل.
4. سيقوم الذكاء الاصطناعي بعد ذلك بتحليل مقطع الفيديو المسجل وتقديم وصف مفصل للغاية للمشهد والشخصيات والإجراءات.
4.2 تحليل الفيديو (Shift + V)
يمكنك تحليل ملفات الفيديو المحلية والفيديوهات عبر الإنترنت. ما عليك سوى تحديد ملف فيديو محلي في مستكشف Windows، أو نسخ رابط فيديو عبر الإنترنت إلى الحافظة. يمكنك أيضاً الضغط على Shift + V في أي مكان (مثل داخل مشغل وسائط) لفتح نافذة حيث يمكنك تصفح ملف فيديو أو لصق رابط يدوياً.
- المنصات المدعومة عبر الإنترنت: YouTube و Instagram و TikTok و Twitter (X).
- سيكتشف الذكاء الاصطناعي تلقائياً الملف المحلي أو الرابط، ويعالج الفيديو، ويقدم وصفاً بصرياً شاملاً وملخصاً صوتياً.
4.3 توليد الوصف الصوتي (SRT)
لتجربة أكثر تنظيماً، يمكن للإضافة توليد نصوص وصف صوتي احترافية بتنسيق SubRip (SRT) القياسي.
- توقيت الفجوات الذكي: يستمع الذكاء الاصطناعي إلى المسار الصوتي ويربط أوصافه المرئية على وجه التحديد بالتوقفات الطبيعية والفجوات الصامتة لتقليل تداخل الحوار بذكاء.
- تتبع الشخصيات: يقوم المحرك بتمرير تمهيدي لاستخراج الشخصيات المميزة بناءً على ملامح الوجه الثابتة. يبني قاموساً عالمياً لتتبع الشخصيات وتسميتها بدقة عبر المشاهد المختلفة دون لبس.
- نص OCR الحرفي: أي نص يظهر على الشاشة (لافتات، هواتف، اعتمادات) يُقتبس حرفياً بدقة.
- طريقة الاستخدام: للاستماع إلى الترجمة المولدة، ضع ملف .srt في نفس مجلد ملف الفيديو وأعطه نفس الاسم بالضبط. ثم قم بإعداد مشغل الوسائط (مثل VLC أو PotPlayer) لتوجيه نص الترجمة مباشرة إلى قارئ الشاشة أو محرك TTS أثناء التشغيل.
4.4 السرد الصوتي المتزامن (تصدير MP3)
إلى جانب إنشاء ملفات SRT النصية فقط، تعمل الإضافة كأداة إنتاج وصف صوتي كاملة من خلال توليف الأوصاف إلى كلام ودمجها مع الفيديو. يمكنك الآن اختيار Gemini Live TTS كمحرك صوتي، والذي يستخدم Gemini Live API لتوليد سرد صوتي واقعي للغاية وغير محدود. عند توليد MP3 لملفات الفيديو المحلية، تتوفر لديك أوضاع دمج متعددة:
- الوصف الصوتي القياسي (مزج الصوت): يتم وضع السرد مباشرة فوق صوت الفيديو. سيُطلب منك إذا كنت تريد تطبيق خفض الصوت الخلفي (خفض مستوى الصوت في الخلفية أثناء الأوصاف) لضمان وضوح السرد.
- الوصف الصوتي الموسع (إيقاف الصوت): يقوم المحرك بإيقاف صوت الفيديو الأصلي مؤقتاً أثناء الأوصاف، مما يضمن ألا تفوتك كلمة واحدة من الحوار الأصلي أو السرد بالذكاء الاصطناعي.
- فيديوهات YouTube: بالنسبة لمصادر YouTube (التي لا يتم تنزيلها محلياً)، سيحتوي تصدير MP3 بدقة على المسار الصوتي المتزامن للذكاء الاصطناعي دون الصوت الخلفي للفيديو.
5. تفريغ الوسائط والدبلجة (M)
تمت إعادة بناء أداة التفريغ الصوتي بالكامل لدعم ملفات الصوت والفيديو (MP3، WAV، MP4، MKV، وغيرها). اضغط M في طبقة الأوامر لتحديد ملف وسائط واختيار أحد أوضاع التشغيل الثلاثة المميزة:
1. تفريغ (اللغة الأصلية): يفرغ الكلام المنطوق بدقة بلغته الأصلية.
2. تفريغ وترجمة (اللغة الهدف): يفرغ الكلام ويترجمه إلى لغتك الهدف المكونة.
3. دبلجة وترجمة (اللغة الهدف) (Gemini فقط): ميزة جديدة قوية تفرغ الكلام وتترجمه إلى لغتك الهدف وتولّف دبلجة صوتية منطوقة باستخدام محرك TTS الخاص بالإضافة.
6. القارئ المتقدم للمستندات والصور
يتضمن Vision Assistant Pro قارئ مستندات عالي التحسين مصمماً لملفات PDF متعددة الصفحات والصور المعقدة وحتى تنسيقات iPhone HEIC.
6.1 المعالجة المجمعة والاستئناف
لست بحاجة لقراءة مستند ضخم دفعة واحدة. أدخل نطاق صفحات (مثل 1-20)، وسيعالج الذكاء الاصطناعي جميع الصفحات في الخلفية. إذا تعطل NVDA أو قاطعت المسح، ستتذكر الإضافة تقدمك وتعرض عليك الاستئناف من حيث توقفت بالضبط!
6.2 إجراء الملف الذكي
لست بحاجة دائماً لفتح المستند أولاً. في مستكشف ملفات Windows، قم بتمييز ملف PDF أو صورة واضغط على D (قارئ المستندات) أو F (إجراء الملف الذكي) داخل طبقة الأوامر. ستتجاوز الإضافة نافذة الملف فوراً وتبدأ في معالجة الملف المميز.
6.3 اختصارات عارض المستندات
عند فتح نافذة قارئ المستندات، يمكنك استخدام الاختصارات التالية:
- Ctrl + PageDown: الانتقال إلى الصفحة التالية.
- Ctrl + PageUp: الانتقال إلى الصفحة السابقة.
- Alt + A: فتح مربع حوار الدردشة لطرح أسئلة حول المستند.
- Alt + R: فرض إعادة مسح بالذكاء الاصطناعي باستخدام مزودك النشط.
- Alt + G: إنشاء وحفظ ملف صوتي عالي الجودة (WAV/MP3). (مخفي إذا كان المزود لا يدعم TTS).
- Alt + S / Ctrl + S: حفظ النص المستخرج كملف TXT أو HTML.
7. التسمية الدلالية بالذكاء الاصطناعي ومستكشف واجهة المستخدم
هل أنت عالق في تطبيق مليء بـ"أزرار غير مسماة"؟ محرك التسمية الدلالية بالذكاء الاصطناعي يحل هذه المشكلة بشكل دائم.
7.1 التسمية الدائمة للكائنات (L)
ركّز قارئ الشاشة على رسم أو زر غير مسماة واضغط L في طبقة الأوامر. سينظر الذكاء الاصطناعي إلى الزر بصرياً، ويحدد وظيفته، ويطبق تسمية دائمة.
على عكس أدوات تسمية قارئ الشاشة الأقدم، تستخدم هذه الإضافة نظام "توقيع الكائن" الهجين المتقدم (AutomationId/ControlID). ستنجو تسمياتك المخصصة من تغيير حجم النوافذ وتبديل الشاشات وتحديثات التطبيقات!
7.2 مسح التطبيق الكامل (Shift + L)
اضغط Shift + L لمسح النافذة النشطة بأكملها دفعة واحدة. سيجد الذكاء الاصطناعي جميع العناصر غير المسماة ويسميها بذكاء في خطوة واحدة. يمكنك لاحقاً إدارة هذه التسميات أو إعادة تسميتها أو حذفها دفعة واحدة من مدير التسميات المدمج.
7.3 مستكشف واجهة المستخدم (E)
هل تحتاج إلى التفاعل مع عنصر دون التنقل إليه يدوياً؟ اضغط E لتفعيل مستكشف واجهة المستخدم. سيقوم الذكاء الاصطناعي بمسح الشاشة وتوليد قائمة يسهل الوصول إليها بكل عنصر قابل للنقر (متجاهلاً ضجيج النظام مثل أشرطة المهام). اختر عنصراً من القائمة، وستقوم الإضافة بالنقر عليه فوراً نيابة عنك.
8. المساعد الصوتي المباشر
يحوّل المساعد المباشر Vision Assistant Pro إلى مساعد مصاحب تفاعلي في الوقت الفعلي.
(ملاحظة: هذه الميزة حصرية لـ Google Gemini والمزودين المخصصين المتوافقين مع Gemini).
- التفعيل: اضغط Control + L في طبقة الأوامر لفتح نافذة المساعد المباشر.
- التفاعل في الوقت الفعلي: تحدث بشكل طبيعي عبر الميكروفون. سيستمع الذكاء الاصطناعي إلى صوتك وينظر إلى شاشتك النشطة في نفس الوقت. يمكنك طرح أسئلة مثل "ماذا أنظر إليه؟" أو "اقرأ الفقرة الثالثة لي".
- التخصيص: داخل النافذة، يمكنك تغيير أسلوب صوت الذكاء الاصطناعي (مثل احترافي، ودود، مفعم بالحيوية) وضبط "عمق التفكير" للتحكم في مدى عمق تفكيره قبل الإجابة.
9. الموجهات المخصصة والمتغيرات
يمكنك إدارة الموجهات في الإعدادات > الموجهات > إدارة الموجهات....
المتغيرات المدعومة
[selection]: النص المحدد حالياً.
[clipboard]: محتوى الحافظة.
[clipboard_image]: صورة موجودة حالياً في الحافظة.
[screen_obj]: لقطة شاشة لكائن التوجيه.
[screen_fg_obj]: لقطة شاشة للنافذة النشطة في المقدمة.
[screen_full]: لقطة شاشة للشاشة بأكملها.
[file_ocr]: اختيار ملف صورة/PDF لاستخراج النص.
[file_read]: اختيار مستند للقراءة (TXT، Code، PDF).
[file_audio]: اختيار ملف صوتي للتحليل (MP3، WAV، OGG).
{target_lang}: اللغة الهدف الحالية.
{source_lang}: لغة المصدر الحالية.
{response_lang}: لغة رد الذكاء الاصطناعي الحالية.
{swap_target}: اللغة الاحتياطية للترجمة الذكية بالتبديل.
{swap_instruction}: كتلة تعليمات الترجمة الذكية للتبديل.
10. حالات الاستخدام الواقعية (أي ميزة يجب أن أستخدمها؟)
حزمة Vision Assistant Pro مليئة بالأدوات المتقدمة. إليك بعض السيناريوهات الشائعة لمساعدتك في اختيار الأداة المناسبة:
-
السيناريو: تريد فهم التخطيط الكامل لنافذة معقدة أو تطبيق غير قابل للوصول.
الحل: اضغط O (رؤية الشاشة بالكامل). سيقوم الذكاء الاصطناعي بتحليل الشاشة بأكملها ووصف مكان العناصر والنصوص والأزرار بالضبط.
-
السيناريو: وجدت صورة على صفحة ويب أو رسماً غير مسماً في مستند.
الحل: حرّك كائن التوجيه إلى الرسم واضغط V (رؤية الكائن). سيصف الذكاء الاصطناعي تحديداً ما تحتويه تلك الصورة.
-
السيناريو: تريد مشاهدة فيلم أو مقطع فيديو مع أوصاف صوتية.
الحل: اضغط Shift + V على الفيديو واختر "توليد الوصف الصوتي (ملف SRT)". عند الانتهاء، انقر "توليد سرد متزامن (MP3)" واختر "الوصف الصوتي الموسع". ستقوم الإضافة بإنشاء مسار صوتي يوقف حوار الفيلم بذكاء لوصف المشاهد المرئية.
-
السيناريو: واجهت تطبيقاً مليئاً بـ"أزرار غير مسماة".
الحل: اضغط L لتسمية الزر المحدد بشكل دائم باستخدام الذكاء الاصطناعي. أو اضغط Shift + L لمسح النافذة بأكملها وتسميتها مرة واحدة. إذا كنت تريد فقط النقر على شيء بسرعة، اضغط E (مستكشف واجهة المستخدم) للحصول على قائمة بجميع العناصر القابلة للنقر.
-
السيناريو: تحتاج إلى تجاوز كابتشا غير قابلة للوصول.
الحل: اضغط C (حل الكابتشا). سيقوم الذكاء الاصطناعي تلقائياً بالتقاط الكابتشا وحلها وحقن الإجابة في الحقل الصحيح.
-
السيناريو: تريد قراءة مستند PDF طويل من 50 صفحة.
الحل: اضغط D (قارئ المستندات)، واضبط المزود على Google Gemini، وأدخل نطاق الصفحات 1-50. ستقوم الإضافة باستخراج النص بدقة في الخلفية.
-
السيناريو: تشاهد برنامجاً تعليمياً أو رسماً متحركاً صامتاً على شاشتك.
الحل: اضغط Control + V لبدء تسجيل الشاشة. دع البرنامج التعليمي يعمل، ثم اضغط Control + V مرة أخرى. سيشرح الذكاء الاصطناعي بالضبط ما تم عرضه.
-
السيناريو: تواجه خطأً غير متوقعاً، أو فشل اتصال API، أو تريد تشخيص مشكلات مع خوادم محلية مخصصة.
الحل: انتقل إلى الإعدادات > المتقدم، وحدد "تفعيل ملف سجل مخصص"، واضبط مستوى التسجيل على "تصحيح". نفّذ الإجراء مرة أخرى، ثم انقر "فتح ملف السجل" لفحص التفاصيل الفنية أو إرفاق vision_assistant.log بتذكرة الدعم.
ملاحظة: مطلوب اتصال نشط بالإنترنت لجميع ميزات الذكاء الاصطناعي. تتم معالجة المستندات متعددة الصفحات تلقائياً.
11. الدعم والمجتمع
ابق على اطلاع بأحدث الأخبار والميزات والإصدارات:
- قناة التليجرام: t.me/VisionAssistantPro
- GitHub Issues: للإبلاغ عن الأخطاء وطلبات الميزات.
الإبلاغ عن الأخطاء والسجلات
عند فتح قضية على GitHub أو طلب الدعم، يرجى تضمين تفاصيل حول مزود الذكاء الاصطناعي النشط لديك ونموذجه وإصدار NVDA. إذا كنت تواجه مشكلات في الاتصال أو أعطالاً غير متوقعة، ففعّل ملف السجل المخصص في الإعدادات > المتقدم، وأعد إنتاج المشكلة، وأرفق ملف vision_assistant.log الخاص بك لمساعدتنا في حل المشكلة بشكل أسرع.
12. داعمو المشروع
شكر جزيل من القلب لأعضاء مجتمعنا الذين يدعمون التطوير المستمر والصيانة لهذا المشروع من خلال مساهماتهم المالية السخية:
- @Alyabani94
- Ali Alamri
- Ilya
- داعم مجهول (
UQDd...CnMY)
- leonardo0216
- Sergei Fleytin
- Suman Gayen
إذا كنت ترغب في دعم المشروع مالياً ورؤية اسمك هنا، يمكنك العثور على خيار التبرع في قائمة أدوات NVDA (القائمة الفرعية Vision Assistant) أو أثناء عملية الإعداد بعد التثبيت.
تغييرات الإصدار 2026.08.06
- تسمية مستكشف واجهة المستخدم: يمكنك الآن إضافة تسميات مباشرة إلى العناصر التي تم العثور عليها داخل مستكشف واجهة المستخدم! تمت إضافة زر "إضافة تسمية" جديد، وتظل الواجهة مفتوحة بذكاء وتحافظ على التركيز بحيث يمكنك تسمية كائنات متعددة بسرعة دون انقطاع.
- تحسين طبقة الإعدادات السريعة: أصبحت طبقة Vision Assistant (
Insert+Shift+V) دائمة وتفاعلية للغاية! يمكنك استخدام الأسهم أعلى/أسفل للتنقل بين الإعدادات السريعة (المزود، النموذج، لغة رد الذكاء الاصطناعي، نموذج TTS) والأسهم يسار/يمين لتغيير قيمها فوراً مع ردود صوتية ذكية وموجزة. يتم تطبيق اختياراتك على الفور (بما في ذلك التفعيل التلقائي للتوجيه المتقدم عند الحاجة)، وتبقى الطبقة نشطة أثناء التكوين.
- الدردشة المباشرة (
Shift+C): تمت إضافة أمر جديد إلى الطبقة! اضغط Shift+C لفتح نافذة "دردشة مباشرة" فوراً. يوفر هذا واجهة محادثة نصية نظيفة مع الذكاء الاصطناعي مباشرة، دون الحاجة إلى صورة أو مستند كنقطة بداية.
- استدعاء سجل المحادثة بشكل مثالي: تم إصلاح خطأ رئيسي حيث كان الضغط على مفتاح
المسافة لاستدعاء آخر نتيجة يفقد سجل المحادثة اللاحق. الآن، تتتبع الإضافة محادثتك عالمياً. إذا تحدثت وأغلقت النافذة وضغطت مفتاح المسافة لاستدعائها، فسيتم استعادة سجل المحادثة الكامل بشكل مثالي! يعمل للدردشة المباشرة وتحليل الرؤية ودردشة المستندات والترجمة.
- وصف الصور ضمن النص أثناء OCR: تمت إضافة ميزة اختيارية لوصف الصور ضمن النص أثناء التعرف على النص (OCR) للمستندات. يمكنك تبديل هذا الإعداد في إعدادات OCR للإضافة، ضمن خيارات قارئ المستندات قبل الاستخراج، وبسرعة أثناء العمل عبر طبقة الإعدادات السريعة.
- الترجمة الصوتية (
Control+T): تمت إضافة ميزة قوية جديدة! أمِل صوتك وترجم فوراً واكتب باستخدام الذكاء الاصطناعي بناءً على لغتي المصدر والهدف اللتين قمت بتكوينهما.
- تحسينات منزّل التحديثات: تعرض نافذة تنزيل التحديث الآن تقدم التنزيل بالنسبة المئوية بشكل صحيح، وتم إصلاح خطأ ظهور رسالة "جارٍ تنزيل التحديث" الوهمية عند إلغاء التثبيت.
- تحسينات منزّل eSpeak-NG: تمت إضافة تتبع التقدم بالنسبة المئوية لتنزيلات eSpeak-NG.
- مرونة OCR الدفعي: تم إصلاح مشكلة في OCR الدفعي لملفات PDF حيث تتوقف العملية إذا بلغ مفتاح API النشط حصته في منتصف العمل؛ الآن يتحول تلقائياً إلى المفتاح التالي المتاح ويستأنف العملية.
- دعم الكابتشا المرئية: تمت إضافة دعم قوي لحل الكابتشا المرئية. يحاول حل تحديات الصور المعقدة مثل hCaptcha وreCAPTCHA تلقائياً، مما يعزز بشكل كبير إمكانية الوصول في نماذج الويب الصعبة.
- إعادة بناء التفريغ الصوتي: تمت إعادة بناء وحدة التفريغ الصوتي بالكامل وهي تدعم الآن ملفات الصوت والفيديو. تتميز بثلاثة أوضاع تشغيل متميزة: "تفريغ (اللغة الأصلية)"، "تفريغ وترجمة (اللغة الهدف)"، وخيار "دبلجة وترجمة (اللغة الهدف)" الجديد القوي (حصري لـ Gemini) الذي يولّد دبلجة صوتية مترجمة للكلام الأصلي.
- أرقام صفحات اختيارية في قارئ المستندات: تمت إضافة إعداد جديد لتبديل تضمين أرقام الصفحات والفواصل في مخرجات المستندات متعددة الصفحات. يمكنك إدارة هذا الخيار بسهولة من الإعدادات الرئيسية أو تبديله أثناء العمل عبر طبقة الإعدادات السريعة. تنطبق هذه الميزة على تصدير ملفات النص/HTML ونافذة "عرض منسق" المضمنة، مما يسمح لك بقراءة المستندات المجمعة بسلاسة.
- Gemini Live TTS غير محدود لأوصاف الفيديو: يمكنك الآن تحديد "Gemini Live TTS" كمحرك صوتي عند توليد السرد الصوتي المتزامن (MP3) للفيديوهات. يستخدم هذا Gemini Live API لتوليف أوصاف صوتية عالية الجودة دون أي حدود للأحرف أو قيود على الطول.
- نمذجة الكود: تمت إعادة هيكلة بنية الإضافة من ملف واحد إلى بنية معيارية متعددة الملفات لتحسين قابلية الصيانة.
- إعادة تصميم واجهة الإعدادات: تمت إعادة تصميم نافذة الإعدادات بالكامل لاستخدام واجهة حديثة قائمة على التبويبات بدلاً من التخطيط المجمع، مما يوفر تنظيماً أفضل وتنقلاً أسهل مع الحفاظ على جميع الخيارات الحالية.
- تسجيل الملفات العام والمخصص: تمت إضافة نظام تسجيل ملفات عام اختياري ضمن تبويب الإعدادات "المتقدم" الجديد. يلتقط تلقائياً الأحداث التشغيلية وحركة مرور API والأخطاء عبر جميع وحدات الإضافة في ملف مخصص (
vision_assistant.log). يدعم مستويات تفصيل قابلة للتكوين (تصحيح، معلومات، تحذير، خطأ)، وفترات احتفاظ تلقائية (من ساعة واحدة إلى 90 يوماً)، وفتح السجل أو مسحه مباشرة من الإعدادات دون أي تأثير على الأداء أو تداخل مع سجل NVDA.
- تتبع تقدم رفع Gemini: تمت إضافة إعلانات تقدم بالنسبة المئوية في الوقت الفعلي عند رفع الملفات الكبيرة (الفيديو والصوت والمستندات) إلى Google Gemini API.
تغييرات الإصدار 2026.07.15
- التصفية الذكية لنماذج API: إصلاح شامل لنظام تصفية النماذج لاستخدام نهج القائمة السوداء البحتة بدلاً من القوائم البيضاء. تمت إضافة كلمات تصفية أقوى (
embedding، bison، gecko، audio، realtime، babbage، moderation، deep، antigravity، computer) لضمان بقاء القائمة المنسدلة لنموذج الدردشة الرئيسي نظيفة تماماً ومقاومة للمستقبل، مع إبقاء جميع النماذج المتخصصة متاحة في قسم التوجيه المتقدم.
- البحث في التوجيه المتقدم: جميع القوائم المنسدلة للتوجيه المتقدم للنماذج (OCR، STT، TTS، المشغل، الفيديو، المباشر) ومحدد متغير eSpeak أصبحت قابلة للبحث بالكامل. يمكنك الكتابة بسرعة للتصفية والعثور على النموذج أو المتغير المطلوب.
- اختصارات جديدة لطبقة الأوامر:
- الإعدادات (
Alt + S): يفتح فوراً نافذة إعدادات Vision Assistant Pro.
- الإبلاغ عن المفاتيح المستنفدة (
Alt + Q): يعلن عن العدد الدقيق لمفاتيح Gemini API التي تجاوزت حصتها اليومية، ويحدد النموذج المحدد الذي استُنفدت عليه، ويعلن عن وقت إعادة تعيينها بالضبط.
- مراجعة التوجيه (
Alt + M): يراجع ويعلن عن تكوين التوجيه المتقدم الحالي لديك، ويقرأ النماذج المحددة بنشاط للمهام المتخصصة (متجاوزاً الإعدادات الافتراضية).
- إصلاح شامل لمحلل الفيديو: تم تحويل محلل الفيديو بالكامل! سابقاً، كان يقدم وصفاً أساسياً للفيديوهات عبر الإنترنت فقط. الآن، هو مجموعة معالجة فيديو شاملة مصممة للمستخدمين المكفوفين:
- تسجيل الشاشة المحلي (
Control+V): يمكنك الآن تسجيل فيديوهات صامتة مباشرة من شاشتك. سيقوم الذكاء الاصطناعي بتحليل المقطع المسجل وتقديم وصف مفصل للغاية للمشهد والتخطيط والإجراءات.
- توليد الوصف الصوتي (SRT): يمكن للإضافة الآن توليد نصوص وصف صوتي مفصلة للغاية (بتنسيق SRT القياسي) للفيديوهات، مع توقيت فجوات ذكي لربط الأوصاف بالتوقفات الطبيعية في المسار الصوتي، وOCR حرفي لأي نص يظهر على الشاشة.
- السرد الصوتي المتزامن (تصدير MP3): إلى جانب الترجمة النصية، يمكن للإضافة توليف الوصف الصوتي إلى كلام، ودمجه تلقائياً مع المسار الصوتي الأصلي للفيديو، وتطبيق خفض الصوت الخلفي (خفض مستوى الصوت في الخلفية أثناء الأوصاف)، وتصدير النتيجة المتزامنة النهائية كملف MP3!
- إجراء الملف الذكي للفيديو: إذا ركزت على ملف فيديو محلي وضغطت اختصار الفيديو، ستكتشف الإضافة الملف تلقائياً وتعالجه مباشرة.
- تتبع الشخصيات المتقدم: يقوم الذكاء الاصطناعي الآن بتمرير استخراج الشخصيات. يبني قاموس شخصيات عالمي ويتتبع الشخصيات بدقة مقطعاً بمقطع دون الخلط بين الهويات.
- تكوين تحليل الفيديو: تمت إضافة إعدادات جديدة للتحكم في أحجام شرائح SRT وتنظيم الشخصيات وإخلاء المسؤولية.
- توجيه النماذج الموسع: يمكنك الآن تحديد نماذج فيديو متخصصة صراحة (
gemini_video_model، custom_video_model) في إعدادات التوجيه المتقدم للنماذج.
- الإدارة الذكية لحصة API: تحسين معالجة أخطاء 429 (الحد اليومي) من خلال تتبع الحصص لكل نموذج. إذا بلغ مفتاح حدّه اليومي على نموذج واحد، يتم عزله بذكاء لهذا النموذج المحدد فقط، تاركاً المفتاح متاحاً للاستخدام مع نماذج أخرى.
تغييرات الإصدار 7.0.0
- استئناف المسح غير المكتمل: تمت إضافة ميزة الاستئناف لكل من قارئ المستندات وإجراءات الملف الذكية. إذا انقطع المسح، يمكنك الآن المتابعة من حيث توقف بدلاً من البدء من الصفر.
- متغير جديد
[screen_fg_obj]: تمت إضافة متغير موجه مخصص لالتقاط لقطة شاشة للنافذة النشطة في المقدمة فقط بدلاً من الشاشة بأكملها.
- إعادة المحاولة الذكية وتدوير المفاتيح: تعيد الإضافة الآن المحاولة بصمت حتى 5 مرات على نفس المفتاح عند مواجهة أحمال زائدة مؤقتة على الخادم (مثل "الطلب المرتفع" أو الاستجابات غير الصالحة). إذا فشلت إعادة المحاولة، تتحول تلقائياً إلى مفتاح API التالي في قائمتك.
- كشف ستارة الشاشة: تمت إضافة فحص لمنع التقاط لقطات الشاشة عندما تكون ستارة الشاشة نشطة (سواء كانت مفعلة بشكل دائم أو مفعلة مؤقتاً باختصار لوحة المفاتيح). ستحذرك وتتوقف، لمنع إرسال صور سوداء وإهدار رموز API.
- تحسينات قارئ المستندات: يقوم مربع حوار نطاق PDF الآن بتحديد اللغة الهدف الافتراضية تلقائياً من إعدادات الإضافة. كما تم تحسين معالجة الخيوط لضمان توقف المهام في الخلفية بشكل نظيف عند إغلاق القارئ.
- تكامل Mistral OCR الأصلي: تم دمج واجهة برمجة تطبيقات OCR الأصلية للمستندات من Mistral. يتم دمج المستندات متعددة الصفحات تلقائياً ورفعها ومعالجتها في دفعات باستخدام نقطة اتصال
/v1/ocr المتخصصة من Mistral، بينما تتم معالجة صور الصفحة الواحدة مباشرة دون تحويلات PDF غير ضرورية [1].
- معالجات URL مخصصة ديناميكية: يؤدي تعديل رابط API المخصص الآن إلى مسح قائمة النماذج المخزنة مؤقتاً فوراً واستعادة مربع إدخال اسم النموذج اليدوي. يضمن هذا التوافق الكامل مع نقاط الاتصال المخصصة (مثل Cloudflare AI Gateway) التي لا تدعم نقطة الاتصال القياسية
/v1/models.
- إصلاح محرك إدخال مشغل الذكاء الاصطناعي: تمت إعادة كتابة نظام محاكاة الماوس ولوحة المفاتيح الأساسي لمشغل الذكاء الاصطناعي بالكامل. تم استبدال واجهة
mouse_event القديمة بواجهة Windows الحديثة SendInput، مما يوفر توافقاً أعلى بكثير مع التطبيقات الحديثة والنوافذ المحمية بـ UAC وشاشات عالية الدقة (DPI).
- إصلاح عمليات السحب والإفلات: أصبحت إجراءات السحب والإفلات في مشغل الذكاء الاصطناعي مستقرة وموثوقة تماماً الآن. يستخدم المحرك الجديد منحنيات "تخفيف" طبيعية وتمركزاً دقيقاً للمؤشر وتوقيتاً محسناً وتقنية "نقرة ذكية" لضمان تعرف Windows والتطبيقات على إيماءات السحب والإفلات وتنفيذها بشكل صحيح دون فشل في منتصف الطريق.
- دعم الشاشات المتعددة: يدعم مشغل الذكاء الاصطناعي الآن إعدادات الشاشات المتعددة بالكامل. تعمل حركات الماوس والنقرات بشكل صحيح عبر جميع الشاشات باستخدام علامة
MOUSEEVENTF_VIRTUALDESK، مما يضمن تحديد الموضع بدقة بغض النظر عن الشاشة التي يوجد عليها التطبيق الهدف.
- تحسين محاكاة لوحة المفاتيح: تحسين حقن ضغطات المفاتيح لدعم "المفاتيح الموسعة" بالكامل (مثل مفاتيح الأسهم و Home و End و Page Up/Down و Insert و Delete و F1-F12). يضمن هذا عمل أوامر التنقل والاختصارات التي يرسلها مشغل الذكاء الاصطناعي بشكل مثالي عبر جميع التطبيقات.
- دعم صور HEIC/HEIF: تمت إضافة دعم أصلي لتنسيقات صور iPhone. يمكنك الآن تحديد ملفات
.heic و .heif مباشرة للوصف بالذكاء الاصطناعي أو OCR أو قراءة المستندات دون تحويل مسبق.
تغييرات الإصدار 6.5.0
- المساعد المباشر (Live Assistant): تمت إضافة ميزة المساعد الصوتي والبصري المباشر، والمتاحة حصرياً لمزود Google Gemini (أو المزودين المخصصين المتوافقين مع Gemini). تتضمن تفاعلاً صوتياً وتخصيص عمق التفكير مباشرة داخل الحوار، مع إعادة اتصال تلقائي عند تغيير الإعدادات.
- مزود MiniMax AI: تم دمج MiniMax كمزود مكافئ مع دعم كامل متعدد الوسائط (دردشة، رؤية، OCR)، وصوت TTS مخصص باستخدام أكثر من 300+ صوت ديناميكي، وإزالة تلقائية لكتل التفكير (مثل
<think>...</think>) من المخرجات.
- تصحيح ترجمة عارض المستندات: تم إصلاح فشل الترجمة الصامت لمستخدمي NVDA غير الناطقين بالإنجليزية من خلال ضمان إرسال رمز اللغة المكون من حرفين إلى Google Translate بدلاً من اسم اللغة المحلي.
- إعادة محاولة المسح المجمع PDF: تم تنفيذ منطق إعادة محاولة منفصل وصامت وعالي التحسين لمسح دفعات مستندات PDF لمنع الرفع المكرر وتجنب النوافذ المنبثقة المزعجة أثناء إعادة المحاولة.
- حالة عارض المستندات: تم إصلاح خطأ حيث كانت حالة الإضافة الإجمالية (التي يتم التحقق منها عبر
I) تبقى عالقة على "بدأت المعالجة المجمعة" أثناء مسح المستندات الطويلة.
- إصلاح تعطل الخيوط: تم إصلاح تعطل فادح في تأكيد
IsMain() failed in wxTimerImpl عند فتح المستندات من خيط في الخلفية من خلال تحويل قائمة استدعاءات واجهة المستخدم الرسومية إلى wx.CallAfter.
تغييرات الإصدار 6.1.2
- الفحص المسبق للتسميات المكررة: تم إصلاح مشكلة في التسمية الفردية حيث كان فحص التكرار يستخدم مفاتيح إحداثيات قديمة، مما جعل NVDA يرسل طلبات ذكاء اصطناعي مكررة للكائنات المسماة بالفعل بدلاً من الإعلان عن التسمية الحالية.
- دردشة المستندات للمزودين غير Gemini: تم إصلاح فحص صارم لمفتاح API في دردشة المستندات (
on_ask) لضمان قدرة المستخدمين على مزودي OpenAI أو Groq أو المزودين المخصصين المحليين (مثل Ollama) على الدردشة مع المستندات بنجاح دون حظر.
- ترجمة OCR السريعة عبر كروم: تمت استعادة واجهة الترجمة المجانية بدون مفتاح لـ Chrome OCR. ترجمة النص المستخرج تتجاوز الآن Gemini AI، مما يوفر حصص API ويسرع عملية الترجمة.
- عامل تصفية الكابتشا الأبجدي الرقمي: تم تصحيح منطق التصفية في حل الكابتشا لضمان تنظيف الأحرف غير الأبجدية الرقمية بشكل صحيح في جميع الحالات.
- تحديث تعليمات طبقة الأوامر: تم تصحيح اختصار الإعلان عن الحالة في قائمة المساعدة من
L إلى I، وتمت إضافة أمرَي التسمية (L و Shift+L) إلى القائمة.
تغييرات الإصدار 6.1.1
- إصلاح مخرجات تفكير Gemma 4: تم إصلاح مشكلة مع نماذج Gemma 4 حيث تم عرض عملية التفكير الداخلية بأكملها كاستجابة نهائية، أو حيث أدى تعطيل التفكير إلى استجابات فارغة. تعزل الإضافة الآن وتستخرج فقط نص الاستجابة النهائية النظيف.
- OCR الدفعي من مستكشف الملفات: يمكنك الآن تحديد عدة صور أو ملفات PDF مباشرة في مستكشف ملفات Windows واستخراج النص أو تحليلها دفعة واحدة. ستقوم الإضافة تلقائياً بتصفية ومعالجة تنسيقات الملفات المدعومة فقط.
تغييرات الإصدار 6.1.0
- تكامل الذكاء الاصطناعي المحلي الشامل (إعداد الذكاء الاصطناعي المحلي): تمت إضافة زر جديد "إعداد الذكاء الاصطناعي المحلي" في إعدادات المزود المخصص. يمكن للمستخدمين الآن تكوين محركات الذكاء الاصطناعي المحلية تلقائياً، بما في ذلك Ollama و LM Studio و Jan.ai و KoboldCPP فوراً.
- تجاوز البروكسي المحلي الذكي: تمت إعادة بناء منطق الاتصال بآلية متقدمة لتجاوز البروكسي. الإضافة الآن ذكية بما يكفي لتجاوز بروكسيات نظام Windows تماماً لاتصالات الحلقة المحلية، مما يضمن اتصالات ذكاء اصطناعي محلية مستقرة حتى عندما يكون VPN/وضع TUN نشطاً.
- التسمية بالذكاء الاصطناعي فائقة الثبات (v2): تم استبدال مفاتيح الإحداثيات المطلقة للشاشة بنظام توقيع الكائن الهجين المتقدم. تعتمد التسميات الآن على معرّفات برمجية (UIA AutomationId أو Win32 ControlID) وإحداثيات متعلقة بالنافذة، مما يجعل تسمياتك المخصصة مقاومة تماماً لتغيير حجم النوافذ أو تحريكها أو تبديل الشاشات أو تغيير المقياس.
- ترحيل تلقائي سلس للتسميات: الترقية شفافة تماماً. ستقوم الإضافة تلقائياً بترحيل تسمياتك القديمة القائمة على الإحداثيات إلى تنسيق التوقيع الجديد المستقر في الخلفية عند أول تركيز، دون أي فقدان للبيانات.
تغييرات الإصدار 6.0
- تقديم التسمية الدلالية بالذكاء الاصطناعي: يمكن للمستخدمين الآن تسمية الأزرار والأيقونات غير المسماة بشكل دائم باستخدام الذكاء الاصطناعي. اضغط L لتسمية كائن التوجيه الحالي (يدعم تركيز Tab وتنقل الكائنات) أو Shift+L لمسح التطبيق بأكمله وتسميته دفعة واحدة.
- إدارة التسميات الذكية: تمت إضافة نافذة مدير تسميات جديدة يسهل الوصول إليها بالكامل (عبر Shift+L إذا كانت هناك تسميات) لعرض التسميات المخصصة أو إعادة تسميتها أو حذفها دفعة واحدة.
- تحليل الملفات المباشر (تجاوز نافذة الملف): الإضافة الآن ذكية بما يكفي لاكتشاف ما إذا كنت تركز حالياً على ملف PDF أو صورة في مستكشف ملفات Windows. الضغط على F (إجراء الملف الذكي) أو D (قارئ المستندات) على ملف مميز سيعالجه فوراً، متجاوزاً نافذة "فتح" القياسية تماماً.
تغييرات الإصدار 5.6
- إضافة محرك OCR "بلا (استخراج طبقة النص)": يمكن للمستخدمين الآن استخراج النص مباشرة من ملفات PDF القابلة للبحث دون استخدام أرصدة الذكاء الاصطناعي، مما يحسن السرعة والخصوصية بشكل كبير للمستندات النصية.
- تحسين دقة مستكشف واجهة المستخدم: تم تحسين موجه مستكشف واجهة المستخدم لتحديد أنواع العناصر بشكل أفضل (مثل عناصر القائمة) والإبلاغ بدقة عن حالات مثل "(محدد)" أو "(مختار)" أو "(موسع)" مع تجاهل مكونات نظام Windows مثل شريط المهام والساعة.
- تذكير إعداد التثبيت: تمت إضافة إشعار بعد التثبيت لتوجيه المستخدمين إلى قائمة الإعدادات لتكوين مفاتيح API والتفضيلات.
تغييرات الإصدار 5.5.2
- إصلاح مشكلة الكتابة في مشغل الذكاء الاصطناعي: تم حل خطأ حيث تم كتابة الحرف 'v' بدلاً من لصق النص على بعض الأنظمة. يعالج هذا الإصلاح تضاربات التوقيت التي حدثت أثناء الحمل العالي على النظام.
- تعزيز الثبات: تمت إضافة معالجة قوية للأخطاء لعمليات الحافظة لمنع أعطال الإضافة عندما تكون حافظة النظام مقفلة مؤقتاً بواسطة تطبيقات أخرى.
- تحسين التوقيت: تم تعديل التأخيرات الداخلية لأحداث لوحة المفاتيح لضمان موثوقية أعلى عبر سرعات الأنظمة المختلفة وتوافق أفضل مع مديري الحافظة من الأطراف الثالثة.
تغييرات الإصدار 5.5 (تحديث الأتمتة)
- مشغل الذكاء الاصطناعي (التحكم المستقل - Shift+A): هذا هو جوهرة التاج في v5.5. تخرج Vision Assistant Pro من كونها مساعداً سلبياً لتصبح مشغل الذكاء الاصطناعي الشخصي الخاص بك. إنه لا يصف الشاشة فقط — بل يتولى القيادة.
- كيف يعمل: يمكنك الآن إعطاء تعليمات شفهية لتشغيل جهاز الكمبيوتر الخاص بك. على سبيل المثال، في تطبيق غير قابل للوصول تماماً حيث يظل قارئ الشاشة صامتاً، يمكنك الضغط على Shift+A وكتابة: "انقر على زر الإعدادات" أو "ابحث عن حقل البحث، واكتب 'آخر الأخبار' واضغط Enter." يحدد الذكاء الاصطناعي العناصر بصرياً ويحرك الماوس وينفذ المهمة نيابة عنك.
- ملاحظة الأداء: هذه الميزة محسنة لـ Gemini 3.0 Flash (Preview)، مما يوفر استجابات سريعة وذكية بشكل لا يصدق يمكنها التعامل مع حتى أكثر تخطيطات واجهة المستخدم تعقيداً.
- ⚠️ تحذير استخدام API: نظراً لأن مشغل الذكاء الاصطناعي يحتاج إلى "رؤية" ما يحدث بالضبط ليكون دقيقاً، فإنه يرسل لقطة شاشة عالية الدقة مع كل خطوة. يرجى ملاحظة أن الاستخدام المتكرر سيستهلك حصة API الخاصة بك بشكل أسرع بكثير من المهام النصية القياسية.
- مستكشف واجهة المستخدم المرئي (E): هل سئمت من التنقل عبر "الأزرار غير المسماة"؟ اضغط E لتفعيل مستكشف واجهة المستخدم. سيقوم الذكاء الاصطناعي بمسح النافذة بأكملها وتوليد قائمة بكل عنصر قابل للنقر يراه — بما في ذلك الأيقونات والرسومات والقوائم. ما عليك سوى اختيار عنصر من القائمة، وسيقوم مشغل الذكاء الاصطناعي بالنقر عليه نيابة عنك. إنه مثل امتلاك "طبقة يسهل الوصول إليها" فوق أي تطبيق.
- إجراء الملف الذكي الحساس للسياق (F): تم إصلاح مفتاح "F" بالكامل. لم يعد يفترض أنك تريد OCR فقط. عند تحديد صورة واحدة، يطلب الآن نيتك بذكاء: يمكنك اختيار وصف بصري مفصل لفهم المشهد أو استخراج نص منظم (OCR) للقراءة. تتكيف القائمة ديناميكياً بناءً على نوع الملف ومحرك الذكاء الاصطناعي النشط لديك.
- التحسين الأساسي: قمنا بتنظيف عميق لمنطق الإضافة الداخلي، وإزالة الوظائف القديمة غير المستخدمة والكود المكرر. ينتج عن هذا تجربة أخف وأسرع وأكثر موثوقية لجميع المستخدمين.
تغييرات الإصدار 5.0
- بنية متعددة المزودين: تمت إضافة دعم كامل لـ OpenAI و Groq و Mistral إلى جانب Google Gemini. يمكن للمستخدمين الآن اختيار خلفية الذكاء الاصطناعي المفضلة لديهم.
- التوجيه المتقدم للنماذج: يمكن لمستخدمي المزودين الأصليين (Gemini، OpenAI، وغيرهم) الآن تحديد نماذج محددة من قائمة منسدلة لمهام مختلفة (OCR، STT، TTS).
- تكوين نقطة الاتصال المتقدم: يمكن لمستخدمي المزود المخصص إدخال عناوين URL وأسماء نماذج محددة يدوياً للتحكم الدقيق في الخوادم المحلية أو الخارجية.
- رؤية الميزات الذكية: قائمة الإعدادات وواجهة قارئ المستندات تخفي الآن تلقائياً الميزات غير المدعومة (مثل TTS) بناءً على المزود المحدد.
- الجلب الديناميكي للنماذج: تجلب الإضافة الآن قائمة النماذج المتاحة مباشرة من واجهة برمجة تطبيقات المزود، مما يضمن التوافق مع النماذج الجديدة فور إصدارها.
- OCR والترجمة الهجينان: تم تحسين المنطق لاستخدام Google Translate للسرعة عند استخدام Chrome OCR، والترجمة المدعومة بالذكاء الاصطناعي عند استخدام محركات Gemini/Groq/OpenAI.
- "إعادة المسح بالذكاء الاصطناعي" الشامل: لم تعد ميزة إعادة المسح في قارئ المستندات مقتصرة على Gemini. تستخدم الآن أي مزود ذكاء اصطناعي نشط حالياً لإعادة معالجة الصفحات.
تغييرات الإصدار 4.6
- استدعاء النتيجة التفاعلي: تمت إضافة مفتاح Space إلى طبقة الأوامر، مما يسمح للمستخدمين بإعادة فتح آخر استجابة من الذكاء الاصطناعي فوراً في نافذة دردشة لأسئلة المتابعة، حتى عندما يكون وضع "الإخراج المباشر" نشطاً.
- مركز مجتمع Telegram: تمت إضافة رابط "القناة الرسمية على Telegram" إلى قائمة أدوات NVDA، مما يوفر طريقة سريعة للبقاء على اطلاع بأحدث الأخبار والميزات والإصدارات.
- ثبات محسّن للاستجابة: تم تحسين المنطق الأساسي لميزات الترجمة و OCR والرؤية لضمان أداء أكثر موثوقية وتجربة أكثر سلاسة عند استخدام الإخراج الصوتي المباشر.
- تحسين الإرشادات في الواجهة: تم تحديث أوصاف الإعدادات والوثائق لشرح نظام الاستدعاء الجديد بشكل أفضل وكيف يعمل جنباً إلى جنب مع إعدادات الإخراج المباشر.
تغييرات الإصدار 4.5
- مدير الموجهات المتقدم: تم تقديم نافذة إدارة مخصصة في الإعدادات لتخصيص موجهات النظام الافتراضية وإدارة الموجهات المعرفة من قبل المستخدم مع دعم كامل للإضافة والتعديل وإعادة الترتيب والمعاينة.
- دعم شامل للبروكسي: تم حل مشكلات الاتصال بالشبكة من خلال ضمان تطبيق إعدادات البروكسي التي يحددها المستخدم بدقة على جميع طلبات API، بما في ذلك الترجمة و OCR وتوليد الكلام.
- ترحيل البيانات الآلي: تم دمج نظام ترحيل ذكي لترقية تكوينات الموجهات القديمة تلقائياً إلى تنسيق JSON v2 قوي عند التشغيل الأول دون فقدان البيانات.
- تحديث التوافق (2025.1): تم تعيين الحد الأدنى لإصدار NVDA المطلوب إلى 2025.1 بسبب اعتماديات المكتبات في الميزات المتقدمة مثل قارئ المستندات لضمان أداء مستقر.
- واجهة إعدادات محسنة: تم تبسيط واجهة الإعدادات من خلال إعادة تنظيم إدارة الموجهات في نافذة منفصلة، مما يوفر تجربة مستخدم أنظف وأسهل في الوصول إليها.
- دليل متغيرات الموجهات: تمت إضافة دليل مدمج داخل نوافذ الموجهات لمساعدة المستخدمين على تحديد واستخدام المتغيرات الديناميكية بسهولة مثل [selection] و [clipboard] و [screen_obj].
تغييرات الإصدار 4.0.3
- تعزيز مرونة الشبكة: تمت إضافة آلية إعادة محاولة تلقائية للتعامل بشكل أفضل مع اتصالات الإنترنت غير المستقرة والأخطاء المؤقتة للخادم، مما يضمن استجابات ذكاء اصطناعي أكثر موثوقية.
- نافذة الترجمة المرئية: تم تقديم نافذة مخصصة لنتائج الترجمة. يمكن للمستخدمين الآن التنقل وقراءة الترجمات الطويلة سطراً بسطر بسهولة، على غرار نتائج OCR.
- العرض المنسق المجمع: ميزة "عرض منسق" في قارئ المستندات تعرض الآن جميع الصفحات المعالجة في نافذة واحدة منظمة مع رؤوس صفحات واضحة.
- سير عمل OCR محسّن: يتخطى تلقائياً تحديد نطاق الصفحات للمستندات ذات الصفحة الواحدة، مما يجعل عملية التعرف أسرع وأكثر سلاسة.
- تحسين ثبات API: تم التحول إلى طريقة مصادقة قوية قائمة على الرؤوس، مما يحل أخطاء "فشلت جميع مفاتيح API" المحتملة الناتجة عن تضاربات تدوير المفاتيح.
- إصلاحات الأخطاء: تم حل عدة أعطال محتملة، بما في ذلك مشكلة أثناء إنهاء الإضافة وخطأ تركيز في نافذة الدردشة.
تغييرات الإصدار 4.0.1
- قارئ المستندات المتقدم: عارض جديد قوي لملفات PDF والصور مع اختيار نطاق الصفحات والمعالجة في الخلفية والتنقل السلس عبر
Ctrl+PageUp/Down.
- قائمة فرعية جديدة للأدوات: تمت إضافة قائمة فرعية مخصصة "Vision Assistant" ضمن قائمة أدوات NVDA للوصول بشكل أسرع إلى الميزات الأساسية والإعدادات والوثائق.
- تخصيص مرن: يمكنك الآن اختيار محرك OCR وصوت TTS المفضل لديك مباشرة من لوحة الإعدادات.
- دعم مفاتيح API متعددة: تمت إضافة دعم لمفاتيح Gemini API متعددة. يمكنك إدخال مفتاح واحد لكل سطر أو فصلها بفواصل في الإعدادات.
- محرك OCR بديل: تم تقديم محرك OCR جديد لضمان التعرف الموثوق على النص حتى عند الوصول إلى حدود حصة Gemini API.
- تدوير مفاتيح API الذكي: يتحول تلقائياً إلى أسرع مفتاح API يعمل ويتذكره لتجاوز حدود الحصة.
- المستند إلى MP3/WAV: تم دمج القدرة على توليد وحفظ ملفات صوتية عالية الجودة بتنسيقي MP3 (128kbps) و WAV مباشرة داخل القارئ.
- دعم قصص Instagram: تمت إضافة القدرة على وصف وتحليل قصص Instagram باستخدام عناوين URL الخاصة بها.
- دعم TikTok: تم تقديم دعم فيديوهات TikTok، مما يسمح بالوصف البصري الكامل والتفريغ الصوتي للمقاطع.
- نافذة تحديث مُعاد تصميمها: تتميز بواجهة جديدة يسهل الوصول إليها مع مربع نص قابل للتمرير لقراءة تغييرات الإصدار بوضوح قبل التثبيت.
- حالة وتجربة مستخدم موحدتان: تم توحيد نوافذ الملفات عبر الإضافة وتحسين أمر 'L' للإبلاغ عن التقدم في الوقت الفعلي.
تغييرات الإصدار 3.6.0
- نظام المساعدة: تمت إضافة أمر مساعدة (
H) داخل طبقة الأوامر لتوفير قائمة يسهل الوصول إليها بجميع الاختصارات ووظائفها.
- تحليل الفيديو عبر الإنترنت: تم توسيع الدعم ليشمل فيديوهات Twitter (X). كما تم تحسين اكتشاف URL والثبات لتجربة أكثر موثوقية.
- المساهمة في المشروع: تمت إضافة نافذة تبرع اختيارية للمستخدمين الذين يرغبون في دعم التحديثات المستقبلية والنمو المستمر للمشروع.
تغييرات الإصدار 3.5.0
- طبقة الأوامر: تم تقديم نظام طبقة أوامر (الافتراضي:
NVDA+Shift+V) لتجميع الاختصارات تحت مفتاح رئيسي واحد. على سبيل المثال، بدلاً من الضغط على NVDA+Control+Shift+T للترجمة، تضغط الآن NVDA+Shift+V ثم T.
- تحليل الفيديو عبر الإنترنت: تمت إضافة ميزة جديدة لتحليل فيديوهات YouTube و Instagram مباشرة عن طريق توفير رابط URL.
تغييرات الإصدار 3.1.0
- وضع الإخراج المباشر: تمت إضافة خيار لتخطي نافذة الدردشة وسماع استجابات الذكاء الاصطناعي مباشرة عبر الكلام لتجربة أسرع وأكثر سلاسة.
- تكامل الحافظة: تمت إضافة إعداد جديد لنسخ استجابات الذكاء الاصطناعي تلقائياً إلى الحافظة.
تغييرات الإصدار 3.0
- لغات جديدة: تمت إضافة الترجمتين الفارسية و الفيتنامية.
- نماذج ذكاء اصطناعي موسعة: تمت إعادة تنظيم قائمة اختيار النماذج ببادئات واضحة (
[Free]، [Pro]، [Auto]) لمساعدة المستخدمين على التمييز بين النماذج المجانية والنماذج المحدودة (المدفوعة). تمت إضافة دعم Gemini 3.0 Pro و Gemini 2.0 Flash Lite.
- ثبات الإملاء: تم تحسين ثبات الإملاء الذكي بشكل كبير. تمت إضافة فحص أمان لتجاهل المقاطع الصوتية الأقصر من ثانية واحدة، لمنع هلوسات الذكاء الاصطناعي والأخطاء الفارغة.
- معالجة الملفات: تم إصلاح مشكلة فشل رفع الملفات ذات الأسماء غير الإنجليزية.
- تحسين الموجهات: تم تحسين منطق الترجمة ونتائج الرؤية المنظمة.
تغييرات الإصدار 2.9
- تمت إضافة الترجمتين الفرنسية والتركية.
- العرض المنسق: تمت إضافة زر "عرض منسق" في نوافذ الدردشة لعرض المحادثة بتنسيق مناسب (العناوين، الغامق، الكود) في نافذة قياسية قابلة للتصفح.
- إعداد Markdown: تمت إضافة خيار جديد "تنظيف Markdown في الدردشة" في الإعدادات. إلغاء تحديده يسمح للمستخدمين برؤية صيغة Markdown الخام (مثل
**، #) في نافذة الدردشة.
- إدارة النوافذ: تم إصلاح مشكلة فتح نوافذ "تحسين النص" أو الدردشة عدة مرات أو فشل التركيز عليها بشكل صحيح.
- تحسينات تجربة المستخدم: تم توحيد عناوين نوافذ الملفات إلى "فتح" وإزالة الإعلانات الصوتية المكررة (مثل "جارٍ فتح القائمة...") لتجربة أكثر سلاسة.
تغييرات الإصدار 2.8
- تمت إضافة الترجمة الإيطالية.
- الإبلاغ عن الحالة: تمت إضافة أمر جديد (NVDA+Control+Shift+I) للإعلان عن الحالة الحالية للإضافة (مثل "جارٍ الرفع..."، "جارٍ التحليل...").
- تصدير HTML: زر "حفظ المحتوى" في نوافذ النتائج يحفظ الآن المخرجات كملف HTML منسق، مع الحفاظ على الأنماط مثل العناوين والنص الغامق.
- واجهة الإعدادات: تم تحسين تخطيط لوحة الإعدادات بتجميع يسهل الوصول إليه.
- نماذج جديدة: تمت إضافة دعم لـ gemini-flash-latest و gemini-flash-lite-latest.
- اللغات: تمت إضافة النيبالية إلى اللغات المدعومة.
- منطق قائمة التحسين: تم إصلاح خطأ حرج حيث فشلت أوامر "تحسين النص" إذا لم تكن لغة واجهة NVDA إنجليزية.
- الإملاء: تم تحسين اكتشاف الصمت لمنع إخراج نص غير صحيح عند عدم إدخال كلام.
- إعدادات التحديث: أصبح "التحقق من التحديثات عند بدء التشغيل" معطلاً افتراضياً للامتثال لسياسات متجر الإضافات.
- تنظيف الكود.
تغييرات الإصدار 2.7
- تم ترحيل بنية المشروع إلى القالب الرسمي لإضافات NV Access للامتثال الأفضل للمعايير.
- تم تنفيذ منطق إعادة محاولة تلقائي لأخطاء HTTP 429 (حد المعدل) لضمان الموثوقية أثناء حركة المرور العالية.
- تم تحسين موجهات الترجمة لدقة أعلى ومعالجة أفضل لمنطق "التبديل الذكي".
- تم تحديث الترجمة الروسية.
تغييرات الإصدار 2.6
- تمت إضافة دعم الترجمة الروسية (بفضل nvda-ru).
- تم تحديث رسائل الخطأ لتوفير ملاحظات أكثر وصفاً بشأن الاتصال.
- تم تغيير اللغة الهدف الافتراضية إلى الإنجليزية.
تغييرات الإصدار 2.5
- تمت إضافة أمر OCR أصلي للملفات (NVDA+Control+Shift+F).
- تمت إضافة زر "حفظ الدردشة" إلى نوافذ النتائج.
- تم تنفيذ دعم الترجمة الكامل (i18n).
- تم ترحيل التغذية الراجعة الصوتية إلى وحدة النغمات الأصلية في NVDA.
- تم التحول إلى Gemini File API لمعالجة أفضل لملفات PDF والصوت.
- تم إصلاح تعطل عند ترجمة نص يحتوي على أقواس متعرجة.
تغييرات الإصدار 2.1.1
- تم إصلاح مشكلة عدم عمل متغير [file_ocr] بشكل صحيح داخل الموجهات المخصصة.
تغييرات الإصدار 2.1
- تم توحيد جميع الاختصارات لاستخدام NVDA+Control+Shift للقضاء على التعارضات مع تخطيط الكمبيوتر المحمول في NVDA واختصارات النظام.
تغييرات الإصدار 2.0
- تم تنفيذ نظام التحديث التلقائي المدمج.
- تمت إضافة ذاكرة تخزين مؤقت للترجمة الذكية للاسترجاع الفوري للنص المترجم سابقاً.
- تمت إضافة ذاكرة المحادثة لتحسين النتائج حسب السياق في نوافذ الدردشة.
- تمت إضافة أمر ترجمة الحافظة المخصص (NVDA+Control+Shift+Y).
- تم تحسين موجهات الذكاء الاصطناعي لفرض إخراج اللغة الهدف بدقة.
- تم إصلاح تعطل ناتج عن أحرف خاصة في نص الإدخال.
تغييرات الإصدار 1.5
- تمت إضافة دعم لأكثر من 20 لغة جديدة.
- تم تنفيذ نافذة التحسين التفاعلية لأسئلة المتابعة.
- تمت إضافة ميزة الإملاء الذكي الأصلي.
- تمت إضافة فئة "Vision Assistant" إلى نافذة إيماءات الإدخال في NVDA.
- تم إصلاح أعطال COMError في تطبيقات محددة مثل Firefox و Word.
- تمت إضافة آلية إعادة محاولة تلقائية لأخطاء الخادم.
تغييرات الإصدار 1.0