تبدأ رحلتنا في استكشاف موقع مجاني شامل يضم كنوز وهي : دورات مجانية ومنح دراسية ووظائف وتدريب ومقالات مفيدة ودليل كامل لكل مجال خاص بالتكنولوجيا حصريا وبعض من المجالات الاخري لمتابعة كل جديد علي التليجرام والفيسبوك | Telegram | Facebook

500+ NLP Interview Questions with Answers 2026

دورة متاحة لفترة محدودة
free-palestine free-palestine

Responsive image
منذ 3 ساعات

أهلا بك عزيزي المتابع لموقع (journey for learn) نقدم دورات بكوبونات متاحة لاول 1000 تسجيل مجاني فقط وكوبونات اخري لفترة محدودة فاذا كنت تريد ان تحصل علي كل الكورسات علي موقعنا وان تكون اول المسجلين في الكورسات المجانية قم بتسجيل الدخول أوقم بالدخول علي وسائل التواصل الاجتماعي وخصوصا التليجرام نوضح الوصف المختصر والطويل للدورات لكي تعرف الدروس التي سوف تتعلمها بسهولة ويسر :

تغطية تفصيلية لنطاق الاختبار، ينقسم بنك الأسئلة الشامل هذا بشكل منهجي إلى الكفاءات الفنية الأساسية المتوقعة في المقابلات المهنية المتعلقة بالذكاء الاصطناعي وهندسة التعلم الآلي.
  • المعالجة المسبقة للنص (18%): استراتيجيات الترميز (WordPiece، BPE)، والاستخلاص المتقدم، والتحويل باستخدام أشجار التبعية، وترشيح كلمات التوقف، وقواعد تطبيع النص.
  • تحليل المشاعر واستخراج الآراء (15%): القائم على المعجم مقابل تحليل المشاعر القائم على تعلم الآلة، واكتشاف المشاعر، وتحليل المشاعر القائم على الجوانب (ABSA)، وبنيات التعلم العميق لاستخراج الآراء على مستوى التسلسل.
  • التعلم الآلي للبرمجة اللغوية العصبية (20%): نماذج التعلم الخاضع للإشراف، والمجموعات الهيكلية غير الخاضعة للإشراف، ونماذج تسلسل التعلم العميق، وبروتوكولات الضبط الدقيق للتعلم النقلي، وآليات الانتباه.
  • تطبيقات البرمجة اللغوية العصبية (12%): نص متعدد الفئات التصنيف، والترجمة الآلية العصبية (NMT)، وتكامل التعرف على الكلام، وبنية Chatbots، واسترجاع المعلومات المتقدمة المستندة إلى المتجهات.
  • نماذج ومعماريات البرمجة اللغوية العصبية (15%): أطر التشفير وفك التشفير، وهندسة المحولات (الانتباه الذاتي، والتشفير الموضعي)، والشبكات العصبية المتكررة (RNNs)، وشبكات الذاكرة الطويلة قصيرة المدى (LSTMs)، والكلمات الثابتة مقابل السياقية. التضمينات.
  • التقييم والتحسين (10%): مقاييس البرمجة اللغوية العصبية الأساسية (BLEU، ROUGE، F1-score، Perplexity)، التحقق من صحة تسلسل النص، ضبط المعلمات الفائقة، إمكانية تفسير النماذج، وقابلية الشرح.
  • موضوعات البرمجة اللغوية العصبية المتخصصة (5%): النمذجة متعددة الوسائط، النقل عبر اللغات والبرمجة اللغوية العصبية متعددة اللغات، قيود اللغة منخفضة الموارد، الهجمات العدائية على النماذج النصية، والتخفيف من مشكلات الإنصاف والتحيز.
  • أدوات وأطر عمل البرمجة اللغوية العصبية (5%): تنفيذ خط الأنابيب على مستوى الإنتاج باستخدام NLTK، وspaCy، وGensim، وTensorFlow، وPyTorch.
حول الدورة التدريبية يتطلب إجراء مقابلة لمهندس البرمجة اللغوية العصبية أو منصب مطور الذكاء الاصطناعي أكثر من مجرد الاتصال بـ .fit() على نموذج تم تدريبه مسبقًا. تختبر الجولات التقنية الحديثة فهمك الأساسي لكيفية تدفق الرموز المميزة عبر البنية العصبية، وكيف تتعامل مصفوفات الاهتمام مع أوزان الرموز المميزة، وكيف تؤثر اختيارات المعالجة المسبقة المحددة بشكل مباشر على زمن استجابة التطبيق ومقاييسه. لقد قمت ببناء قاعدة بيانات اختبار الممارسة الشاملة هذه لتوفر لك بيئة واقعية وصارمة للغاية حيث يمكنك اختبار معرفتك مقابل السيناريوهات الدقيقة التي يطلبها القائمون على المقابلات في الصناعة. يحتوي هذا المورد على 550 سؤالًا فريدًا تم تطويره بدقة، ويتجاوز التوافه البسيطة على طراز البطاقات التعليمية. بدلاً من ذلك، سوف تتعمق مباشرة في المشكلات الهندسية الواقعية: تشخيص التدرجات المتلاشية في LSTMs، وإدارة عدم تطابق الرمز المميز في النماذج متعددة اللغات، وتصحيح أخطاء طبقات الاهتمام الذاتي للمحولات، واختيار مقاييس التقييم المثالية لمجموعات البيانات النصية غير المتوازنة للغاية. يحتوي كل سؤال على تحليل فني شامل يشرح الواقع الرياضي أو الخوارزمي الدقيق وراء الخيار الصحيح، إلى جانب تحليل مباشر لسبب فشل الخيارات البديلة في التنفيذ. سواء كنت تقوم بمراجعة بنيات نمذجة التسلسل الأساسي أو التحضير لأسئلة تصميم الأنظمة المتقدمة التي تتضمن استرجاع المعلومات على نطاق واسع وروبوتات الدردشة، فإن اختبارات التدريب هذه ستساعدك على تحديد نقاط الضعف لديك ومسح شاشتك الفنية في محاولتك الأولى. أسئلة الممارسة النموذجية معاينة السؤال 1: تعقيد مصفوفة الاهتمام الذاتي والقياس في بنيات المحولات يقوم أحد المهندسين بنشر نموذج تشفير قائم على المحولات لمعالجة المستندات القانونية الطويلة. أثناء الاختبار الأولي مع المدخلات الطويلة، يواجه النظام خطأ خارج الذاكرة (OOM) على وجه التحديد أثناء حساب طبقة الانتباه الذاتي. إذا تمت الإشارة إلى طول تسلسل الإدخال كـ $N$، ما هو التعقيد الحسابي والذاكرة الأساسي لآلية انتباه المنتج النقطي التي تسبب اختناق القياس هذا؟
  • أ) يتم قياسه خطيًا، ويشار إليه بـ $O(N)$، لأن الاهتمام يتم حسابه بشكل مستقل لكل رمز مميز في تسلسل الإدخال.
  • ب) يتم قياسه لوغاريتميًا، يُشار إليه بـ $O(\log N)$، نظرًا لـ تم تطبيق التخفيض المنظم على شكل شجرة أثناء خطوة Softmax.
  • ج) يتم قياسه بشكل تربيعي، ويشار إليه بـ $O(N^2)$، لأن كل رمز مميز يجب أن يحسب منتج نقطي مع كل رمز مميز آخر لإنشاء مصفوفة الاهتمام.
  • د) يتم قياسه من حيث المساحة عند $O(N^3)$ بسبب تسلسل إسقاط الطبقة المخفية عبر رؤوس متعددة.
  • هـ) يتم قياسه بشكل أسي، يُشار إليه بـ $O(2^N)$، لأن الخصائص العودية لطبقة التشفير الموضعية تنمو مع طول التسلسل.
  • F) يتم قياسها بتعقيد ثابت قدره $O(1)$ لأن وقت التشغيل يعتمد كليًا على حجم المفردات الثابتة.
الإجابة الصحيحة والشرح:
  • الإجابة الصحيحة: C
  • لماذا هي صحيحة: يعتمد جوهر بنية المحولات على حساب التفاعل بين الاستعلامات ($Q$)، المفاتيح ($K$)، والقيم ($V$). صيغة مصفوفة الانتباه هي $\text{Softmax}(\frac{QK^T}{\sqrt{d_k}})V$. يؤدي ضرب المصفوفة $Q$ (الشكل $N \times d_k$) في المصفوفة $K$ المنقولة (الشكل $d_k \times N$) إلى مصفوفة $N \times N$. لذلك، يتم قياس كل من الوقت المطلوب لحساب منتجات النقاط هذه والذاكرة المطلوبة لتخزين درجات الانتباه بشكل تربيعي ($O(N^2)$) بالنسبة لطول التسلسل $N$.
  • لماذا الخيارات البديلة غير صحيحة:
    • الخيار أ غير صحيح: توجد نماذج انتباه خطية (مثل Linformer)، لكن انتباه محول الفانيليا القياسي غير خطي تمامًا فيما يتعلق بطول التسلسل.
    • الخيار ب غير صحيح: لا ينطبق المقياس اللوغاريتمي هنا لأن الانتباه يتطلب جميع الاتصالات الزوجية، والتي لا يمكن تنظيمها كبحث شجرة بسيط.
    • الخيار D غير صحيح: التعقيد المكعب ($O(N^3)$) يحدث في بعض عمليات تحليل المصفوفة، ولكن التخصيص المكاني للاهتمام الذاتي يحده مصفوفة $N \times N$.
    • الخيار E غير صحيح: الترميزات الموضعية هي متجهات ثابتة أو وظائف رياضية بسيطة تضاف إلى تضمينات الرمز المميز الأولية؛ أنها لا تؤدي إلى القياس الأسي.
    • الخيار F غير صحيح: يحد حجم المفردات من بُعد مصفوفة طبقة التضمين الأولي، ولكن ليس له أي تأثير على حساب طول التسلسل داخل كتل الانتباه المخفية.
السؤال 2: تقييم مخرجات نظام الترجمة الآلية العصبية باستخدام مقاييس BLEU يقوم مطور الذكاء الاصطناعي بتقييم نموذج ترجمة لغة تم تدريبه حديثًا على مجموعة بيانات التحقق من الصحة. الترجمة المرجعية المستهدفة هي "الثعلب البني السريع يقفز فوق الكلب الكسول"، ويقوم النموذج بإنشاء سلسلة نصية مرشحة: "الثعلب البني السريع يقفز فوق الكلب". عند حساب درجات الدقة لمقياس بحث التقييم ثنائي اللغة (BLEU)، كيف يمنع المقياس الكلمة المكررة "سريع" من تضخيم درجة الدقة بشكل مصطنع؟
  • أ) يتم إسقاط التكرار الثاني لكلمة "سريع" من خلال تطبيق مسافة Levenshtein على مستوى الحرف.
  • ب) يستخدم دقة n-gram المعدلة، والتي تقص الحد الأقصى لعدد أي n-gram من خلال الحد الأقصى لتكراره في المرجع text.
  • ج) يطبق تلقائيًا عامل عقوبة الإيجاز الذي يعمل على تقليل النتيجة الإجمالية بناءً على نسبة التكرار المحلية.
  • د) يتحول ديناميكيًا من الحساب الدقيق إلى تقييم ROUGE القائم على الاستدعاء إذا تجاوز تكرار الكلمة عتبة 10%.
  • هـ) يستفيد من أوزان الترميز من spaCy أو NLTK لوضع علامة على علامات الصفات المتكررة كانتهاكات لبناء الجملة.
  • F) يعاقب المرشح باستخدام اختلافات الخسارة عبر الإنتروبيا المحسوبة مباشرة من تخصيص القاموس المصدر.
الإجابة الصحيحة والشرح:
  • الإجابة الصحيحة: ب
  • لماذا هي صحيحة: الدقة القياسية تحسب ببساطة عدد الكلمات المرشحة التي تظهر في النص المرجعي. في هذه الحالة، تظهر كلمة "سريع" مرتين في المرشح، وبما أنها موجودة في المرجع، فإن الدقة القياسية ستعتبر كلاهما صحيحتين. يمنع BLEU ذلك باستخدام دقة n-gram المعدلة. فهو يحسب تكرار الكلمة في النص المرشح، لكن المقاطع التي يتم حسابها تصل إلى الحد الأقصى لعدد المرات التي تظهر فيها الكلمة في أي جملة مرجعية واحدة (والتي تكون 1 لـ "سريع").
  • لماذا تكون الخيارات البديلة غير صحيحة:
    • الخيار أ غير صحيح: مسافة Levenshtein تحسب مسافة التحرير بين السلاسل الفردية؛ لم يتم دمجه في منطق مطابقة الرمز المميز الخاص بـ BLEU.
    • الخيار C غير صحيح: تم تصميم عقوبة الإيجاز في BLEU لمعاقبة الترجمات المرشحة القصيرة جدًا مقارنة بالمرجع؛ فهو لا يقيس أو يعاقب التكرار الداخلي للكلمات.
    • الخيار د غير صحيح: BLEU هو مقياس قائم على الدقة بشكل صارم مع عقوبة الإيجاز؛ فهو لا يغير أبدًا منطقه الداخلي ليصبح ROUGE (وهو مقياس يركز على الاستدعاء يستخدم غالبًا للتلخيص).
    • الخيار E غير صحيح: BLEU هو مقياس مطابقة سلسلة على مستوى السطح؛ فهو لا يتوافق تمامًا مع علامات جزء من الكلام (POS)، أو توزيعات التبعية، أو قواعد إطار البرمجة اللغوية العصبية الخارجية.
    • الخيار F غير صحيح: خسارة الإنتروبيا المتقاطعة هي دالة خسارة قابلة للتمييز يتم استخدامها أثناء التدريب على النموذج، في حين أن BLEU هو مقياس غير قابل للتمييز يتم حسابه أثناء تقييم ما بعد التدريب.
السؤال 3: عدم تطابق استراتيجية الترميز أثناء المفردات أحداث خارج نطاق المفردات (OOV) أثناء نشر تطبيق تحليل المشاعر باستخدام نموذج مُدرب مسبقًا، يواجه النظام كلمات نادرة خاصة بالمجال ومصطلحات عامية مثل "un-machine-learnable". إذا كانت البنية الأساسية تستخدم تشفير زوج البايت (BPE) للترميز، فكيف يقوم النظام بمعالجة هذا التسلسل النصي دون تشغيل خطأ خارج المفردات (OOV)؟
  • أ) يستخدم رمزًا نائبًا لاستبدال تسلسل الكلمات بالكامل على الفور.
  • ب) يقوم بتحويل السلسلة الكاملة إلى أقرب رمز صوتي مكافئ لها باستخدام روتين فرعي Soundex.
  • ج) يقرأ ديناميكيًا تكوين الكلمة من قاموس معجم احتياطي خارجي مثل WordNet.
  • د) يقوم بشكل متكرر بتقسيم الكلمة المعقدة غير المعروفة إلى وحدات كلمات فرعية أصغر ومتكررة أو أحرف فردية موجودة في قاعدة المفردات الخاصة بها.
  • هـ) يتجاوز الكلمة تلقائيًا، ويعين لها تمثيل متجه محايد يتكون بالكامل من الأصفار.
  • و) يلقي استثناء وقت التشغيل الذي يجب اكتشافه عبر كتل محاولة الالتقاط الصريحة داخل PyTorch أو TensorFlow.
الإجابة الصحيحة والشرح:
  • الإجابة الصحيحة: D
  • لماذا هي صحيحة: تشفير زوج البايت (BPE) هو خوارزمية ترميز الكلمات الفرعية. يبدأ بمفردات أساسية من الشخصيات الفردية ويدمج بشكل متكرر الأزواج الأكثر شيوعًا. عندما يواجه كلمة غير مرئية، لا يفشل BPE؛ بدلاً من ذلك، يقوم بتقسيم الكلمة إلى أصغر أجزاء الكلمات الفرعية (مثل "un"، "##machine"، "##learn"، "##able") التي يعرفها بالفعل من مفردات التدريب الخاصة به، مع تجنب مشكلات OOV.
  • لماذا تكون الخيارات البديلة غير صحيحة:
    • الخيار أ غير صحيح: تعتمد الرموز المميزة التقليدية على مستوى الكلمة بشكل كبير على الرمز المميز للكلمات غير المعروفة. تتجنب أدوات ترميز الكلمات الفرعية مثل BPE وWordPiece وSentencePiece هذا الأسلوب بشكل واضح.
    • الخيار B غير صحيح: Soundex عبارة عن خوارزمية لفهرسة الأسماء حسب الصوت؛ ولا يتم استخدامه في المحولات الحديثة أو مسارات ترميز التعلم الآلي.
    • الخيار C غير صحيح: لا تستعلم أدوات الرموز المميزة عن قواعد البيانات الدلالية الخارجية مثل WordNet أثناء الاستدلال؛ يعتمدون بشكل صارم على مصفوفات المفردات الثابتة والمجمعة.
    • الخيار E غير صحيح: يؤدي تجاوز الرموز المميزة أو تصفيرها إلى تغيير أبعاد تسلسل المصفوفة وتدمير المنطق الدلالي الهيكلي السياقي.
    • الخيار F غير صحيح: تم إنشاء الرموز المميزة للكلمات الفرعية الحديثة خصيصًا لتجنب استثناءات OOV في وقت التشغيل، مما يضمن التنفيذ السلس بغض النظر عن اختلافات إدخال النص.
ما يمكن توقعه
  • مرحبًا بك في اختبارات أسئلة المقابلة لمساعدتك في الاستعداد لاختبار الممارسة الخاص بأسئلة المقابلة الخاصة بمعالجة اللغة الطبيعية.
  • يمكنك إعادة إجراء الاختبارات عدة مرات كما تريد
  • هذا بنك أسئلة أصلي ضخم
  • يمكنك الحصول على دعم من المدرسين إذا كانت لديك أسئلة
  • يحتوي كل سؤال على شرح تفصيلي
  • متوافق مع الهاتف المحمول مع تطبيق Udemy
نأمل أن تكون مقتنعًا الآن! وهناك الكثير من الأسئلة داخل الدورة.

ما هي المتطلبات الأساسية لدخول الدورة والتسجيل فيها على موقعنا؟ رحلة التعلم:

(احصل على الدورة للدخول إلى الموقع والتسجيل)

يجب أن يكون لديك بريد إلكتروني (حساب بريد) تتذكره لنفسك وأيضًا يجب أن تتذكر كلمة مرور البريد الإلكتروني الذي ستسجل به ، وإذا لم يكن لديك حساب بريد إلكتروني ، فمن الأفضل إنشاء حساب (Gmail)

اغلق مانع الاعلانات لتحصل على الدورة



0 تعليقات