تبدأ رحلتنا في استكشاف موقع مجاني شامل يضم كنوز وهي : دورات مجانية ومنح دراسية ووظائف وتدريب ومقالات مفيدة ودليل كامل لكل مجال خاص بالتكنولوجيا حصريا وبعض من المجالات الاخري لمتابعة كل جديد علي التليجرام والفيسبوك | Telegram | Facebook

500+ Data Engineering Interview Questions with Answers 2026

دورة متاحة لفترة محدودة
free-palestine free-palestine

Responsive image
منذ 6 ساعات

أهلا بك عزيزي المتابع لموقع (journey for learn) نقدم دورات بكوبونات متاحة لاول 1000 تسجيل مجاني فقط وكوبونات اخري لفترة محدودة فاذا كنت تريد ان تحصل علي كل الكورسات علي موقعنا وان تكون اول المسجلين في الكورسات المجانية قم بتسجيل الدخول أوقم بالدخول علي وسائل التواصل الاجتماعي وخصوصا التليجرام نوضح الوصف المختصر والطويل للدورات لكي تعرف الدروس التي سوف تتعلمها بسهولة ويسر :

تغطية تفصيلية لمجال الاختبار تم تصميم مستودع الاختبار التدريبي هذا بدقة ليعكس التوزيعات الفنية الواقعية المتوقعة في المقابلات الفنية على مستوى المؤسسة لهندسة البيانات وهندسة البيانات.
  • تصميم خطوط البيانات (20%): الاستراتيجيات الأساسية لاستيعاب البيانات، وإدارة تدفق البيانات في الوقت الفعلي، والهندسة المعمارية لقابلية التوسع، ومعالجة البيانات عالية الإنتاجية، وإعدادات تخزين البيانات الدائمة.
  • نمذجة البيانات (15%): تصميم مستودع البيانات التقليدي والحديث بما في ذلك Star المخططات، ومخططات Snowflake، وتحديد جداول الحقائق الدقيقة، وتنظيم جداول الأبعاد، والحفاظ على سلسلة البيانات الكاملة.
  • إدارة جودة البيانات (10%): تصميم أطر قوية للتحقق من البيانات، وحلقات معالجة الأخطاء الآلية، وسير عمل تنظيف البيانات، والكشف المتقدم عن القيم الخارجية، وإزالة التكرارات عالية الأداء.
  • تخزين البيانات وتنسيقات الملفات (12%): الغوص العميق في التخزين العمودي مثل Parquet، الهياكل الموجهة نحو الصفوف مثل Avro، ومعالجة الملفات المسطحة (CSV)، واستراتيجيات تخزين الكائنات، وتحسين تخزين الكتل.
  • الأنظمة السحابية والموزعة (18%): بنية البيانات الأساسية عبر الأنظمة البيئية السحابية للمؤسسات (AWS، وGCP، وAzure) وأطر الحوسبة الموزعة مثل Hadoop وApache Spark.
  • SQL وإدارة قواعد البيانات (10%): استعلامات SQL التحليلية المعقدة، وقواعد تصميم قواعد البيانات الأساسية، ومفاهيم تخزين البيانات الحديثة، وETL على مستوى الإنتاج خطوط الأنابيب، وأطر إدارة البيانات الهيكلية.
  • حل المشكلات والاتصالات (5%): التعامل مع الأسئلة السلوكية الهامة، وتصميم نظام السبورة البيضاء، وإنشاء بنية بيانات قابلة للتطوير، واتصالات فنية واضحة، وتعاون جماعي متعدد الوظائف.
  • أدوات وتقنيات هندسة البيانات (10%): منطق تشغيلي عملي للمنسقين وطبقات الحوسبة مثل Airflow وdbt وSnowflake وDatabricks، وApache Kafka.
حول الدورة التدريبية يتطلب إجراء مقابلة فنية حديثة لهندسة البيانات أو مهندس البيانات أكثر بكثير من مجرد كتابة استعلام SQL أساسي أو معرفة كيفية تشغيل وظيفة Spark. تبحث شركات التكنولوجيا رفيعة المستوى والمؤسسات المالية والمؤسسات سريعة التوسع عن محترفين يمكنهم إنشاء بيئات بيانات مرنة وفعالة من حيث التكلفة وموزعة بشكل كبير. لقد صممت بنك الأسئلة الشامل هذا ليكون بمثابة مخطط الإعداد النهائي الخاص بك، مما يسد الفجوة بين المعرفة الأساسية بإطار العمل والمقايضات المعمارية المعقدة الفعلية التي سيُطلب منك إجراؤها أثناء السبورة البيضاء والجولات الفنية العميقة. مع 550 سؤال تدريبي مفصل للغاية ومبتكر تمامًا، يتحرك هذا المورد إلى ما هو أبعد من الأسئلة السطحية. أركز بشكل كبير على المشكلات الفعلية القائمة على السيناريوهات، وتحديات تدهور النظام، ومعضلات نمذجة البيانات الهيكلية، وفشل خطوط الأنابيب. يأتي كل سؤال مدعومًا بتحليل فني شامل يشرح بالضبط سبب نجاح الخيار الصحيح ولماذا تفشل الاختلافات البديلة في بيئة نطاق الإنتاج. سواء كنت تسعى للحصول على منصب كبير مهندسي البيانات، أو تستعد لترقية داخلية، أو صقل معرفتك بالأنظمة الموزعة، فإن هذا المورد يوفر الممارسة الصارمة اللازمة لمسح جولات المقابلة الفنية الخاصة بك بثقة في محاولتك الأولى. معاينة أسئلة الممارسة النموذجية لفهم عمق وأسلوب الشروحات المقدمة داخل بنك الأسئلة هذا، قم بمراجعة نماذج الأسئلة الثلاثة عالية الدقة هذه. السؤال 1: فشل تطور المخطط في خطوط تدفق البيانات الموزعة يقوم مهندس البيانات بإعداد تحليل في الوقت الفعلي خط أنابيب تدفق البيانات حيث يتلقى موضوع Apache Kafka بيانات الحدث المتسلسلة باستخدام Apache Avro. تقوم خدمة المستهلك النهائية بقراءة هذه الأحداث وكتابتها في مخزن الكائنات كملفات Apache Parquet. عندما يضيف فريق المنبع حقلاً اختياريًا جديدًا بقيمة افتراضية إلى مخطط Avro، تبدأ خدمة المستهلك على الفور في التعطل بسبب عدم تطابق التسلسل. ما هو السبب الجذري لفشل مسار التشغيل هذا؟
  • أ) لا يدعم كافكا تغييرات المخطط الهيكلي للموضوعات التي تستخدم تنسيقات التسلسل الثنائي Avro.
  • ب) يقوم تطبيق المستهلك النهائي بتشغيل إصدار مخطط أقدم دون الوصول إلى سجل مخطط مترابط مركزي لحل قواعد تعيين الحقول الجديدة.
  • ج) لا يسمح تنسيق تخزين ملفات Parquet بإلحاق الأعمدة ديناميكيًا بمجرد إضافة قسم الملف تمت تهيئته.
  • د) ارتكب التطبيق الرئيسي تغيير المخطط باستخدام وضع التوافق الأمامي بدلاً من وضع التوافق الكامل الصارم.
  • هـ) يستخدم تطبيق المستهلك مساحة ذاكرة مؤقتة صغيرة جدًا للتنفيذ للاحتفاظ بحمولة البيانات الإضافية الناتجة عن متغيرات الأعمدة المضافة.
  • و) يفتقر نظام التخزين الأساسي إلى أذونات ملف POSIX الصحيحة اللازمة لكتابة أعمدة البيانات المعدلة إلى القرص.
إجابة صحيحة & Explanation:
  • الإجابة الصحيحة: B
  • لماذا هي صحيحة: في بنيات البث الموزعة التي تستخدم Avro، يتم فصل المخططات عن الحمولة لتقليل حجم الرسالة. عندما يتطور المخطط، يحتاج المستهلكون إلى طريقة للبحث عن نسخة مخطط الكاتب لتعيينها بشكل صحيح مقابل مخطط القارئ الخاص بهم. بدون تكوين سجل المخطط المركزي، لا يمكن للمستهلك جلب البيانات التعريفية الجديدة المطلوبة لقراءة الحمولة، مما يتسبب في تعطل التسلسل على الرغم من أن الحقل يحتوي على قيمة افتراضية.
  • لماذا الخيارات البديلة غير صحيحة:
    • الخيار أ غير صحيح: كافكا لا يعرف تمامًا هياكل بيانات الحمولة؛ فهو يتعامل مع كافة الرسائل الواردة كمصفوفات بايت أولية.
    • الخيار C غير صحيح: يتعامل Parquet مع إضافات المخطط الاختيارية بشكل نظيف نظرًا لأن بيانات التعريف الداخلية الخاصة به تقوم بتعيين الأعمدة حسب الاسم أو الفهرس على مستوى التذييل.
    • الخيار D غير صحيح: إضافة حقل اختياري بقيمة افتراضية هي خطوة تطور صالحة للأمام والخلف؛ الخطأ هو مشكلة حل، وليس انتهاك التوافق.
    • الخيار E غير صحيح: يضيف حقل عمود اختياري واحد مضاف أحجام بايت ضئيلة لا تؤدي إلى تعطل الذاكرة أو المخزن المؤقت.
    • الخيار F غير صحيح: قد تؤدي مشكلات الأذونات إلى رفض الكتابة القياسية لنظام التشغيل (تم رفض الوصول)، وليس تسلسل محدد أو عدم تطابق فك التشفير.
السؤال 2: إدارة الذاكرة الموزعة و تبديل العمليات في Apache Spark أثناء تنفيذ مهمة تحويل بيانات Apache Spark واسعة النطاق والتي تتضمن عملية .groupByKey() عبر مجموعة بيانات سعة 500 جيجابايت، ينخفض أداء المجموعة بشكل ملحوظ، وتتعطل العديد من العقد العاملة بسبب java.lang.OutOfMemoryError: غير قادر على الحصول على رسالة بايتات الذاكرة. ما هي استراتيجية التحسين الهيكلي التي تحل هذا الفشل مباشرة؟
  • أ) قم بزيادة إجمالي عدد الأقسام بشكل ملحوظ عن طريق تشغيل أمر .repartition() الصريح على كتلة إطار البيانات الأولية.
  • ب) استبدل عملية .groupByKey() بطريقة .reduceByKey() أو .aggregateByKey() للاستفادة من مجموعات جانب الخريطة قبل خلط البيانات عبر الشبكة.
  • ج) اضبط معلمات بيئة Spark لتعيينها spark.executor.memoryOverhead إلى قيمة نسبة مئوية أقل لتحرير مساحة تنفيذ JVM.
  • د) قم بتحويل جداول بيانات المصدر الأساسية من تنسيق Parquet المُحسّن إلى ملفات CSV مسطحة غير مضغوطة قبل تحميلها في الذاكرة.
  • هـ) قم بتبديل محرك وقت تشغيل مجموعة Spark ليعمل بشكل صارم على عقدة برنامج تشغيل ضخمة واحدة لتجنب الحمل الزائد لاتصالات الشبكة.
  • و) قم بتغيير متغيرات حالة الانضمام إلى متغيرات بث واسعة النطاق لتجاوز خطوات توازن القسم تمامًا.
الإجابة الصحيحة والشرح:
  • الإجابة الصحيحة: ب
  • لماذا هي صحيحة: عملية .groupByKey() تجبر Spark على نقل جميع السجلات المطابقة لمفتاح معين عبر الشبكة أثناء التبديل العشوائي، وتحميل جميع القيم لهذا المفتاح في ذاكرة المنفذ لقسم واحد في وقت واحد. إذا كان مفتاح واحد يحتوي على كمية هائلة من البيانات (انحراف البيانات)، فإنه يكسر حدود الذاكرة بسهولة. يؤدي استخدام .reduceByKey() إلى دمج البيانات محليًا على عقدة مخطط الخرائط قبل حدوث التبديل العشوائي للشبكة، مما يقلل بشكل كبير من حجم البيانات المرسلة عبر الشبكة ويحمي ذاكرة المنفذ.
  • لماذا تكون الخيارات البديلة غير صحيحة:
    • الخيار أ غير صحيح: تساعد زيادة الأقسام على تقسيم البيانات إلى أجزاء أصغر، ولكن إذا كان المفتاح الواحد يحتوي على مجموعة بيانات منحرفة ضخمة، فسينتهي الأمر على عقدة عاملة واحدة، ويفشل على أي حال.
    • الخيار ج هو غير صحيح: خفض حمل الذاكرة يجعل المجموعة أكثر عرضة لتعطل ذاكرة الحاوية خارج الكومة في ظل أعباء العمل الثقيلة.
    • الخيار D غير صحيح: تتطلب بنيات CSV غير المضغوطة مساحة ذاكرة أكبر من تنسيقات Parquet المضغوطة العمودية، مما يؤدي إلى تفاقم المشكلة.
    • الخيار E غير صحيح: يؤدي تقييد مهمة معالجة بسعة 500 جيجابايت إلى عقدة برنامج تشغيل واحدة إلى إلغاء مزايا الحوسبة الموزعة ويتعطل المثيل الرئيسي على الفور.
    • الخيار F غير صحيح: عمليات البث تم تصميمه لتحسين عمليات ربط الجداول غير المتطابقة، وليس لحل مشكلات التجميع الناتجة عن عمليات التجميع الداخلية.
السؤال 3: تحسين تخزين البيانات وتقليص الأقسام في Snowflake لاحظ مهندس البيانات أن استعلام لوحة معلومات تحليلية لذكاء الأعمال يستهدف جدول معاملات تاريخية ضخم في Snowflake، ولكن يستغرق تنفيذه أكثر من خمس دقائق. يقوم الاستعلام بتصفية البيانات بشكل صارم استنادًا إلى عمود TRANSACTION_TIMESTAMP من الأيام السبعة الماضية. ما هي الطريقة الأكثر فعالية لتحسين أداء الاستعلام هذا دون تغيير حجم مجموعة الأجهزة الأساسية فعليًا؟
  • أ) أعد فرز جدول المعاملات التاريخية فعليًا عن طريق إنشاء مفتاح مجموعة يركز على عمود TRANSACTION_TIMESTAMP لتمكين تقليم الأقسام الدقيقة بشكل فعال.
  • ب) قم بتحويل بنية الجدول الحالي إلى نموذج مخطط نجمي متعدد الطبقات باستخدام تخطيطات حقيقة وأبعاد مميزة لكل متغير طابع زمني فردي.
  • ج) فرض محرك تنفيذ الاستعلام على تجاوز نظام التخزين المؤقت العام عن طريق إضافة تلميح تحكم صريح إلى الجزء العلوي من كتلة عبارة SQL.
  • د) قم بإسقاط جميع القيود العلائقية للمفتاح الأساسي والمفتاح الخارجي على جدول Snowflake للتخلص من عبء التحقق من القيود.
  • هـ) أعد كتابة استعلام معالجة المعاملة بالكامل للاستفادة من استعلامات فرعية متداخلة متعددة بدلاً من تشغيل وصلات مرشح SQL التعريفية القياسية.
  • و) انقل قاعدة بيانات المعاملات من طبقات تخزين الكائنات القياسية إلى تخزين الكتل المؤسسي المترجم الإعدادات.
الإجابة الصحيحة والشرح:
  • الإجابة الصحيحة: أ
  • لماذا هي صحيحة: يدير Snowflake تخطيط البيانات تلقائيًا باستخدام الأقسام الدقيقة. إذا تم تحميل جدول كبير بشكل عشوائي، فسيتم توزيع قيم TRANSACTION_TIMESTAMP عبر آلاف الأقسام الصغيرة المنفصلة. من خلال تحديد مفتاح التجميع بشكل صريح في عمود الطابع الزمني هذا، يقوم Snowflake بإعادة تنظيم صفوف البيانات بشكل تسلسلي. يسمح هذا لمحرك الاستعلام بتجاهل الأقسام غير ذات الصلة تمامًا (تقليم الأقسام)، ومسح المجموعة الفرعية الصغيرة التي تحتوي على بيانات الأيام السبعة الماضية فقط، مما يؤدي إلى تسريع الاستعلام بشكل كبير.
  • لماذا تكون الخيارات البديلة غير صحيحة:
    • الخيار B غير صحيح: إعادة تصميم مستودع البيانات إلى مخطط نجمي منفصل تمامًا يستغرق وقتًا هندسيًا مكثفًا ولا يحل مشكلة الأداء إذا ظلت البيانات الأساسية غير مجمعة.
    • الخيار C غير صحيح: تجاوز تؤدي ذاكرة التخزين المؤقت للبيانات التعريفية إلى إبطاء الاستعلامات نظرًا لأن المحرك يضطر إلى إعادة جلب البيانات الأولية من مخزن الكائنات بدلاً من تقديم نتائج سريعة مخزنة مؤقتًا.
    • الخيار D غير صحيح: لا يفرض Snowflake قيودًا على المفاتيح الأساسية أو الخارجية أثناء استيعاب البيانات، لذا فإن إسقاطها لا يوفر أي فوائد لأداء التنفيذ.
    • الخيار E غير صحيح: يؤدي استبدال عوامل التصفية التعريفية القياسية باستعلامات فرعية متداخلة معقدة إلى زيادة تعقيد التحليل ويؤدي عادةً إلى خطط تنفيذ استعلام أسوأ.
    • الخيار F غير صحيح: تعمل Snowflake كخدمة مُدارة على البنية التحتية السحابية حيث يتم التحكم في طبقة التخزين داخليًا؛ لا يمكن للمستخدمين إعادة تعيين محركات الأقراص المادية الأساسية يدويًا.
ما يمكن توقعه
  • مرحبًا بك في اختبارات أسئلة المقابلة لمساعدتك في الاستعداد لاختبار الممارسة الخاص بأسئلة مقابلة هندسة البيانات.
  • يمكنك إعادة إجراء الاختبارات عدة مرات كما تريد
  • هذا بنك أسئلة أصلي ضخم
  • يمكنك الحصول على الدعم من المدرسين إذا كانت لديك أسئلة
  • يحتوي كل سؤال على تفاصيل الشرح
  • متوافق مع الجوال مع تطبيق Udemy
نأمل أن تكون مقتنعًا الآن! وهناك الكثير من الأسئلة داخل الدورة.

ما هي المتطلبات الأساسية لدخول الدورة والتسجيل فيها على موقعنا؟ رحلة التعلم:

(احصل على الدورة للدخول إلى الموقع والتسجيل)

يجب أن يكون لديك بريد إلكتروني (حساب بريد) تتذكره لنفسك وأيضًا يجب أن تتذكر كلمة مرور البريد الإلكتروني الذي ستسجل به ، وإذا لم يكن لديك حساب بريد إلكتروني ، فمن الأفضل إنشاء حساب (Gmail)

اغلق مانع الاعلانات لتحصل على الدورة



0 تعليقات