منذ 6 ساعات
أهلا بك عزيزي المتابع لموقع (journey for learn) نقدم دورات بكوبونات متاحة لاول 1000 تسجيل مجاني فقط وكوبونات اخري لفترة محدودة فاذا كنت تريد ان تحصل علي كل الكورسات علي موقعنا وان تكون اول المسجلين في الكورسات المجانية قم بتسجيل الدخول أوقم بالدخول علي وسائل التواصل الاجتماعي وخصوصا التليجرام نوضح الوصف المختصر والطويل للدورات لكي تعرف الدروس التي سوف تتعلمها بسهولة ويسر :
تغطية تفصيلية لمجال الاختبار تم تصميم مستودع الاختبار التدريبي هذا بدقة ليعكس التوزيعات الفنية الواقعية المتوقعة في المقابلات الفنية على مستوى المؤسسة لهندسة البيانات وهندسة البيانات.- تصميم خطوط البيانات (20%): الاستراتيجيات الأساسية لاستيعاب البيانات، وإدارة تدفق البيانات في الوقت الفعلي، والهندسة المعمارية لقابلية التوسع، ومعالجة البيانات عالية الإنتاجية، وإعدادات تخزين البيانات الدائمة.
- نمذجة البيانات (15%): تصميم مستودع البيانات التقليدي والحديث بما في ذلك Star المخططات، ومخططات Snowflake، وتحديد جداول الحقائق الدقيقة، وتنظيم جداول الأبعاد، والحفاظ على سلسلة البيانات الكاملة.
- إدارة جودة البيانات (10%): تصميم أطر قوية للتحقق من البيانات، وحلقات معالجة الأخطاء الآلية، وسير عمل تنظيف البيانات، والكشف المتقدم عن القيم الخارجية، وإزالة التكرارات عالية الأداء.
- تخزين البيانات وتنسيقات الملفات (12%): الغوص العميق في التخزين العمودي مثل Parquet، الهياكل الموجهة نحو الصفوف مثل Avro، ومعالجة الملفات المسطحة (CSV)، واستراتيجيات تخزين الكائنات، وتحسين تخزين الكتل.
- الأنظمة السحابية والموزعة (18%): بنية البيانات الأساسية عبر الأنظمة البيئية السحابية للمؤسسات (AWS، وGCP، وAzure) وأطر الحوسبة الموزعة مثل Hadoop وApache Spark.
- SQL وإدارة قواعد البيانات (10%): استعلامات SQL التحليلية المعقدة، وقواعد تصميم قواعد البيانات الأساسية، ومفاهيم تخزين البيانات الحديثة، وETL على مستوى الإنتاج خطوط الأنابيب، وأطر إدارة البيانات الهيكلية.
- حل المشكلات والاتصالات (5%): التعامل مع الأسئلة السلوكية الهامة، وتصميم نظام السبورة البيضاء، وإنشاء بنية بيانات قابلة للتطوير، واتصالات فنية واضحة، وتعاون جماعي متعدد الوظائف.
- أدوات وتقنيات هندسة البيانات (10%): منطق تشغيلي عملي للمنسقين وطبقات الحوسبة مثل Airflow وdbt وSnowflake وDatabricks، وApache Kafka.
- أ) لا يدعم كافكا تغييرات المخطط الهيكلي للموضوعات التي تستخدم تنسيقات التسلسل الثنائي Avro.
- ب) يقوم تطبيق المستهلك النهائي بتشغيل إصدار مخطط أقدم دون الوصول إلى سجل مخطط مترابط مركزي لحل قواعد تعيين الحقول الجديدة.
- ج) لا يسمح تنسيق تخزين ملفات Parquet بإلحاق الأعمدة ديناميكيًا بمجرد إضافة قسم الملف تمت تهيئته.
- د) ارتكب التطبيق الرئيسي تغيير المخطط باستخدام وضع التوافق الأمامي بدلاً من وضع التوافق الكامل الصارم.
- هـ) يستخدم تطبيق المستهلك مساحة ذاكرة مؤقتة صغيرة جدًا للتنفيذ للاحتفاظ بحمولة البيانات الإضافية الناتجة عن متغيرات الأعمدة المضافة.
- و) يفتقر نظام التخزين الأساسي إلى أذونات ملف POSIX الصحيحة اللازمة لكتابة أعمدة البيانات المعدلة إلى القرص.
- الإجابة الصحيحة: B
- لماذا هي صحيحة: في بنيات البث الموزعة التي تستخدم Avro، يتم فصل المخططات عن الحمولة لتقليل حجم الرسالة. عندما يتطور المخطط، يحتاج المستهلكون إلى طريقة للبحث عن نسخة مخطط الكاتب لتعيينها بشكل صحيح مقابل مخطط القارئ الخاص بهم. بدون تكوين سجل المخطط المركزي، لا يمكن للمستهلك جلب البيانات التعريفية الجديدة المطلوبة لقراءة الحمولة، مما يتسبب في تعطل التسلسل على الرغم من أن الحقل يحتوي على قيمة افتراضية.
- لماذا الخيارات البديلة غير صحيحة:
- الخيار أ غير صحيح: كافكا لا يعرف تمامًا هياكل بيانات الحمولة؛ فهو يتعامل مع كافة الرسائل الواردة كمصفوفات بايت أولية.
- الخيار C غير صحيح: يتعامل Parquet مع إضافات المخطط الاختيارية بشكل نظيف نظرًا لأن بيانات التعريف الداخلية الخاصة به تقوم بتعيين الأعمدة حسب الاسم أو الفهرس على مستوى التذييل.
- الخيار D غير صحيح: إضافة حقل اختياري بقيمة افتراضية هي خطوة تطور صالحة للأمام والخلف؛ الخطأ هو مشكلة حل، وليس انتهاك التوافق.
- الخيار E غير صحيح: يضيف حقل عمود اختياري واحد مضاف أحجام بايت ضئيلة لا تؤدي إلى تعطل الذاكرة أو المخزن المؤقت.
- الخيار F غير صحيح: قد تؤدي مشكلات الأذونات إلى رفض الكتابة القياسية لنظام التشغيل (تم رفض الوصول)، وليس تسلسل محدد أو عدم تطابق فك التشفير.
- أ) قم بزيادة إجمالي عدد الأقسام بشكل ملحوظ عن طريق تشغيل أمر .repartition() الصريح على كتلة إطار البيانات الأولية.
- ب) استبدل عملية .groupByKey() بطريقة .reduceByKey() أو .aggregateByKey() للاستفادة من مجموعات جانب الخريطة قبل خلط البيانات عبر الشبكة.
- ج) اضبط معلمات بيئة Spark لتعيينها spark.executor.memoryOverhead إلى قيمة نسبة مئوية أقل لتحرير مساحة تنفيذ JVM.
- د) قم بتحويل جداول بيانات المصدر الأساسية من تنسيق Parquet المُحسّن إلى ملفات CSV مسطحة غير مضغوطة قبل تحميلها في الذاكرة.
- هـ) قم بتبديل محرك وقت تشغيل مجموعة Spark ليعمل بشكل صارم على عقدة برنامج تشغيل ضخمة واحدة لتجنب الحمل الزائد لاتصالات الشبكة.
- و) قم بتغيير متغيرات حالة الانضمام إلى متغيرات بث واسعة النطاق لتجاوز خطوات توازن القسم تمامًا.
- الإجابة الصحيحة: ب
- لماذا هي صحيحة: عملية .groupByKey() تجبر Spark على نقل جميع السجلات المطابقة لمفتاح معين عبر الشبكة أثناء التبديل العشوائي، وتحميل جميع القيم لهذا المفتاح في ذاكرة المنفذ لقسم واحد في وقت واحد. إذا كان مفتاح واحد يحتوي على كمية هائلة من البيانات (انحراف البيانات)، فإنه يكسر حدود الذاكرة بسهولة. يؤدي استخدام .reduceByKey() إلى دمج البيانات محليًا على عقدة مخطط الخرائط قبل حدوث التبديل العشوائي للشبكة، مما يقلل بشكل كبير من حجم البيانات المرسلة عبر الشبكة ويحمي ذاكرة المنفذ.
- لماذا تكون الخيارات البديلة غير صحيحة:
- الخيار أ غير صحيح: تساعد زيادة الأقسام على تقسيم البيانات إلى أجزاء أصغر، ولكن إذا كان المفتاح الواحد يحتوي على مجموعة بيانات منحرفة ضخمة، فسينتهي الأمر على عقدة عاملة واحدة، ويفشل على أي حال.
- الخيار ج هو غير صحيح: خفض حمل الذاكرة يجعل المجموعة أكثر عرضة لتعطل ذاكرة الحاوية خارج الكومة في ظل أعباء العمل الثقيلة.
- الخيار D غير صحيح: تتطلب بنيات CSV غير المضغوطة مساحة ذاكرة أكبر من تنسيقات Parquet المضغوطة العمودية، مما يؤدي إلى تفاقم المشكلة.
- الخيار E غير صحيح: يؤدي تقييد مهمة معالجة بسعة 500 جيجابايت إلى عقدة برنامج تشغيل واحدة إلى إلغاء مزايا الحوسبة الموزعة ويتعطل المثيل الرئيسي على الفور.
- الخيار F غير صحيح: عمليات البث تم تصميمه لتحسين عمليات ربط الجداول غير المتطابقة، وليس لحل مشكلات التجميع الناتجة عن عمليات التجميع الداخلية.
- أ) أعد فرز جدول المعاملات التاريخية فعليًا عن طريق إنشاء مفتاح مجموعة يركز على عمود TRANSACTION_TIMESTAMP لتمكين تقليم الأقسام الدقيقة بشكل فعال.
- ب) قم بتحويل بنية الجدول الحالي إلى نموذج مخطط نجمي متعدد الطبقات باستخدام تخطيطات حقيقة وأبعاد مميزة لكل متغير طابع زمني فردي.
- ج) فرض محرك تنفيذ الاستعلام على تجاوز نظام التخزين المؤقت العام عن طريق إضافة تلميح تحكم صريح إلى الجزء العلوي من كتلة عبارة SQL.
- د) قم بإسقاط جميع القيود العلائقية للمفتاح الأساسي والمفتاح الخارجي على جدول Snowflake للتخلص من عبء التحقق من القيود.
- هـ) أعد كتابة استعلام معالجة المعاملة بالكامل للاستفادة من استعلامات فرعية متداخلة متعددة بدلاً من تشغيل وصلات مرشح SQL التعريفية القياسية.
- و) انقل قاعدة بيانات المعاملات من طبقات تخزين الكائنات القياسية إلى تخزين الكتل المؤسسي المترجم الإعدادات.
- الإجابة الصحيحة: أ
- لماذا هي صحيحة: يدير Snowflake تخطيط البيانات تلقائيًا باستخدام الأقسام الدقيقة. إذا تم تحميل جدول كبير بشكل عشوائي، فسيتم توزيع قيم TRANSACTION_TIMESTAMP عبر آلاف الأقسام الصغيرة المنفصلة. من خلال تحديد مفتاح التجميع بشكل صريح في عمود الطابع الزمني هذا، يقوم Snowflake بإعادة تنظيم صفوف البيانات بشكل تسلسلي. يسمح هذا لمحرك الاستعلام بتجاهل الأقسام غير ذات الصلة تمامًا (تقليم الأقسام)، ومسح المجموعة الفرعية الصغيرة التي تحتوي على بيانات الأيام السبعة الماضية فقط، مما يؤدي إلى تسريع الاستعلام بشكل كبير.
- لماذا تكون الخيارات البديلة غير صحيحة:
- الخيار B غير صحيح: إعادة تصميم مستودع البيانات إلى مخطط نجمي منفصل تمامًا يستغرق وقتًا هندسيًا مكثفًا ولا يحل مشكلة الأداء إذا ظلت البيانات الأساسية غير مجمعة.
- الخيار C غير صحيح: تجاوز تؤدي ذاكرة التخزين المؤقت للبيانات التعريفية إلى إبطاء الاستعلامات نظرًا لأن المحرك يضطر إلى إعادة جلب البيانات الأولية من مخزن الكائنات بدلاً من تقديم نتائج سريعة مخزنة مؤقتًا.
- الخيار D غير صحيح: لا يفرض Snowflake قيودًا على المفاتيح الأساسية أو الخارجية أثناء استيعاب البيانات، لذا فإن إسقاطها لا يوفر أي فوائد لأداء التنفيذ.
- الخيار E غير صحيح: يؤدي استبدال عوامل التصفية التعريفية القياسية باستعلامات فرعية متداخلة معقدة إلى زيادة تعقيد التحليل ويؤدي عادةً إلى خطط تنفيذ استعلام أسوأ.
- الخيار F غير صحيح: تعمل Snowflake كخدمة مُدارة على البنية التحتية السحابية حيث يتم التحكم في طبقة التخزين داخليًا؛ لا يمكن للمستخدمين إعادة تعيين محركات الأقراص المادية الأساسية يدويًا.
- مرحبًا بك في اختبارات أسئلة المقابلة لمساعدتك في الاستعداد لاختبار الممارسة الخاص بأسئلة مقابلة هندسة البيانات.
- يمكنك إعادة إجراء الاختبارات عدة مرات كما تريد
- هذا بنك أسئلة أصلي ضخم
- يمكنك الحصول على الدعم من المدرسين إذا كانت لديك أسئلة
- يحتوي كل سؤال على تفاصيل الشرح
- متوافق مع الجوال مع تطبيق Udemy
ما هي المتطلبات الأساسية لدخول الدورة والتسجيل فيها على موقعنا؟ رحلة التعلم:
(احصل على الدورة للدخول إلى الموقع والتسجيل)
يجب أن يكون لديك بريد إلكتروني (حساب بريد) تتذكره لنفسك وأيضًا يجب أن تتذكر كلمة مرور البريد الإلكتروني الذي ستسجل به ، وإذا لم يكن لديك حساب بريد إلكتروني ، فمن الأفضل إنشاء حساب (Gmail)
0 تعليقات
تسجيل دخول
دورات مشابهة