لماذا يُعد DataStore أسرع
1. SQL Pushdown
2. استبعاد الأعمدة غير اللازمة
3. التنفيذ الكسول
قياس الأداء: DataStore مقابل pandas
بيئة الاختبار
- البيانات: 10 ملايين صف
- الجهاز: حاسوب محمول عادي
- صيغة الملف: CSV
النتائج
أبرز الاستنتاجات
- عمليات GroupBy: DataStore أسرع بما يصل إلى 19.93x
- مسارات المعالجة المعقدة: DataStore أسرع بمقدار 5-6x (بفضل SQL pushdown)
- عمليات التقطيع البسيطة: الأداء متقارب - والفرق لا يُذكر
- أفضل حالة استخدام: العمليات متعددة الخطوات مع groupby/التجميع
- النسخ الصفري: لا يضيف
to_df()أي عبء إضافي لتحويل البيانات
متى يكون DataStore الخيار الأفضل
عمليات التجميع الثقيلة
مسارات معالجة معقّدة
معالجة الملفات الكبيرة
عمليات على أعمدة متعددة
متى يكون pandas منافسًا
مجموعات البيانات الصغيرة (<1,000 صفوف)
عمليات التقطيع البسيطة
دوال Lambda مخصّصة في Python
مهمحتى في الحالات التي يكون فيها DataStore “أبطأ”، يكون الأداء عادةً مماثلًا لأداء pandas - والفارق لا يُذكر عمليًا. كما أن مزايا DataStore في العمليات المعقدة تفوق هذه الحالات المحدودة بدرجة كبيرة.للتحكم الدقيق في التنفيذ، راجع إعدادات محرك التنفيذ.
تكامل DataFrame بتقنية النسخ الصفري
to_df()مجاني عمليًا — من دونserializationأو نسخ للذاكرة- إنشاء DataStore من pandas DataFrame يتم فورًا
- الذاكرة مشتركة بين DataStore وعروض pandas