Почему DataStore работает быстрее
1. SQL Pushdown
2. Отсечение столбцов
3. Отложенное вычисление
Бенчмарк: DataStore vs pandas
Тестовое окружение
- Данные: 10 миллионов строк
- Оборудование: стандартный ноутбук
- Формат файла: CSV
Результаты
Ключевые выводы
- Операции GroupBy: DataStore до 19,93x быстрее
- Сложные конвейеры: DataStore в 5–6 раз быстрее (за счёт SQL pushdown)
- Простые операции среза: производительность сопоставима — разница незначительна
- Лучший сценарий использования: многошаговые операции с группировкой и агрегацией
- Zero-copy:
to_df()не создаёт накладных расходов на преобразование данных
Когда DataStore — лучший выбор
Тяжелые агрегации
Сложные конвейеры
Обработка больших файлов
Операции над несколькими столбцами
Когда pandas показывает сопоставимую производительность
Небольшие наборы данных (<1,000 строк)
Простые операции со срезами
Пользовательские лямбда-функции Python
ВажноДаже в случаях, когда DataStore работает «медленнее», производительность обычно сопоставима с pandas — на практике разница несущественна. Преимущества DataStore при выполнении сложных операций значительно перевешивают эти редкие исключения.Для более точного управления выполнением см. конфигурацию движка выполнения.
Интеграция DataFrame без копирования данных
to_df()практически ничего не стоит — без сериализации и копирования в памяти- DataStore создается из pandas DataFrame мгновенно
- DataStore и представления pandas используют общую память