Polars для дата-инженеров

Polars 1.42 для дата-инженеров: Series, DataFrame, expressions, LazyFrame, оптимизатор, streaming, Arrow, тестирование и production ETL/ELT.
Средний уровень
100-160 часов

Чему вы научитесь

  • уверенно работать с Series, DataFrame и системой выражений Polars
  • читать и записывать CSV, JSON и Parquet с явной схемой и корректными типами
  • строить join, aggregation, window и reshape-преобразования без циклов по строкам
  • применять LazyFrame, pushdown, streaming и анализ плана запроса
  • тестировать схемы и данные, измерять производительность и память
  • собирать надёжный production ETL/ELT-пайплайн с мониторингом

О курсе

Как стать Senior Data Engineer за 3 года и не сойти с ума?

Меня зовут Дима. Я Senior Data Engineer в Сбере. Мой путь включает шесть лет фундаментального образования на ПМИ в НИЯУ МИФИ, стажировку в «Гринатоме» и рост от начинающего инженера до работы с архитектурой высоконагруженных платформ данных.

Курс входит в образовательную линейку Telegram-канала «Логово Дата-Инженера». В канале выходят hard-skill материалы, live-собеседования, архитектурные разборы и практические карты роста от junior до senior.

О курсе

Polars для дата-инженеров — Практический курс по быстрой и предсказуемой обработке табличных данных на одном сервере. Вы освоите выражения Polars, ленивые планы и потоковое выполнение, а затем соберёте промышленный ETL-конвейер.

Технологическая база: Polars 1.42, Python 3.12+, PyArrow.

Кому подойдёт

  • дата-инженеры, обрабатывающие CSV, Parquet и большие табличные наборы в Python
  • pandas-разработчики, которым нужны скорость, строгие типы и lazy execution
  • аналитические инженеры, строящие локальные ETL/ELT-пайплайны
  • Python-разработчики, интегрирующие Arrow, DuckDB, базы данных и lakehouse

Чему вы научитесь

  • уверенно работать с Series, DataFrame и системой выражений Polars
  • читать и записывать CSV, JSON и Parquet с явной схемой и корректными типами
  • строить join, aggregation, window и reshape-преобразования без циклов по строкам
  • применять LazyFrame, pushdown, streaming и анализ плана запроса
  • тестировать схемы и данные, измерять производительность и память
  • собирать надёжный production ETL/ELT-пайплайн с мониторингом

Как построена программа

  1. Основа Polars: Series, DataFrame, expressions, фильтрация, типы и очистка.
  2. Преобразования: строки, даты, агрегации, окна, join и изменение формы.
  3. Lazy execution: LazyFrame, query optimizer, pushdown, streaming и данные больше RAM.
  4. Качество и интеграции: тесты, Arrow, базы данных, lakehouse и SQL.
  5. Итоговый ETL: слои raw/clean/curated, идемпотентность, метрики и оптимизация.

Формат обучения

В курсе 23 модуля и 156 уроков. Каждый урок содержит подробное объяснение, небольшие нарастающие примеры, проверку понимания и практические задачи. Решения практики доступны для разбора после самостоятельной попытки.

Всего внутри 752 тестовых вопросов и 479 практических задач. Ориентировочная нагрузка: 100-160 часов. Курс рассчитан на самостоятельный темп без обязательных дедлайнов.

Итоговый проект

End-to-end ETL интернет-магазина: чтение сырых файлов, явные схемы, очистка, join и агрегации, ленивый streaming-план, Parquet-витрины, тесты и мониторинг.

Что потребуется на старте

  • базовый Python: функции, коллекции, файлы и виртуальное окружение
  • Python 3.12+, Polars 1.42 и PyArrow; установка разобрана в курсе
  • знание pandas или SQL полезно, но не является обязательным

Как получить максимум пользы

  1. Запускайте примеры и меняйте входные данные, а не ограничивайтесь чтением.
  2. Сначала отвечайте на тест и решайте задачу самостоятельно, затем сверяйтесь с разбором.
  3. Ведите журнал ошибок, решений и технических компромиссов.
  4. Собирайте упражнения в отдельный репозиторий и регулярно возвращайтесь к старым задачам.
  5. Связывайте каждый инструмент с проблемой, которую он решает в реальной системе.

Результат прохождения

Вы сможете заменять хрупкие табличные скрипты воспроизводимыми Polars-пайплайнами, читать планы выполнения и подтверждать производительность измерениями.

Telegram: Логово Дата-Инженера

В Telegram-канале автора публикуются материалы по Rust, Java, Python, Go, SQL, pandas, Polars, Scala, Spark, Flink, Kafka, Hadoop, Airflow, DWH, Trino, ClickHouse, S3, файловым форматам, Docker/Kubernetes, разборы собеседований и архитектура Enterprise-проектов. Подписка поможет дополнять последовательную программу курса живыми кейсами из профессии.

Для кого этот курс

дата-инженеры, обрабатывающие CSV, Parquet и большие табличные наборы в Python; pandas-разработчики, которым нужны скорость, строгие типы и lazy execution; аналитические инженеры, строящие локальные ETL/ELT-пайплайны; Python-разработчики, интегрирующие Arrow, DuckDB, базы данных и lakehouse.

Начальные требования

базовый Python: функции, коллекции, файлы и виртуальное окружение Python 3.12+, Polars 1.42 и PyArrow; установка разобрана в курсе знание pandas или SQL полезно, но не является обязательным

Наши преподаватели

Как проходит обучение

Каждый урок проходится по циклу: понять идею, запустить и изменить пример, ответить на тест, самостоятельно решить практику и только затем свериться с разбором.

Материал выстроен последовательно, без обязательных дедлайнов. Рекомендуется вести учебный репозиторий и журнал ошибок.

Программа курса

загружаем...

Что вы получаете

  • полный текстовый конспект курса с рабочими примерами
  • 752 тестовых вопросов для самопроверки
  • 479 практических задач с решениями
  • итоговый проект: End-to-end ETL интернет-магазина: чтение сырых файлов, явные схемы, очистка, join и агрегации, ленивый streaming-план, Parquet-витрины, тесты и мониторинг.
Price: Бесплатно

Расскажите о курсе друзьям

Price: Бесплатно