Чему вы научитесь
- уверенно работать с Series, DataFrame и системой выражений Polars
- читать и записывать CSV, JSON и Parquet с явной схемой и корректными типами
- строить join, aggregation, window и reshape-преобразования без циклов по строкам
- применять LazyFrame, pushdown, streaming и анализ плана запроса
- тестировать схемы и данные, измерять производительность и память
- собирать надёжный production ETL/ELT-пайплайн с мониторингом
О курсе
Как стать Senior Data Engineer за 3 года и не сойти с ума?
Меня зовут Дима. Я Senior Data Engineer в Сбере. Мой путь включает шесть лет фундаментального образования на ПМИ в НИЯУ МИФИ, стажировку в «Гринатоме» и рост от начинающего инженера до работы с архитектурой высоконагруженных платформ данных.
Курс входит в образовательную линейку Telegram-канала «Логово Дата-Инженера». В канале выходят hard-skill материалы, live-собеседования, архитектурные разборы и практические карты роста от junior до senior.
О курсе
Polars для дата-инженеров — Практический курс по быстрой и предсказуемой обработке табличных данных на одном сервере. Вы освоите выражения Polars, ленивые планы и потоковое выполнение, а затем соберёте промышленный ETL-конвейер.
Технологическая база: Polars 1.42, Python 3.12+, PyArrow.
Кому подойдёт
- дата-инженеры, обрабатывающие CSV, Parquet и большие табличные наборы в Python
- pandas-разработчики, которым нужны скорость, строгие типы и lazy execution
- аналитические инженеры, строящие локальные ETL/ELT-пайплайны
- Python-разработчики, интегрирующие Arrow, DuckDB, базы данных и lakehouse
Чему вы научитесь
- уверенно работать с Series, DataFrame и системой выражений Polars
- читать и записывать CSV, JSON и Parquet с явной схемой и корректными типами
- строить join, aggregation, window и reshape-преобразования без циклов по строкам
- применять LazyFrame, pushdown, streaming и анализ плана запроса
- тестировать схемы и данные, измерять производительность и память
- собирать надёжный production ETL/ELT-пайплайн с мониторингом
Как построена программа
- Основа Polars: Series, DataFrame, expressions, фильтрация, типы и очистка.
- Преобразования: строки, даты, агрегации, окна, join и изменение формы.
- Lazy execution: LazyFrame, query optimizer, pushdown, streaming и данные больше RAM.
- Качество и интеграции: тесты, Arrow, базы данных, lakehouse и SQL.
- Итоговый ETL: слои raw/clean/curated, идемпотентность, метрики и оптимизация.
Формат обучения
В курсе 23 модуля и 156 уроков. Каждый урок содержит подробное объяснение, небольшие нарастающие примеры, проверку понимания и практические задачи. Решения практики доступны для разбора после самостоятельной попытки.
Всего внутри 752 тестовых вопросов и 479 практических задач. Ориентировочная нагрузка: 100-160 часов. Курс рассчитан на самостоятельный темп без обязательных дедлайнов.
Итоговый проект
End-to-end ETL интернет-магазина: чтение сырых файлов, явные схемы, очистка, join и агрегации, ленивый streaming-план, Parquet-витрины, тесты и мониторинг.
Что потребуется на старте
- базовый Python: функции, коллекции, файлы и виртуальное окружение
- Python 3.12+, Polars 1.42 и PyArrow; установка разобрана в курсе
- знание pandas или SQL полезно, но не является обязательным
Как получить максимум пользы
- Запускайте примеры и меняйте входные данные, а не ограничивайтесь чтением.
- Сначала отвечайте на тест и решайте задачу самостоятельно, затем сверяйтесь с разбором.
- Ведите журнал ошибок, решений и технических компромиссов.
- Собирайте упражнения в отдельный репозиторий и регулярно возвращайтесь к старым задачам.
- Связывайте каждый инструмент с проблемой, которую он решает в реальной системе.
Результат прохождения
Вы сможете заменять хрупкие табличные скрипты воспроизводимыми Polars-пайплайнами, читать планы выполнения и подтверждать производительность измерениями.
Telegram: Логово Дата-Инженера
В Telegram-канале автора публикуются материалы по Rust, Java, Python, Go, SQL, pandas, Polars, Scala, Spark, Flink, Kafka, Hadoop, Airflow, DWH, Trino, ClickHouse, S3, файловым форматам, Docker/Kubernetes, разборы собеседований и архитектура Enterprise-проектов. Подписка поможет дополнять последовательную программу курса живыми кейсами из профессии.
Для кого этот курс
Начальные требования
Наши преподаватели
Как проходит обучение
Каждый урок проходится по циклу: понять идею, запустить и изменить пример, ответить на тест, самостоятельно решить практику и только затем свериться с разбором.
Материал выстроен последовательно, без обязательных дедлайнов. Рекомендуется вести учебный репозиторий и журнал ошибок.
Программа курса
Что вы получаете
- полный текстовый конспект курса с рабочими примерами
- 752 тестовых вопросов для самопроверки
- 479 практических задач с решениями
- итоговый проект: End-to-end ETL интернет-магазина: чтение сырых файлов, явные схемы, очистка, join и агрегации, ленивый streaming-план, Parquet-витрины, тесты и мониторинг.