Чему вы научитесь
- Поднимать локальный стенд: Spark + Postgres + Airflow + JupyterLab + MinIO в Docker
- Понимать, что за что отвечает в окружении, и разбирать типовые проблемы по логам
- Организовывать слои RAW / STG / CORE / MARTS на реальном датасете
- Делать идемпотентные и инкрементальные загрузки
- Проектировать факты, измерения, event-даты и витрины
- Писать базовые SQL- и Spark-трансформации для подготовки слоёв
- Оформлять пайплайн в Airflow DAG: зависимости, ретраи, расписание
- Делать DQ-проверки: дубли, пустые ключи, расхождения по слоям
- Собирать финальную витрину и простой BI-дашборд
- Оформлять результат в Git-репозитории и уверенно рассказывать про свой ETL-проект на собеседовании
О курсе
Соберите рабочий ETL-проект: от RAW-файла до BI-витрины
Отдельно написать SQL-запрос или запустить Docker недостаточно, чтобы понять работу Data Engineer. Сложности начинаются на стыках: повторный запуск создаёт дубли, зелёный DAG записывает 0 строк, после JOIN меняется количество данных, а ошибка обнаруживается уже в отчёте.
На практикуме вы соберёте один сквозной проект и проведёте данные по всему пути: приём файлов, слои RAW / STG / CORE / MARTS, Spark, Airflow, проверки качества и итоговая BI-витрина.
В результате у вас останется запускаемый проект и приватный GitHub-репозиторий. На собеседовании вы сможете показать не набор учебных запросов, а целый пайплайн: откуда пришли данные, как они меняются, где проверяется качество и что произойдёт при повторном запуске.
Поток 6 стартует 12 октября 2026 года.
Можно проходить проект в своём темпе без жёстких дедлайнов.
Стоимость: 40 000 ₽
Нагрузка: 6–8 часов в неделю
Доступ: курс на Stepik и приватный репозиторий остаются у вас
Проверка: каждую сдачу проверяю лично
Поддержка: до завершения практикума
Проверить, подходит ли мне практикум →
Это не оплата. На странице есть программа, входная диагностика, реальные сдачи и отзывы участников.
Что вы соберёте
- Локальный стенд. Поднимете в Docker PostgreSQL, MinIO, Spark, Airflow, JupyterLab и Metabase.
- Загрузку исходных данных. Примете файлы, сохраните оригинал и добавите контроль входного батча.
- Слои хранилища. Построите
RAW,STG,COREиMARTS, разберётесь с ключами, grain, фактами и измерениями. - Обработку в Spark. Запустите Spark-задачи и научитесь проверять не только статус выполнения, но и результат обработки.
- Оркестрацию в Airflow. Соберёте DAG, зависимости, параметры запуска и повторяемую загрузку без дублей.
- Проверки качества. Добавите проверки количества строк, уникальности, обязательных полей и сверки между слоями.
- BI-витрину. Доведёте данные до финальной модели и соберёте дашборд в Metabase.
Так выглядит часть проекта участника
1. Локальный стенд
Участник сам поднимает рабочий контур в Docker. В нём одновременно запускаются PostgreSQL, MinIO, Spark, Airflow, JupyterLab и Metabase. Это окружение используется на всём протяжении проекта.
2. Исходные данные и слой RAW
Исходные CSV поступают батчами и сохраняются в объектном хранилище. Вы организуете структуру файлов, сохраните оригинальные данные и подготовите загрузку, которую можно безопасно повторить.
3. Оркестрация в Airflow
Полный batch в Airflow: загрузка, преобразования, проверки качества и журналирование собраны в одну воспроизводимую цепочку.
4. Обработка в Spark
Проверка Spark-задачи: важно увидеть не только статус SUCCESS, но и количество прочитанных и записанных строк, ошибки и время выполнения.
Как проходит проверка
Я лично проверяю каждую сдачу. Смотрю SQL, код, структуру слоёв, логи и фактический результат в таблицах. Если пайплайн формально запускается, но даёт неверные данные, работа возвращается с конкретными замечаниями.
Проверка продолжается до рабочего результата. Вы не остаетесь один на один с ошибкой окружения, непонятным логом или сломанной зависимостью в DAG.
Номинант Stepik Awards 2025 в категории
🧩 «Лучшая система практических заданий».
Хотите сначала проверить формат руками?
Откройте бесплатное демо практикума. В нём вы поднимете небольшой стенд с PostgreSQL и Airflow, проведёте данные по слоям и выполните две задачи.
Отзывы участников предыдущего потока можно посмотреть на Stepik. Участники рассказывают, кому подошёл формат, где было сложно и что изменилось в понимании Data Engineering после проекта.
Как попасть в поток
- Посмотрите программу, реальные сдачи и входные требования.
- Пройдите короткую диагностику и оставьте заявку.
- Я проверю входную точку и отвечу в Telegram.
- После оплаты вы получите доступ к курсу и приватному репозиторию.
Посмотреть программу и оставить заявку →
Остался конкретный вопрос? Задайте его Telegram-боту.
Для кого этот курс
Начальные требования
- SQL:
SELECT,JOIN,GROUP BY, агрегаты иCTE; - базовый Python: чтение кода, функции, списки, словари и работа с файлами;
- понимание таблиц, ключей и витрин на уровне основных идей;
- готовность поставить Docker по инструкции, читать логи и разбираться с ошибками;
- компьютер с 16 ГБ ОЗУ. С 12 ГБ пройти можно, но 16 ГБ комфортнее.
Если сомневаетесь в подготовке, пройдите короткую диагностику на странице практикума. Она проверит SQL, Python, окружение и доступное время. После заявки я посмотрю ответы и честно скажу, стоит ли заходить в поток сейчас.
Наши преподаватели
Как проходит обучение
Вы проходите практикум в своем темпе, без обязательных созвонов и видео-марафонов.
Сначала проходите демо или диагностику и пишете мне в Telegram. После подтверждения получаете доступ к приватному GitHub-репозиторию и инструкции по запуску стенда.
Дальше поднимаете локальное окружение у себя на машине и проходите модули по шагам: SQL, Docker, Postgres, Spark, Airflow, DWH, проверки качества, витрины и BI.
По ходу задаете вопросы в чате. Я помогаю с окружением, логами, ошибками в коде и ключевыми решениями по пайплайну.
Рекомендованный темп — 6-8 часов в неделю.
Программа курса
Что вы получаете
- цельный проект для портфолио: mini-DWH, сквозной ETL, проверки качества, витрина и BI-дашборд;
- опыт поднятия локального DE-стенда без магии и страха перед Docker;
- понимание RAW / STG / CORE / MARTS, инкрементов, DAG, DQ-проверок и reconcile;
- практику с Git и репозиторием как в реальной команде;
- поддержку на первых шагах: разбор логов, ошибок, архитектурных решений;
- материалы и репозиторий, к которым можно возвращаться позже.