DE-практикум: ETL-проект от RAW до Airflow, Spark и BI

Соберите сквозной ETL-проект: Docker, PostgreSQL, S3, Spark, Airflow, проверки качества и BI-витрина. Каждую сдачу лично проверяет практикующий Data Engineer.
Начальный уровень
150

Чему вы научитесь

  • Поднимать локальный стенд: Spark + Postgres + Airflow + JupyterLab + MinIO в Docker
  • Понимать, что за что отвечает в окружении, и разбирать типовые проблемы по логам
  • Организовывать слои RAW / STG / CORE / MARTS на реальном датасете
  • Делать идемпотентные и инкрементальные загрузки
  • Проектировать факты, измерения, event-даты и витрины
  • Писать базовые SQL- и Spark-трансформации для подготовки слоёв
  • Оформлять пайплайн в Airflow DAG: зависимости, ретраи, расписание
  • Делать DQ-проверки: дубли, пустые ключи, расхождения по слоям
  • Собирать финальную витрину и простой BI-дашборд
  • Оформлять результат в Git-репозитории и уверенно рассказывать про свой ETL-проект на собеседовании

О курсе

Соберите рабочий ETL-проект: от RAW-файла до BI-витрины

Отдельно написать SQL-запрос или запустить Docker недостаточно, чтобы понять работу Data Engineer. Сложности начинаются на стыках: повторный запуск создаёт дубли, зелёный DAG записывает 0 строк, после JOIN меняется количество данных, а ошибка обнаруживается уже в отчёте.

На практикуме вы соберёте один сквозной проект и проведёте данные по всему пути: приём файлов, слои RAW / STG / CORE / MARTS, Spark, Airflow, проверки качества и итоговая BI-витрина.

В результате у вас останется запускаемый проект и приватный GitHub-репозиторий. На собеседовании вы сможете показать не набор учебных запросов, а целый пайплайн: откуда пришли данные, как они меняются, где проверяется качество и что произойдёт при повторном запуске.

Поток 6 стартует 12 октября 2026 года.
Можно проходить проект в своём темпе без жёстких дедлайнов.
Стоимость: 40 000 ₽
Нагрузка: 6–8 часов в неделю
Доступ: курс на Stepik и приватный репозиторий остаются у вас
Проверка: каждую сдачу проверяю лично
Поддержка: до завершения практикума

 

Проверить, подходит ли мне практикум →

Это не оплата. На странице есть программа, входная диагностика, реальные сдачи и отзывы участников.

 

Что вы соберёте

  1. Локальный стенд. Поднимете в Docker PostgreSQL, MinIO, Spark, Airflow, JupyterLab и Metabase.
  2. Загрузку исходных данных. Примете файлы, сохраните оригинал и добавите контроль входного батча.
  3. Слои хранилища. Построите RAW, STG, CORE и MARTS, разберётесь с ключами, grain, фактами и измерениями.
  4. Обработку в Spark. Запустите Spark-задачи и научитесь проверять не только статус выполнения, но и результат обработки.
  5. Оркестрацию в Airflow. Соберёте DAG, зависимости, параметры запуска и повторяемую загрузку без дублей.
  6. Проверки качества. Добавите проверки количества строк, уникальности, обязательных полей и сверки между слоями.
  7. BI-витрину. Доведёте данные до финальной модели и соберёте дашборд в Metabase.

 

Так выглядит часть проекта участника

1. Локальный стенд

Локальный стенд DE-практикума в Docker

Участник сам поднимает рабочий контур в Docker. В нём одновременно запускаются PostgreSQL, MinIO, Spark, Airflow, JupyterLab и Metabase. Это окружение используется на всём протяжении проекта.

2. Исходные данные и слой RAW

Исходные файлы и слой RAW в объектном хранилище

Исходные CSV поступают батчами и сохраняются в объектном хранилище. Вы организуете структуру файлов, сохраните оригинальные данные и подготовите загрузку, которую можно безопасно повторить.

3. Оркестрация в Airflow

Airflow DAG со сквозной загрузкой данных до слоя MARTS

Полный batch в Airflow: загрузка, преобразования, проверки качества и журналирование собраны в одну воспроизводимую цепочку.

4. Обработка в Spark

Метрики выполнения Spark-задачи

Проверка Spark-задачи: важно увидеть не только статус SUCCESS, но и количество прочитанных и записанных строк, ошибки и время выполнения.

 

Как проходит проверка

Я лично проверяю каждую сдачу. Смотрю SQL, код, структуру слоёв, логи и фактический результат в таблицах. Если пайплайн формально запускается, но даёт неверные данные, работа возвращается с конкретными замечаниями.

Проверка продолжается до рабочего результата. Вы не остаетесь один на один с ошибкой окружения, непонятным логом или сломанной зависимостью в DAG.

Номинант Stepik Awards 2025 в категории
🧩 «Лучшая система практических заданий».

Хотите сначала проверить формат руками?

Откройте бесплатное демо практикума. В нём вы поднимете небольшой стенд с PostgreSQL и Airflow, проведёте данные по слоям и выполните две задачи.

Отзывы участников предыдущего потока можно посмотреть на Stepik. Участники рассказывают, кому подошёл формат, где было сложно и что изменилось в понимании Data Engineering после проекта.

 

Как попасть в поток

  1. Посмотрите программу, реальные сдачи и входные требования.
  2. Пройдите короткую диагностику и оставьте заявку.
  3. Я проверю входную точку и отвечу в Telegram.
  4. После оплаты вы получите доступ к курсу и приватному репозиторию.

Посмотреть программу и оставить заявку →

 Остался конкретный вопрос? Задайте его Telegram-боту.

Для кого этот курс

аналитикам и BI-специалистам, которые уже пишут SQL и хотят понимать весь путь данных до витрины; Junior Data Engineers, которым не хватает цельного проекта и практики на стыках инструментов; разработчикам и специалистам по данным, которые хотят системно освоить DWH, Spark и Airflow; тем, кто готовится к DE-собеседованиям и хочет предметно рассказать о сделанном проекте.

Начальные требования

  • SQL: SELECT, JOIN, GROUP BY, агрегаты и CTE;
  • базовый Python: чтение кода, функции, списки, словари и работа с файлами;
  • понимание таблиц, ключей и витрин на уровне основных идей;
  • готовность поставить Docker по инструкции, читать логи и разбираться с ошибками;
  • компьютер с 16 ГБ ОЗУ. С 12 ГБ пройти можно, но 16 ГБ комфортнее.

Если сомневаетесь в подготовке, пройдите короткую диагностику на странице практикума. Она проверит SQL, Python, окружение и доступное время. После заявки я посмотрю ответы и честно скажу, стоит ли заходить в поток сейчас.

Наши преподаватели

Как проходит обучение

Вы проходите практикум в своем темпе, без обязательных созвонов и видео-марафонов.

Сначала проходите демо или диагностику и пишете мне в Telegram. После подтверждения получаете доступ к приватному GitHub-репозиторию и инструкции по запуску стенда.

Дальше поднимаете локальное окружение у себя на машине и проходите модули по шагам: SQL, Docker, Postgres, Spark, Airflow, DWH, проверки качества, витрины и BI.

По ходу задаете вопросы в чате. Я помогаю с окружением, логами, ошибками в коде и ключевыми решениями по пайплайну.

Рекомендованный темп — 6-8 часов в неделю.

Программа курса

загружаем...

Что вы получаете

  • цельный проект для портфолио: mini-DWH, сквозной ETL, проверки качества, витрина и BI-дашборд;
  • опыт поднятия локального DE-стенда без магии и страха перед Docker;
  • понимание RAW / STG / CORE / MARTS, инкрементов, DAG, DQ-проверок и reconcile;
  • практику с Git и репозиторием как в реальной команде;
  • поддержку на первых шагах: разбор логов, ошибок, архитектурных решений;
  • материалы и репозиторий, к которым можно возвращаться позже.

Сколько стоит обучение

Price: 40 000 
Вы попробовали и поняли, что вам сейчас не подходит этот курс? Ничего страшного, мы вернём вам деньги в течение 30-ти дней после покупки.

Часто задаваемые вопросы

Расскажите о курсе друзьям

Price: 40 000