Чему вы научитесь
- Собирать ETL-пайплайн в Apache Airflow и запускать его по расписанию
- Разворачивать аналитическую систему в Yandex Cloud: Airflow, PostgreSQL, DataLens
- Анализировать CSV, Parquet и JSON через SQL в DuckDB — без сервера и загрузки в базу
- Использовать продвинутый SQL: оконные функции, PIVOT, EXCLUDE
- Писать SQL-проверки на NULL, дубликаты, диапазоны и связность таблиц
- Настраивать автоматическую валидацию: Great Expectations, Pydantic, Pandera
- Встраивать проверки качества в Airflow и останавливать пайплайн на плохих данных
- Мониторить свежесть, объём и схему данных — Data Observability
- Проектировать схему БД под аналитику и строить дашборды в DataLens
О программе
О курсе
Три курса, которые складываются в один рабочий цикл инженера данных:
посмотреть → собрать → проверить
Это не программа обучения профессии, а набор из 3 практических инструментов, которыми пользуются каждый день.
Каждый курс самостоятельный, но вместе они закрывают путь от сырого файла до production-пайплайна с мониторингом качества.
Отдельно три курса стоят 4 970 ₽, в пакете — 3 990 ₽.
1. DuckDB на практике — быстрый анализ без инфраструктуры.
Вы научитесь читать CSV, Parquet и JSON напрямую через SQL, без сервера БД и загрузки в базу; использовать PIVOT, оконные функции и EXCLUDE; подключать DuckDB к Python и Pandas. Финальный проект — анализ 1 млн+ поездок NYC Taxi.
2. Apache Airflow: ETL-проект на PostgreSQL и DataLens — production-система в облаке.
Вы развернёте сервисы в Yandex Cloud с нуля, соберёте ETL/ELT-пайплайн с инкрементальной загрузкой из внешнего API, спроектируете схему БД с fact- и dimension-таблицами и построите дашборд в DataLens. Плюс — диагностика ошибок Airflow.
3. SQL и Python для проверки данных — чтобы пайплайн не врал.
Вы напишете SQL-проверки на NULL, дубликаты, диапазоны и связность; подключите валидацию на Pydantic и Pandera; настроите Great Expectations и мониторинг свежести, объёма и схемы. И встроите всё это в Airflow из второго курса — так три инструмента становятся одной системой.
Отзывы смотрите на страницах входящих курсов: у пакета своих пока нет, а у курсов их уже больше десятка.
Что внутри
В комплект входят 3 курса общей стоимостью 3 990 ₽.
Для кого эта программа
Начальные требования
☑️ Базовый SQL: SELECT, JOIN, GROUP BY
☑️ Базовый Python: функции, циклы, работа с библиотеками и pandas
☑️ Общее представление об API и HTTP-запросах
☑️ Компьютер, на который можно поставить DuckDB и запускать код локально
Опыта работы с Airflow, Great Expectations и облаком не нужно — всё разбираем с нуля.
⚠️ Про облако: курс по Airflow разворачивается в Yandex Cloud, это платная
инфраструктура. Новым пользователям выдаётся стартовый грант, которого
при разумном расходовании ресурсов хватает на прохождение проекта.
Курсы по DuckDB и по проверкам данных выполняются локально
и не требуют никаких расходов.
Наши преподаватели
Как проходит обучение
Рекомендуемый порядок:
DuckDB → Airflow → проверки данных
Первый курс проходится за вечер и даёт быстрый результат, второй — самый объёмный
проект, третий делает собранное надёжным.
Порядок необязательный:
курсы самостоятельные, начать можно с любого.
📝 Короткие уроки с конкретными примерами кода и SQL
🔨 Практические задания после каждой темы: вы пишете запросы и код руками
📊 Реальные данные: NYC Taxi (1 млн+ записей) и e-commerce-проект
🛠 В каждом курсе законченный проект, а не набор разрозненных примеров
💬 Telegram-чат в каждом курсе: отвечаю на вопросы лично
♾ Доступ к материалам остаётся навсегда, проходить можно в своём темпе
Содержание
Что вы получаете
- ✅ Три рабочих инструмента: локальная SQL-аналитика, оркестрация пайплайнов, автоматические проверки качества
- ✅ Три законченных проекта: анализ NYC Taxi, ETL-система в Yandex Cloud, Data Quality pipeline на e-commerce
- ✅ Готовый код и SQL-шаблоны, которые можно забрать в свою работу
- ✅ Сертификат Stepik по каждому из трёх курсов
- ✅ Доступ навсегда и все будущие обновления курсов
- ✅ Экономия 980 ₽ относительно покупки по-отдельности
- ✅ Личную поддержку автора в Telegram