Чему вы научитесь
- Превращать русский текст в признаки: токенизация, BoW, TF-IDF, Word2Vec
- Обучать и честно сравнивать классификаторы - от линейного бейзлайна до TextCNN
- Работать с последовательностями: RNN, LSTM, GRU, NER с entity-level F1, генерация с температурой, top-k и top-p
- Считать attention руками и собирать трансформер: маски, позиционные кодировки, разница BERT и GPT
- Дообучать энкодер на Hugging Face (актуальная версия v5) и переносить код из старых туториалов
- Строить семантический поиск на эмбеддингах и измерять его качество: recall@k, MRR, разбор отказов
- Собирать сквозной NLP-проект и сводную таблицу, которая показывает, какой метод что дал и чего стоил
О курсе
Это практический курс по обработке естественного языка (NLP) на Python, полностью
на русскоязычных данных. Один корпус отзывов проходит через весь курс, и вы
поэтапно строите на нем: счетный бейзлайн, сверточный классификатор, дообученный
трансформер-энкодер и семантический поиск с измеренным качеством.
Главный результат - сводная таблица, в которой все подходы сравнены честно: одно
разбиение, один seed, одна метрика. Она отвечает на вопрос, который в туториалах
обычно не задают: стоил ли переход к более сложной модели своей цены.
Чем этот курс отличается:
• Данные русские, а не переведенный пример с английского. Разница в токенизации,
размере словаря и качестве моделей видна сразу, а не остается теорией.
• Каждый метод сравнивается с предыдущим. Никакой магии: вы своими руками увидите,
где счетные признаки ломаются и где дообученный трансформер не окупается.
• Курс написан под актуальную версию Hugging Face Transformers. Пятая ветка ломает
почти весь код из старых статей и курсов - отдельный урок разбирает, что именно
изменилось и как читать чужой код под предыдущую версию.
• Честность об ограничениях. Там, где разметка получена дешево, курс это называет и
показывает, как она искажает метрику. Последний урок - список того,
чего построенная система не умеет.
Все проверяется на практике: легкие задачи проходят автопроверку прямо на
платформе, тяжелые вынесены в готовые Google Colab-ноутбуки, которые запускаются в
пару кликов. GPU не нужен - курс проходится целиком на процессоре
Для кого этот курс
Начальные требования
• Python: функции, классы, numpy, pandas.
• Машинное обучение: train/val/test, переобучение, метрики.
• PyTorch на уровне чтения кода: тензоры, модуль, цикл обучения.
• GPU не нужен - все практики проходятся на процессоре, ускоритель только сокращает ожидание.
Наши преподаватели
Как проходит обучение
20 уроков в 6 модулях, self-paced — проходите в своем темпе.
Каждый урок построен одинаково: постановка проблемы → разбор теории → пример на числах → практика → тест → отдельный шаг о границах решения.
Практика двух видов: задачи по коду с автоматической проверкой прямо на платформе (решаете в браузере, система сразу говорит, что не так) и расширенные практики на
PyTorch в готовых Google Colab-ноутбуках — открыл, скопировал к себе, запустил.
В конце — финальный проект в двух треках на выбор: повторить пайплайн на учебных
данных или принести свою задачу. Автор отвечает на вопросы в комментариях два раза
в неделю; комментарии включены во всех уроках.
Ориентировочный объем — 20–25 часов.
Программа курса
Что вы получаете
- Рабочий сквозной NLP-проект и сводную таблицу сравнения методов - готовый артефакт для портфолио.
- Навык, который переносится на свои данные: не «запустить пример», а понимать,
- какой метод выбрать, как его честно измерить и где он сломается.
- Задачи с автопроверкой и Colab-ноутбуки, которые остаются у вас.
- Сертификат Stepik по завершении.
- Бессрочный доступ к материалам курса.