LLM-инженер: от prompt-инжиниринга до production

Курс про инженерную часть работы с LLM на Python: промптинг, structured output, RAG, агенты, оценка качества, вывод в прод. К концу вы собираете рабочий RAG-сервис с замерами качества и выкладываете его в свой репозиторий.
Средний уровень
2-3

Чему вы научитесь

  • Собирать RAG-пайплайн целиком: chunking, эмбеддинги, векторный поиск, гибрид с BM25, реранкинг, генерация с цитатами
  • Выбирать эмбеддер и векторное хранилище под русский язык и под объём данных
  • Получать от модели structured output с валидацией через Pydantic и повтором запроса, когда схема развалилась
  • Мерить качество поиска и ответов на golden-датасете: recall@k, MRR, RAGAS, доверительные интервалы
  • Ставить регрессионную проверку качества в CI, чтобы правка промпта не роняла систему молча
  • Писать промпты под задачу: few-shot, chain-of-thought, self-consistency, контроль токен-бюджета
  • Решать классификацию, NER и суммаризацию через LLM и видеть, где дешевле обойтись классикой
  • Строить агентов с tool use, ограничением числа шагов и роутингом между несколькими агентами
  • Выводить LLM-сервис в прод: кеш, метрики, таймауты, fallback между провайдерами, защита от prompt injection

О курсе

О чём курс

Материалов про "вызвали API, получили ответ" много. Дальше начинается инженерия, и про неё почти ничего.

Что делать, когда провайдер отвалился посреди запроса. Как получать структурированный ответ, который не разваливается на живом трафике. Почему RAG, отлично работавший на демо, через месяц начинает отвечать мимо. И как по числам увидеть, стало лучше или хуже после ваших правок.

Всё это на рабочем коде и с оглядкой на российские реалии: прокси-агрегаторы, GigaChat, оплата без зарубежной карты.

Что вы соберёте

Сквозная линия курса - RAG-сервис на открытом русскоязычном корпусе. К финальному уроку у вас на руках ingest и chunking, эмбеддинги, векторное хранилище, гибридный поиск с реранкингом, генерация с цитатами и проверкой цитат по контексту, golden-датасет с прогоном метрик, кеширование и метрики рантайма.

Архитектура финального проекта: FastAPI /ask, параллельный поиск по pgvector и BM25, опциональный реранкер, RRF-fusion, топ-K чанков, вызов LLM через прокси, структурированный ответ с цитатами и пост-проверка цитат по контексту; рядом логи, метрики и eval в CI

Референс-реализация лежит открыто: github.com/Daniil-Nay/production-rag-service. Смотреть и форкать можно с первого урока.

Программа

8 разделов и 22 урока: 3 вводных, 14 основных, 4 бонусных и 1 заключительный.

Введение

  • Добро пожаловать
  • Как устроены задания и как их отлаживать
  • Проверка окружения

Основы LLM-инженерии

  • Что такое LLM и как они работают
  • Промпт-инжиниринг: zero-shot, few-shot, chain-of-thought
  • Настройка проекта и LLM-клиент
  • Структурированный вывод (structured output) и вызов функций

LLM как инструмент для классического NLP

  • NLP-задачи через LLM: классификация, NER, суммаризация

RAG: генерация с опорой на поиск

  • Зачем нужен RAG (и когда без него легче)
  • Chunking и embeddings: фундамент поиска
  • Векторные хранилища и поиск (retrieval): dense, sparse, hybrid
  • Reranking и генерация: финальный отбор и качественный ответ
  • Оценка качества (evaluation): метрики и golden-датасеты

Схема базового RAG-пайплайна: документы режутся на чанки, чанки превращаются в эмбеддинги и ложатся в векторный индекс; запрос идёт в retriever с вектором и BM25, топ-K чанков уходит в LLM, на выходе ответ

LLM-агенты

  • LLM-агенты: вызов инструментов (tool use) и одиночный агент
  • Мультиагентные системы и маршрутизация

Вывод в продакшен и финальный проект

  • Продакшен: кеширование, мониторинг, задержки, безопасность
  • Финальный проект: сквозное LLM-приложение

Цепочка multi-provider fallback: запрос уходит первому провайдеру, по ошибке переходит к следующему, первый успех возвращает ответ, а если упали все - RuntimeError

Бонус: дообучение, безопасность, ингест, локальные модели

  • Дообучение (fine-tuning): LoRA и QLoRA, когда нужно и когда нет
  • Безопасность LLM-приложений: модель угроз, атаки, red-teaming
  • Ингест и парсинг документов для RAG
  • Локальные модели: Ollama и когда она оправдана

Заключение

  • Спасибо и обратная связь

Формат и задания

  • Видео нет, весь материал - структурированный текст со схемами и кодом. Читаете в своём темпе: знакомое проматываете, сложное перечитываете.
  • 17 задач на код с автопроверкой. Тесты детерминированные и не ходят в LLM, поэтому проверка не зависит от провайдера и его лимитов.
  • 69 вопросов квизов с выбором и с коротким ответом, по нескольку в каждом уроке.
  • 10 заданий со свободным ответом - там, где нужно объяснить решение, а не написать код.
  • Финальный проект: сквозное LLM-приложение, которое вы собираете сами и сдаёте с рубрикой из трёх критериев (техническая реализация, архитектура, документация). Взаимная проверка сокурсниками на бесплатных курсах Stepik недоступна, поэтому рубрику вы применяете к своему проекту сами, а вопросы по нему разбираются в комментариях к уроку.
  • Отдельный урок про то, как устроена автопроверка и как отлаживать задания, плюс шаг проверки окружения перед стартом. Чтобы вы не застряли на setup вместо RAG.
  • В комментариях отвечает бот-ассистент Совелий. Подсказывает направление, готовых решений не выдаёт, а найденные вами опечатки и неточности передаёт мне.
  • Курс обновляется по мере изменения стека.

Что нужно и чего не нужно

Понадобится Python на уровне классов, async и типизации, плюс базовое представление о нейросетях и эмбеддингах. GPU дома, академическая математика и опыт LLM в проде не нужны: модели вызываются по API, а всё, что считается локально, считается на процессоре.

Сколько времени займёт

Ориентировочно 40-50 часов. Зависит от опыта и от того, сколько кода вы пишете руками, а не копируете.

Кто ведёт

Daniil Nay. LLM-инженер в GigaChat (Сбер) с 2026.

До этого - Data Scientist в Сбербанке с 2025 года.

Победитель кейса ML School ИТМО 2025: дообучение Qwen и фильтр контаминации данных.

Магистратура ИТМО по прикладной математике (2025-2027), бакалавриат ЛЭТИ по информационным системам и технологиям (2021-2025).

Открытый код: production-rag-service - демо-проект этого курса, llm-eval-harness - харнесс оценки. 

Что почитать на русском

Что дальше

Курс заканчивается там, где сервис работает и его качество померено один раз. Дальше встаёт вопрос, как удерживать это качество при каждом изменении промпта, чанкинга или модели: откуда брать разметку, как считать согласие асессоров, где ставить порог и как закрыть релиз гейтом в CI. Про это у меня отдельный курс - Оценка LLM-систем: от разметки до гейта в CI, платный, старт 5 октября 2026.

Частые вопросы

Никогда не работал с LLM, потяну?

Если есть Python и базовое понимание ML, да. Курс не объясняет, что такое нейросеть, но и не предполагает, что вы уже собирали production-RAG.

Какую модель использовать?

Любую, доступную через OpenAI-совместимый API, включая прокси-агрегаторы для РФ. Курс не привязан к конкретному провайдеру, а в бонусном уроке есть вариант с локальной моделью через Ollama.

Нужен ли GPU?

Нет. Всё, что нужно посчитать локально, считается на процессоре, а модели вызываются по API.

Будет ли сертификат?

Сейчас нет. Что остаётся после курса - ваш репозиторий с работающим сервисом и замерами качества.

Для кого этот курс

  • Python- и backend-разработчики, которые заходят в LLM-стек с рабочего проекта.
  • ML-инженеры без production-опыта с LLM-приложениями.
  • Те, кто уже трогал LLM руками и хочет системности: дизайн-решения, надёжность, наблюдаемость.

Начальные требования

  • Python на уровне intermediate: классы, async, типизация, виртуальные окружения.
  • Базовое понимание ML и DL: что такое нейросеть, эмбеддинг, трансформер - обзорно.
  • Не понадобится: глубокий NLP, академическая математика, GPU дома, опыт LLM в проде.

Наши преподаватели

Программа курса

загружаем...

Отзывы прошедших курс

5
из 5
из 2 отзывов
2 отзыва
загружаем...
Price: Бесплатно

Расскажите о курсе друзьям

Price: Бесплатно