LLM-инженер: от prompt-инжиниринга до production

Курс по production-LLM-приложениям на Python: prompt-инжиниринг, structured output, RAG, агенты, оценка качества, мониторинг, безопасность. 14 основных и 4 бонусных модуля, около 20 заданий с автопроверкой, финальный проект с проверкой сокурсниками.
Средний уровень
2-3

О курсе

О чём это

Материалов про «вызвали API, получили ответ» много. Дальше начинается инженерия, и про неё почти ничего.

Что делать, когда провайдер отвалился посреди запроса. Как получать структурированный ответ, который не разваливается на живом трафике. Почему RAG, отлично работавший на демо, через месяц начинает отвечать мимо. И как по числам увидеть, стало лучше или хуже после ваших правок.

Всё это на рабочем коде и с оглядкой на российские реалии: прокси-агрегаторы, GigaChat, оплата без зарубежной карты.

Кому подойдёт

  • Python-разработчикам, которые хотят собрать цельную инженерную картину LLM-стека.
  • ML-инженерам без production-опыта с LLM-приложениями.
  • Тем, кто уже трогал LLM руками и хочет системности: дизайн-решения, надёжность, наблюдаемость.

Понадобится Python на уровне классов, async и типизации, плюс базовое представление о нейросетях и эмбеддингах. GPU дома, академическая математика и опыт LLM в проде не нужны.

Чему вы научитесь

  • Понимать, что происходит внутри модели. Токенизация, эмбеддинги, decoding, контекст-окно. На уровне рабочей интуиции, без вывода формул.
  • Делать structured output и function calling с валидацией и retry.
  • Применять LLM к классическим NLP-задачам (классификация, NER, суммаризация) и видеть, где дешевле обойтись классикой.
  • Проектировать RAG под конкретную задачу: chunking, эмбеддер, vector store, гибридный поиск, реранкинг, генерация с цитированием.
  • Собирать golden-датасет и честно мерить качество: recall@k, MRR, RAGAS, bootstrap-интервалы.
  • Строить агентов с tool use, защитой от зацикливания и роутингом между несколькими агентами.
  • Выкатывать в прод. Кеширование, мониторинг, fallback-стратегии, базовая защита от prompt injection.
  • Собрать end-to-end сервис, который можно положить в портфолио.

Программа

14 основных модулей и 4 бонусных.

Базы LLM-инженерии

  • 1. Что такое LLM и как они работают. Transformer, токенизация, эмбеддинги, decoding, контекст-окно.
  • 2. Prompt engineering. Zero/few-shot, chain-of-thought, self-consistency, антипаттерны, токен-бюджеты.
  • 3. Setup проекта и LLM-клиент. Python 3.11 через uv, OpenAI-совместимый прокси, retry и fallback, мок-тестирование.
  • 4. Structured output и function calling. JSON mode, strict, Pydantic как контракт.

Классический NLP через LLM

  • 5. Классификация, NER, суммаризация. Где LLM выигрывает у классики, гибридные пайплайны, post-hoc verification.

RAG

  • 6. Зачем нужен RAG и когда без него проще.
  • 7. Chunking-стратегии и эмбеддинги, выбор эмбеддера для русского языка.
  • 8. Vector stores и retrieval. Pgvector и Qdrant, HNSW, BM25, гибрид с RRF.
  • 9. Реранкинг и генерация. Cross-encoders, цитирование, контроль галлюцинаций.
  • 10. Evaluation. RAGAS, golden-датасеты, recall@k, MRR, bootstrap CI, регрессии в CI.

Агенты

  • 11. Tool use и единичные агенты. ReAct, function calling, защита от зацикливания.
  • 12. Multi-agent системы. Router, orchestrator-worker, отладка.

Production и финальный проект

  • 13. Production. Кеширование, мониторинг, prompt injection, rate limiting.
  • 14. Финальный проект. End-to-end сервис на открытом русскоязычном корпусе, с проверкой сокурсниками.

Бонусные модули

  • Fine-tuning (LoRA/QLoRA): когда он нужен и когда нет.
  • AI safety: модель угроз, атаки на LLM-приложения, red-teaming.
  • Ингест и парсинг документов для RAG.
  • Локальные модели через Ollama: где они уместны, а где только мешают.

Формат

  • Без видео, структурированный текст. Читаете в своём темпе: знакомое проматываете, сложное перечитываете.
  • Около 20 заданий с автопроверкой (код и разбор вывода) плюс практические со свободным ответом. Тесты детерминированные, без вызовов LLM, поэтому автопроверка не зависит от провайдера и его лимитов.
  • Отдельный урок про то, как устроена автопроверка и как отлаживать задания, и шаг проверки окружения перед стартом. Чтобы вы не застряли на setup вместо RAG.
  • Финальный проект с проверкой сокурсниками по прозрачным критериям: техническая реализация, архитектура, документация.
  • Открытый demo-репозиторий: github.com/Daniil-Nay/production-rag-service. Reference-реализация, которую можно смотреть и форкать.
  • В комментариях отвечает ассистент курса. Подсказывает направление, готовых решений не выдаёт, а найденные вами опечатки и неточности передаёт мне.
  • Курс обновляется по мере изменения стека.

Сколько времени займёт

Ориентировочно 40-50 часов. Зависит от опыта и от того, сколько кода вы пишете руками, а не копируете.

Частые вопросы

Никогда не работал с LLM, потяну?

Если есть Python и базовое понимание ML, да. Курс не объясняет, что такое нейросеть, но и не предполагает, что вы уже собирали production-RAG.

Какую модель использовать?

Любую, доступную через OpenAI-совместимый API, включая прокси-агрегаторы для РФ. Курс не привязан к конкретному провайдеру, а в бонусном модуле есть вариант с локальной моделью.

Нужен ли GPU?

Нет. Всё, что нужно посчитать локально, считается на процессоре, а модели вызываются по API.

Будет ли сертификат?

Нет. У бесплатных курсов Stepik сертификаты не выдаются. Осязаемый результат тут другой, собранный вами сервис в репозитории.

Для кого этот курс

  • Middle Python/Backend разработчики, входящие в LLM-стек
  • Junior/Middle ML-инженеры без production-опыта в LLM
  • Старшие разработчики, которым нужен системный upgrade

Начальные требования

Python intermediate: классы, async, типизация, виртуальные окружения

Базовое понимание ML/DL: нейросеть, embedding, transformer (обзорно)

НЕ нужно: глубокий NLP, академматан, GPU дома, опыт LLM в проде

Наши преподаватели

Программа курса

загружаем...

Отзывы прошедших курс

5
из 5
из 2 отзывов
2 отзыва
загружаем...
Price: Бесплатно

Расскажите о курсе друзьям

Price: Бесплатно