9Модуль 9 · нед. 53–59Флагман
MLOps и продакшн
доводить модели до продакшна: Docker, serving, реестр моделей, CI/CD, облако, мониторинг — навыки, которые отличают ML-инженера от «человека с ноутбуками».
Артефакт: ML-сервис в облаке (портфолио №5, флагман)
AIмаксимальное ускорение за весь курс: Dockerfile, YAML для CI, конфиги облака — почти всегда автопилот. Железное правило: к каждому сгенерированному файлу проси построчное объяснение и выбрасывай всё, что не понимаешь и что не нужно. На интервью спросят «почему у вас тут multi-stage build» — отвечать тебе.
Неделя 53 · Docker
- Тема.
- образы и контейнеры, Dockerfile, слои и кэш, multi-stage build, docker compose.
- Практика.
- контейнеризируй флагман №4: multi-stage Dockerfile, компактный образ; compose для связки app + БД; опубликуй образ в GitHub Container Registry.
Чекпоинт. `docker compose up` поднимает всё на чужой машине; объясняешь каждый слой своего Dockerfile.
Неделя 54 · Serving и нагрузка
- Тема.
- паттерны инференса: online API, batch, очередь; латентность и пропускная способность; нагрузочное тестирование.
- Практика.
- сервис `/predict` для модели из модуля 6 (бустинг из Kaggle-проекта — идеально): загрузка модели при старте, валидация входа, версия модели в ответе; прогони нагрузку Locust, измерь p50/p95, найди и почини самое узкое место.
Чекпоинт. цифры p50/p95 при N RPS зафиксированы в README до и после оптимизации.
Неделя 55 · Эксперименты и реестр моделей
- Тема.
- трекинг экспериментов, реестр моделей и стадии; воспроизводимость: конфиги, сиды, lock-файлы.
- Практика.
- переведи обучение модели из ноутбука в скрипты: `train.py` + конфиг; каждый запуск логируется в MLflow с параметрами и метриками; лучшая модель уходит в registry, сервис недели 54 берёт её оттуда.
Чекпоинт. воспроизводишь любой прошлый эксперимент в одну команду; сервис подхватывает модель из registry, а не из случайного файла.
Неделя 56 · CI/CD
- Тема.
- GitHub Actions: линт, тесты, сборка образа, деплой; защита main-ветки; пайплайн как страховка.
- Практика.
- workflow на каждый PR: ruff → pytest → build образа → push в registry; авто-деплой демо при merge в main; защити main обязательным зелёным CI; бейдж в README.
Чекпоинт. сломанный тест физически блокирует merge; зелёный PR доезжает до деплоя без твоих рук.
Неделя 57 · Облако
- Тема.
- один облачный провайдер на выбор: IAM, объектное хранилище, запуск контейнера; GPU-инференс по требованию; контроль расходов.
- Практика.
- задеплой сервис недели 54 в облако из своего CI; данные — в S3/GCS; посчитай месячную стоимость и настрой бюджет-алерт; для LLM-флагмана попробуй Modal.
Чекпоинт. сервис доступен по публичному URL из облака; биллинг-алерт настроен, и ты знаешь, сколько это стоит в месяц.
Неделя 58 · Мониторинг и дрифт
- Тема.
- мониторинг ML-систем: качество данных, дрифт, деградация; логирование предсказаний; регулярные джобы.
- Практика.
- логируй предсказания сервиса в БД; сымитируй сдвиг данных и поймай его Evidently-отчётом; Prefect-flow: ежедневный отчёт по дрифту, при деградации — сигнал (хоть письмо, хоть issue).
Чекпоинт. имитированный дрифт виден в отчёте и порождает алерт без ручного запуска.
Неделя 59 · Капстоун (портфолио №5)
- Тема.
- собрать весь модуль в одну систему: полный жизненный цикл модели на одной задаче.
- Практика.
- одна задача (та же Kaggle-табличка или прогноз по живому API) от и до: данные → train с MLflow → registry → FastAPI → Docker → CI/CD → облако → Evidently-мониторинг; архитектурная схема в README; запуск одной командой (make или uv run).
Чекпоинт. незнакомый человек разворачивает систему по README за 15 минут; схема объясняет её за один взгляд; URL живой.