Python / ML Engineer: data pipelines, trading research infrastructure, backend automation и production-подход к инженерным задачам.
Я занимаюсь практической разработкой на стыке Python, данных, машинного обучения и автоматизации. Основной фокус - надежные инженерные системы: загрузка и нормализация данных, подготовка датасетов, feature engineering, offline training, API, тесты и документация, с которой можно работать в команде.
Сейчас развиваю направление ML-first trading infrastructure: пайплайны рыночных данных, воспроизводимые обучающие выборки, offline-обучение моделей, валидация, backend-сервисы и подготовка к безопасным dry-run / paper-trading сценариям.
Что для меня важно в разработке:
- понятные границы между data engineering, ML, backend и execution-логикой;
- воспроизводимые пайплайны вместо разрозненных ручных скриптов;
- тесты, типизация, линтеры, миграции и документация как часть продукта;
- осторожный подход к рискованным доменам: preflight-gates, audit metadata, dry-run, validation first.
Также изучаю Data Science в SENATOROVAI и использую GitHub как портфолио инженерной практики, исследовательских заметок и проектной работы.
| Проект | Что показывает | Стек |
|---|---|---|
| AI Trading Bot | Private engineering project для trading research: ingestion, feature pipelines, dataset artifacts, offline training, validation и backend API. | Python, FastAPI, PostgreSQL, Redis, RabbitMQ, PyTorch, pandas |
Production-style работа оформлена в виде кейсов, потому что часть репозиториев приватная или связана с коммерческим контекстом.
Цель: создать поддерживаемую инженерную основу для trading research и будущей автоматизации на российском рынке.
Проблема: ML-задачи в трейдинге быстро становятся хаотичными без чистых исторических данных, воспроизводимых датасетов, leakage-aware признаков, валидации моделей и операционных safety-gates.
Что реализовано:
- загрузка рыночных данных для MOEX/AlgoPack-style workflows;
- PostgreSQL-хранилище для raw и normalized market data;
- feature snapshots со schema hash и no-leakage audit metadata;
- pipeline сборки dataset artifacts для offline ML;
- sharded datasets для многолетних диапазонов и ограниченной памяти рабочей станции;
- PyTorch offline training CLI с experiment manifests, metrics, registry metadata и отчетными артефактами;
- FastAPI health endpoints и Docker-based local infrastructure;
- тесты вокруг data ingestion, storage, features, labels, datasets, training, validation, backtesting и API health.
Результат: проект переводит trading model research из набора ad hoc scripts в воспроизводимый инженерный workflow с явной lineage-информацией, повторяемыми командами обучения и safety gates перед model promotion.
- Документировать решения и операционные команды, а не только код.
- Строить воспроизводимые пайплайны вместо ручных notebook-only процессов.
- Разделять исследовательскую, backend, storage, ML и execution-логику.
- Не пропускать рискованные изменения без dry-run, validation, tests и preflight checks.
- Поддерживать проект так, чтобы его мог быстро понять другой разработчик.


