Должностная инструкция Data Scientist / ML-инженера (Machine Learning): 2026
Chief Data Officer (CDO) / CTO
ООО "____________________"
__________ / __________________ /
«___» ____________ 2026 г.
1. Общие положения
1.1. Настоящая должностная инструкция определяет должностные обязанности, права, требования к квалификации и ответственность Data Scientist (специалиста по исследованию данных / инженера по машинному обучению — Machine Learning Engineer) (далее — Работник).
1.2. Должность относится к категории ведущих IT-специалистов в области анализа больших данных и искусственного интеллекта (ИИ).
1.3. Прием на работу и увольнение осуществляются приказом Генерального директора по согласованию с Chief Data Officer (CDO) / Руководителем Data Science подразделения.
1.4. Data Scientist непосредственно подчиняется Lead Data Scientist / Head of AI & Analytics.
1.5. В своей профессиональной деятельности Работник руководствуется:
- Трудовым кодексом РФ, Федеральным законом № 152-ФЗ «О персональных данных»;
- Профессиональным стандартом 06.042 «Специалист по моделированию, сбору и анализу данных с использованием методов машинного обучения»;
- Национальной стратегией развития искусственного интеллекта на период до 2030 года;
- Архитектурными стандартами компании, регламентами информационной безопасности и политиками управления данными (Data Governance).
2. Квалификационные требования к должности
2.1. Требования к образованию: Высшее образование (бакалавриат / магистратура / специалитет) по направлениям «Прикладная математика и информатика», «Фундаментальная информатика», «Компьютерные науки», «Статистика и анализ данных».
2.2. Требования к стажу: Для позиции уровня Middle — опыт практической разработки и внедрения ML-моделей от 2 лет; для позиции Senior / Lead — от 4–5 лет продуктового опыта.
2.3. Data Scientist / ML-инженер должен знать:
- Высшую математику: теорию вероятностей, математическую статистику, линейную алгебру, методы математической оптимизации;
- Классические алгоритмы Machine Learning (линейные модели, деревья решений, ансамбли Random Forest, XGBoost, CatBoost, LightGBM, алгоритмы кластеризации и понижения размерности PCA/t-SNE);
- Архитектуры глубоких нейронных сетей (Deep Learning): MLP, CNN, RNN/LSTM, Transformers (BERT, GPT, T5), Diffusion-модели;
- Стек программирования: Python (NumPy, Pandas, Scikit-learn, SciPy), фреймворки глубокого обучения (PyTorch, TensorFlow);
- Инструменты работы с данными: SQL (PostgreSQL, ClickHouse, Greenplum), экосистему Big Data (Apache Spark, PySpark, Hadoop, Kafka);
- Практики MLOps: версионирование данных и моделей (DVC, MLflow, ClearML), контейнеризацию (Docker, Kubernetes), оркестрацию пайплайнов (Apache Airflow, Kubeflow);
- Методологию валидации моделей (K-Fold кросс-валидация, Out-of-Time валидация), расчет бизнес-метрик и A/B-тестирование (bootstrap, t-тест, CUPED).
Справочные данные классификаторов
| Классификатор | Код / Значение | Основание |
|---|---|---|
| Код по ОКЗ | 2511 (Системные аналитики и исследователи данных) / 2120 | ОК 010-2014 |
| Код по ОКПДТР | 22843 (Инженер-программист / Аналитик данных) | ОК 016-94 |
| Профессиональный стандарт | 06.042 «Специалист по машинному обучению» | Приказ Минтруда РФ № 559н |
| Квалификационный уровень | 6–7 уровень квалификации | Приказ Минтруда РФ № 148н |
3. Должностные и профессиональные обязанности
Data Scientist выполняет следующие задачи по разработке и промышленному внедрению ML-решений:
3.1. Анализ данных и разработка моделей:
- Осуществляет разведочный анализ данных (EDA), выявляет аномалии, пропуски и закономерности в терабайтных массивах структурированных и неструктурированных данных.
- Разрабатывает и валидирует гипотезы по генерации признаков (Feature Engineering), производит отбор значимых предикторов.
- Обучает, настраивает гиперпараметры и оценивает качество предиктивных моделей (метрики ROC-AUC, PR-AUC, F1-Score, RMSE, MAPE, NDCG).
- Fine-tuning и адаптация предобученных больших языковых моделей (LLM) и мультимодальных сетей под прикладные бизнес-задачи (RAG, агенты, эмбеддинги).
3.2. MLOps и интеграция в продакшн:
- Упаковывает обученные модели в высокопроизводительные микросервисы (FastAPI, Triton Inference Server, ONNX Runtime, TensorRT).
- Организует мониторинг работы моделей в реальном времени (Data Drift, Concept Drift, падение качества метрик), настраивает автоматический переобучающий пайплайн (CI/CD/CT).
- Участвует в проектировании и статистической оценке результатов A/B-экспериментов для доказательства влияния ML-модели на бизнес-показатели (LTV, Churn, CTR, выручка).
4. Права работника
Data Scientist имеет право:
- Запрашивать у владельцев продуктов (Product Owners) и аналитиков доступ к необходимым источникам данных (сырые логи, базы транзакций).
- Выбирать архитектуру моделей, библиотеки и вычислительные ресурсы (GPU-кластеры, облачные мощности), необходимые для решения поставленной задачи.
- Инициировать закрытие неперспективных исследовательских R&D-направлений, если на этапе Proof of Concept (PoC) подтверждена невозможность достижения целевого качества.
5. Ответственность
Data Scientist несет ответственность за:
- Утечку данных (Data Leakage): ошибки валидации, приведшие к иллюзорно высоким метрикам на тесте и провалу модели в реальной эксплуатации.
- Конфиденциальность: несанкционированное использование персональных данных (ПДн) и коммерческой тайны при обучении моделей.
- Неоптимальный расход инфраструктурных ресурсов: нецелевое использование дорогостоящих мощностей GPU-серверов.
6. Взаимодействие и KPI
6.1. Связи: взаимодействует с Data Engineers (поставка витрин данных), Software Engineers (встраивание в бэкенд), Product менеджерами и бизнес-заказчиками.
6.2. KPI: достижение таргетированных бизнес-метрик (рост конверсии, оптимизация затрат, сокращение оттока клиентов), скорость вывода моделей из PoC в Production (Time to Market), надежность и latency инференса сервисов.
Лист ознакомления
| ФИО специалиста | Грейд (Middle / Senior / Lead) | Подпись | Дата |
|---|---|---|---|
| ______________________________ | ___________________________ | ______________ | «___» __________ 202__ г. |
Вопросы и ответы по должности
В чем разница между Data Scientist и Data Engineer?
Data Engineer строит надежные пайплайны поставки, очистки и хранения сырых данных (ETL/ELT, хранилища DWH/Data Lake, Kafka, Spark). Data Scientist использует эти подготовленные данные для проведения математического анализа, проверки гипотез и создания самообучающихся алгоритмов (ML/AI).
Обязан ли Data Scientist писать продакшн-код?
В современных продуктовых IT-командах граница между Data Scientist и ML Engineer стерта. Специалист должен не просто обучать модели в Jupyter Notebook, но и писать модульный, покрытый тестами Python-код, оформлять сервисы в Docker-контейнеры и разворачивать API.