Должностная инструкция инженера машинного зрения (Computer Vision / CV-инженера): 2026
Head of AI / Технический директор (СТО)
ООО "____________________"
__________ / __________________ /
«___» ____________ 2026 г.
1. Общие положения
1.1. Настоящая должностная инструкция определяет производственные функции, квалификационные требования, права и ответственность инженера компьютерного (машинного) зрения / Computer Vision Engineer (CV-инженера) (далее — Работник).
1.2. Должность относится к категории ведущих разработчиков в области прикладного искусственного интеллекта и обработки видеопотоков.
1.3. Назначение на должность и освобождение от нее производятся приказом Генерального директора по представлению Head of Computer Vision / Chief Data Officer.
1.4. CV-инженер непосредственно подчиняется Тимлиду группы компьютерного зрения (Lead CV Engineer).
1.5. В своей служебной деятельности Работник руководствуется:
- Трудовым кодексом РФ, Федеральным законом № 152-ФЗ «О персональных данных» (включая требования к биометрическим персональным данным — ст. 11);
- Профессиональным стандартом 06.042 «Специалист по моделированию, сбору и анализу данных с использованием методов машинного обучения»;
- Регламентами обеспечения качества кода, политиками информационной безопасности и стандартами MLOps.
2. Квалификационные требования к специальности
2.1. Образование: Высшее образование (математическое, инженерное, физико-техническое) по профилю «Прикладная математика и информатика», «Оптико-электронные приборы и системы», «Робототехника и мехатроника».
2.2. Требования к опыту: Опыт коммерческой разработки и обучения моделей компьютерного зрения от 2 лет (для Senior — от 4 лет с подтвержденным портфолио внедрений).
2.3. Инженер машинного зрения (CV-инженер) должен знать:
- Классические алгоритмы обработки изображений: фильтрация, цветовые пространства, детекция границ (Canny, Sobel), поиск ключевых точек (SIFT, ORB), морфологические операции;
- Архитектуры глубоких нейросетей для CV: сверточные сети (ResNet, EfficientNet, ConvNeXt), Vision Transformers (ViT, Swin), диффузионные модели;
- Задачи и архитектуры детекции и сегментации: семейство YOLO (v8/v9/v10/v11), RT-DETR, Mask R-CNN, Segment Anything Model (SAM), DeepLab;
- Задачи трекинга объектов (Object Tracking): DeepSORT, ByteTrack, BoT-SORT;
- Распознавание лиц, верификация и биометрия: ArcFace, CosFace, InsightFace;
- Распознавание текста (OCR): PaddleOCR, Tesseract, TrOCR;
- Стек разработки: Python, C++ (для встраиваемых систем), PyTorch, OpenCV, Albumentations, MMsegmentation, MMDetection;
- Оптимизация инференса под целевые устройства (Edge Devices, GPU, CPU): TensorRT, ONNX Runtime, OpenVINO, TVM, квантование (INT8/FP16), прунинг;
- Работа с видеопотоками в реальном времени: RTSP, WebRTC, GStreamer, FFmpeg, DeepStream SDK.
Справочные данные классификаторов
| Классификатор | Код / Значение | Основание |
|---|---|---|
| Код по ОКЗ | 2511 (Системные аналитики и разработчики систем ИИ) | ОК 010-2014 |
| Код по ОКПДТР | 22843 (Инженер-программист систем машинного зрения) | ОК 016-94 |
| Профессиональный стандарт | 06.042 «Специалист по машинному обучению» | Приказ Минтруда РФ № 559н |
| Квалификационный уровень | 6–7 уровень квалификации | Приказ Минтруда РФ № 148н |
3. Должностные и профессиональные обязанности
Инженер компьютерного зрения выполняет следующие обязанности:
3.1. Разработка и обучение моделей:
- Осуществляет сбор, очистку, фильтрацию и аугментацию графических и видеодатасетов, составляет технические задания и контролирует разметку данных асессорами (Label Studio, CVAT).
- Обучает и валидирует нейросетевые модели для задач классификации, детекции объектов, семантической/инстанс-сегментации и трекинга в видеопотоке.
- Оптимизирует метрики качества моделей: mAP@0.5:0.95, IoU, Precision, Recall, F1-score.
- Разрабатывает алгоритмы 3D-реконструкции, оценки позы человека (Pose Estimation) и калибровки камер.
3.2. Оптимизация и развертывание (Deployment):
- Оптимизирует скорость работы нейросетей (FPS, Inference Latency) для запуска на целевом железе (NVIDIA Jetson, серверные GPU, мобильные NPU).
- Интегрирует обученные CV-пайплайны в масштабируемые микросервисы обработки потокового видео (FastAPI, Triton Inference Server, GStreamer).
- Осуществляет мониторинг стабильности распознавания на реальных камерах видеонаблюдения при различных условиях освещенности.
4. Права работника
CV-инженер имеет право:
- Запрашивать дополнительные аппаратные мощности (GPU-серверы, видеокарты NVIDIA A100/H100/L40) для обучения масштабных моделей.
- Выбирать архитектуры нейросетей и методы сжатия (квантование, дистилляция знаний) для достижения требуемого компромисса между точностью и скоростью.
- Отклонять некачественно размеченные датасеты и требовать повторной разметки.
5. Ответственность
CV-инженер несет ответственность за:
- Низкую точность распознавания: высокий уровень ложных срабатываний (False Positive), приведший к ошибкам в промышленных системах контроля качества или безопасности.
- Просадки по FPS (Latency): неспособность алгоритма обрабатывать видеопоток в режиме реального времени (Real-Time processing).
- Нарушение законодательства о биометрии: несанкционированный сбор и хранение биометрических данных лиц граждан (ст. 13.11 КоАП РФ).
6. Взаимодействие и KPI
6.1. Связи: взаимодействует с MLOps-инженерами, разработчиками встраиваемых систем (Embedded/C++), разметчиками данных и продакт-менеджерами.
6.2. KPI: достижение целевой точности (mAP > 90%), обеспечение стабильного real-time инференса (не менее 25–30 FPS на поток), соблюдение сроков релизов моделей.
Лист ознакомления
| ФИО CV-инженера | Специализация | Подпись | Дата |
|---|---|---|---|
| ______________________________ | (Video Analytics / OCR / 3D) | ______________ | «___» __________ 202__ г. |
Вопросы и ответы по должности
Что такое TensorRT и зачем он нужен CV-инженеру?
NVIDIA TensorRT — это высокопроизводительный оптимизатор и среда выполнения инференса нейросетей. Он трансформирует обученные в PyTorch модели, объединяет слои нейросети (layer fusion), подбирает оптимальные ядра GPU и применяет квантование (INT8), что позволяет ускорить обработку видеопотока в 3–10 раз.
В чем разница между классификацией, детекцией и сегментацией?
Классификация определяет, какой объект изображен на картинке в целом. Детекция находит объекты и обводит их прямоугольными рамками (Bounding Box) с указанием координат. Сегментация выделяет точный контур каждого объекта на попиксельном уровне (Pixel-level mask).