Компьютерное зрение
Компьютерное зрение (англ. computer vision, CV) это направление искусственного интеллекта, в котором программа извлекает из изображения или видеопотока структурированные данные. Что попало в кадр, где именно находится объект, сколько объектов, что изменилось между кадрами. На входе пиксели. На выходе запись, с которой уже умеет работать учётная система: артикул товара, координаты рамки, число вошедших посетителей, серия и номер документа.
Предмет легко спутать с генерацией картинок, хотя поток данных направлен в противоположную сторону. Дипфейк и генеративные модели синтезируют изображение, которого не существовало, а компьютерное зрение разбирает изображение, которое уже снято настоящей камерой. Это зеркальные задачи, и путают их часто.
Для компании тема упирается в две вещи, которых почти не бывает в обзорных материалах: в число, по которому подрядчику подписывают акт, и в закон. Камера в торговом зале снимает лица людей. С этого момента у проекта появляется правовой режим обработки данных, а у ошибки модели появляется цена, выраженная в рублях.

Чем отличается от соседних понятий
- Машинное обучение и нейросети это инструмент, а компьютерное зрение это класс задач. Часть задач решается вообще без обучения: бинаризацией, поиском контуров, сопоставлением с шаблоном.
- Обработка изображений меняет сам кадр: убирает шум, выравнивает гистограмму, поворачивает. Компьютерное зрение кадр не трогает и отдаёт описание его содержимого.
- Машинное зрение (machine vision) это промышленный частный случай. Неподвижная камера, поставленный свет, известная сцена, одна операция на конвейере. Условия съёмки там задаёт инженер, а не погода за окном.
- Распознавание текста (OCR) это подзадача компьютерного зрения, у которой свои метрики и свой рынок готовых сервисов.
- Предиктивная аналитика работает с таблицами и временными рядами, а не с пикселями, хотя выход модели зрения часто становится для неё входом.
Откуда взялось
Точкой отсчёта современного этапа считают соревнование ImageNet Large Scale Visual Recognition Challenge 2012 года. Свёрточная сеть Алекса Крижевского, Ильи Суцкевера и Джеффри Хинтона показала ошибку top-5 в 15,3%. У второго места было 26,2%. Разрыв составил 10,9 процентного пункта.
Цифру 15,3% обычно приводят как результат одной сети. В оригинальной статье написано другое: столько дал усреднённый прогноз семи свёрточных сетей, пять из которых обучались на соревновательном срезе, а две предварительно на полном релизе ImageNet осени 2011 года. Обучение заняло пять-шесть суток на двух видеокартах NVIDIA GTX 580 с 3 ГБ памяти. Сам ImageNet насчитывал тогда более 15 млн размеченных изображений примерно в 22 000 категорий, а соревновательный срез состоял из 1,2 млн обучающих кадров в 1000 категорий.
Дальше рос масштаб разметки, а не только архитектуры. Датасет SA-1B, опубликованный в апреле 2023 года вместе с моделью Segment Anything, содержит более миллиарда масок на 11 млн изображений.
Как это устроено
Четыре типа задач
Классификация отвечает на вопрос «что на кадре». Детекция добавляет «и где»: модель возвращает прямоугольник вокруг каждого найденного объекта. Сегментация даёт маску по пикселям, то есть контур вместо рамки. Отслеживание связывает объект между соседними кадрами, чтобы один и тот же покупатель не был посчитан трижды за проход по залу.
Конвейер проекта
Порядок шагов устойчив. Постановка задачи и критерия приёмки, сбор кадров, разметка, обучение или дообучение готовой модели. Дальше замер на отложенной выборке, пилот на одной точке, вывод в прод, мониторинг качества. Встаёт конвейер обычно на разметке и на пилоте. Разметку недооценивают по срокам, а пилот впервые показывает модели реальный свет, реальные ракурсы и реальную грязь на объективе.
Сдвиг домена: почему цифра с теста не доезжает до зала
Явление называется сдвигом домена. Самый аккуратный публичный замер сделан в медицине: в работе Зеча и соавторов 2018 года свёрточные сети обучали искать пневмонию на 158 323 рентгенограммах из трёх клиник. Совместная модель двух больниц показала AUC 0,931 внутри своих данных и 0,815 на третьей клинике, модель одной больницы упала с 0,802 до 0,717. Авторы показали, что сеть частично опознавала саму больницу по служебным меткам и оборудованию, а не патологию на снимке.
Атаки и помехи
Модель зрения обманывается физическими предметами, а не только правкой файла. В работе Эйкхолта и соавторов 2017 года на дорожный знак «Стоп» наклеили чёрно-белые прямоугольники. В лаборатории это давало 100% целевых ошибок классификации. При съёмке с движущегося автомобиля ошибочными оказались 84,8% кадров.
Что делать на практике
- Сформулировать приёмку числом до начала работ, а не после демонстрации.
- Снимать обучающие кадры теми же камерами, в тех же точках и в те же часы, в которых система будет работать.
- Заложить разметку отдельной строкой бюджета и отдельным сроком.
- Развести цену двух ошибок. Ложное срабатывание и пропуск стоят разного, и рабочий порог выбирается под ту ошибку, которая дороже.
- Проверять пилот против ручного контроля на одной точке, сравнение двух вариантов ставится по правилам A/B-тестирования.
- Заложить мониторинг: сезон, ремонт в зале и новая партия камер сдвигают распределение кадров.
- Выяснить правовой режим до закупки оборудования, а не после монтажа.
Чем измеряют
- Точность и полнота (precision, recall) и их среднее гармоническое F1. База для любой задачи обнаружения.
- IoU (Intersection over Union) это доля пересечения предсказанной и настоящей рамки к их объединению. Порог IoU решает, засчитано ли попадание.
- AP и mAP. В COCO основная метрика усредняет AP по десяти порогам IoU от 0,50 до 0,95 с шагом 0,05, а AP при пороге 0,50 вынесен отдельно как метрика PASCAL VOC. Авторы COCO прямо пишут, что между AP и mAP различия не делают.
- FNMR и FMR для биометрического сравнения: доля непризнанных «своих» и доля признанных «чужих» при заданном пороге.
- CER и WER для распознавания текста: доля ошибочных символов и слов.
- Задержка и кадров в секунду. Метрика качества без метрики скорости не даёт принять систему на проходной.
Средняя цифра по датасету обманчива сама по себе. В COCO около 41% объектов мелкие, площадью меньше 32 на 32 пикселя, 34% средние и 24% крупные, поэтому общий AP всегда ниже, чем AP на крупных объектах.
Задача, метрика, цена промаха
| Задача | Метрика приёмки | Чем оборачивается промах |
|---|---|---|
| Распознавание товара на полке | AP при IoU 0,50 по каждому артикулу, доля пропущенных пустот | Пропуск: полка стоит пустой до следующего обхода сотрудника. Ложная тревога: лишний выход в зал. Публичного российского числа для цены пустой полки мы не нашли |
| Контроль возраста покупателя | FNMR и FMR при рабочем пороге, доля решений, переданных человеку | Розничная продажа алкогольной продукции несовершеннолетнему: административный штраф на юридических лиц от 300 до 500 тыс. рублей по части 2.1 статьи 14.16 КоАП РФ |
| Подсчёт трафика в зале | Отклонение от ручного подсчёта на контрольной смене, отдельно на входе и на выходе | Конверсия зала считается от неверной базы, а вслед за ней сдвигаются решения по графику смен и оценка рекламы в сквозной аналитике и в воронке продаж |
| Проверка документов | Доля полей, распознанных без единой ошибки, и CER по номеру и дате | Анкета уходит на ручную перепроверку. Одно автоматическое распознавание паспорта в Yandex Vision OCR стоит 0,71 рубля с НДС за запрос, ручной разбор тарифицируется временем сотрудника |
Биометрия и персональные данные в России
Часть 1 статьи 11 Федерального закона от 27.07.2006 № 152-ФЗ «О персональных данных» в редакции от 26.07.2026 связывает два условия сразу: сведения характеризуют физиологические и биологические особенности человека, на основании которых можно установить его личность, и используются оператором именно для установления личности субъекта. Обрабатывать такие сведения закон разрешает только при наличии согласия в письменной форме, кроме случаев из части 2 той же статьи.
Роскомнадзор опубликовал разъяснения по отнесению фото- и видеоизображений к биометрическим персональным данным 30.08.2013. В них прямо названы обе стороны границы. Изображения сотрудников и посетителей в системе контроля и управления доступом отнесены к биометрическим персональным данным. Фотография в личном деле работника, подпись и почерк к ним не отнесены. Рентгеновские и флюорографические снимки в истории болезни тоже не отнесены, «поскольку они не используются оператором (медицинским учреждением) для установления личности».
Обезличивание закон определяет отдельно, в пункте 9 статьи 3: это действия, после которых без дополнительной информации нельзя определить принадлежность данных конкретному человеку.
Часть 3 статьи 11 того же закона устанавливает, что предоставление биометрических персональных данных не может быть обязательным, за исключением случаев части 2. Там же сказано: оператор не вправе отказывать в обслуживании при отказе человека предоставить такие данные или дать согласие на обработку, если получение согласия по федеральному закону не обязательно.
Отдельный режим действует для единой биометрической системы. Федеральный закон от 29.12.2022 № 572-ФЗ в пункте 4 статьи 2 определяет её как государственную информационную систему «Единая система идентификации и аутентификации физических лиц с использованием биометрических персональных данных», оператором которой является организация, определённая Правительством РФ. Часть 4 статьи 3 перечисляет два вида размещаемых в ней данных: изображение лица человека, полученное с помощью фотовидеоустройств, и запись голоса, полученная звукозаписывающими устройствами. Часть 1 той же статьи называет круг пользователей системы: государственные органы, органы местного самоуправления, Банк России, банки и иные кредитные организации, организации финансового рынка, иные организации, индивидуальные предприниматели и нотариусы.
Съёмку как таковую регулирует ещё и Гражданский кодекс. Подпункт 2 пункта 1 статьи 152.1 ГК РФ в редакции от 10.06.2026 не требует согласия гражданина, когда его изображение получено при съёмке в местах, открытых для свободного посещения, или на публичных мероприятиях, за исключением случаев, когда такое изображение является основным объектом использования.
Санкции за обработку без письменного согласия там, где оно обязательно, установлены частью 2 статьи 13.11 КоАП РФ: на юридических лиц от 300 до 700 тыс. рублей. Повторное нарушение по части 2.1 той же статьи обходится юридическому лицу в 1-1,5 млн рублей.
Разбор конкретного проекта это работа юриста. Статья приводит нормы и не толкует их.
Частые ошибки
- Приёмка описана словами «чтобы работало», а не числом с метрикой и порогом.
- Обучающие кадры сняты одной камерой, а разворачивают систему на сорока разных.
- Один порог поставлен на все задачи сразу, хотя цена ошибок в них разная.
- Метрика измерена на той же выборке, на которой подбирали порог.
- Согласованность разметчиков между собой не проверялась вовсе.
- Биометрия закуплена раньше, чем выяснено, нужна ли она: обезличенный подсчёт посетителей и распознавание лиц это разные режимы обработки данных.
Ограничения и спорные места
Точность зависит от того, чьё лицо на кадре. Отчёт NIST NISTIR 8280 (декабрь 2019) прогнал 189 алгоритмов через 18,27 млн изображений, принадлежащих 8,49 млн человек. Главный вывод авторов: доля ложных совпадений между демографическими группами различается в десять и более чем в сто раз, а у женщин она выше, чем у мужчин, в 2-5 раз. Оговорка самих авторов важна не меньше вывода: они тестировали прототипы лабораторий, а не коробочные продукты, и данные собраны в 2019 году.
Сдвиг домена измерен на медицине, а не на ритейле. Числа Зеча и соавторов получены на рентгенограммах трёх клиник. Механизм переносится на любую съёмку. Конкретная величина падения не переносится.
Устойчивость к физическим атакам померена узко. 84,8% ошибочных кадров из работы Эйкхолта относятся к одному типу знака и конкретной обученной модели, а не к дорожным знакам вообще.
Цена ошибки названа в деньгах только там, где её называет норма права. Для распознавания товара на полке и подсчёта трафика рублёвого числа в статье нет намеренно. Публичных отраслевых замеров по России с описанной методикой мы не нашли. Придумывать их нельзя.
Отраслевые бенчмарки мерят не ваш зал. COCO собран из фотографий общего назначения. AP на нём говорит о сравнении моделей между собой и почти ничего о том, как модель отработает на вашей полке.
Что здесь быстро устаревает
- Цены на распознавание. Прайс Yandex Vision OCR меняется без предупреждения. Признак протухания: на странице тарифов другая цифра.
- Редакции норм. В статье использованы 152-ФЗ и КоАП РФ в редакции от 26.07.2026, ГК РФ от 10.06.2026, 572-ФЗ от 28.12.2024. Тексты сверены 11 сентября 2026 года. Признак протухания: новый федеральный закон о внесении изменений в соответствующий акт.
- Рекорды точности и названия моделей. Числа 2012 и 2023 годов останутся историческими. А вот текущий уровень моделей на открытых датасетах пересматривается несколько раз в год.
- Демографические различия из отчёта NIST. Отчёт вышел в декабре 2019 года, а программа FRVT продолжает публиковать обновления. Признак протухания: свежий отчёт NIST по той же теме.
- Положение о единой биометрической системе. Его утверждает Правительство РФ по части 3 статьи 3 572-ФЗ, то есть без правки самого закона. Признак протухания: новая редакция положения.
См. также
- Нейросеть
- Машинное обучение
- Датасет
- Дипфейк
- Генеративный ИИ
- Нейросети для бизнеса
- Автоматизация бизнес-процессов
- ИИ в маркетинге
Источники
- Krizhevsky A., Sutskever I., Hinton G. ImageNet Classification with Deep Convolutional Neural Networks // Advances in Neural Information Processing Systems 25 (NIPS 2012). papers.nips.cc
- Kirillov A. et al. Segment Anything. arXiv:2304.02643, 5 апреля 2023. arxiv.org
- Zech J. R. et al. Variable generalization performance of a deep learning model to detect pneumonia in chest radiographs: A cross-sectional study // PLOS Medicine, 6 ноября 2018. journals.plos.org
- Eykholt K. et al. Robust Physical-World Attacks on Deep Learning Visual Classification. arXiv:1707.08945, 27 июля 2017. arxiv.org
- Grother P., Ngan M., Hanaoka K. Face Recognition Vendor Test (FRVT) Part 3: Demographic Effects. NISTIR 8280, декабрь 2019. doi.org
- COCO. Detection Evaluation. cocodataset.org
- Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных» (ред. от 26.07.2026), ст. 3, ст. 11. consultant.ru
- Федеральный закон от 29.12.2022 № 572-ФЗ «Об осуществлении идентификации и (или) аутентификации физических лиц с использованием биометрических персональных данных…» (ред. от 28.12.2024), ст. 2, ст. 3. publication.pravo.gov.ru
- Гражданский кодекс РФ, часть первая (ред. от 10.06.2026), ст. 152.1. consultant.ru
- Кодекс РФ об административных правонарушениях (ред. от 26.07.2026), ст. 13.11, ст. 14.16. consultant.ru
- Роскомнадзор. Разъяснения по вопросам отнесения фото-, видеоизображений, дактилоскопических данных и иной информации к биометрическим персональным данным и особенностей их обработки, 30.08.2013. rkn.gov.ru
- Yandex Vision OCR. Правила тарификации. aistudio.yandex.ru