Распознавание лиц на телефоне выглядит так гладко, что кажется, будто внедрить компьютерное зрение где угодно это пара дней работы. На деле путь от красивой демонстрации до системы, которая надёжно работает в реальном магазине или на заводе, оказывается долгим и неочевидным. В этом уроке разберём, почему так и из чего вообще складывается настоящее внедрение.
Демо против реальности
Представь систему распознавания лиц, которая срабатывает в 99 случаях из 100. Звучит отлично. Но «один промах из ста» означает, что каждый сотый человек каждое утро не может войти, и для большой компании это десятки злых людей у двери ежедневно.
Вот в этом вся суть. Демонстрация показывает, как технология работает в удобных условиях: хороший свет, привычные лица, чистая камера. Реальность это бесконечные исключения: кто-то в капюшоне, кто-то против солнца, камера запотела, человек держит на руках ребёнка. Главная работа при внедрении это не запустить технологию, а укротить тот самый неудобный процент, где она спотыкается.
Аналогия. Это как нанять отличника, который блестяще решает задачи из учебника. В живом, шумном офисе он сперва теряется: задачи приходят не такими аккуратными, как в учебнике. Его нужно доучить на ваших реальных случаях и подстраховать на то время, пока он осваивается. Аналогия хромает в том, что человек схватывает новое сам, а систему приходится дообучать вручную на новых примерах.
Из чего складывается внедрение
Пройдём по одному примеру. Магазин хочет камерой считать, сколько людей стоит в очереди к кассе, чтобы вовремя открывать новую.
Сначала, свои данные. Готовая модель видела толпы вообще, но не вашу конкретную камеру под потолком, ваш свет и ваши стеллажи. Нужно собрать примеры именно с этой камеры и показать модели, что считается очередью, а что люди, идущие мимо.
Потом, неудобные случаи. Что делать с человеком, который остановился поговорить, но не стоит в очереди? С коляской, которую видно то как одного человека, то как двух? Эти правила приходится продумывать и проверять отдельно.
Дальше, поведение при сомнении. Надо решить заранее: если система не уверена, она молчит, переспрашивает или зовёт человека. В ответственных местах это важнее, чем точность в идеальных условиях.
И, наконец, цена и приватность. Камеры, вычисления, хранение записей, согласие людей на съёмку, требования закона. Всё это часть проекта, а не мелкая деталь в конце.
Где это видно со стороны
Ты наверняка замечал и удачные, и кривые внедрения.
Кассы самообслуживания. Когда касса не может опознать товар и зовёт сотрудника, ты видишь ровно тот самый «неудобный процент» в действии.
Контроль качества на производстве. Камера на конвейере отбраковывает детали с дефектом. Чтобы это заработало, завод месяцами копит фотографии именно своих дефектов, а не дефектов вообще.
Медицина. Здесь компьютерное зрение почти всегда работает как помощник, а не замена: подсвечивает врачу подозрительное место, но решение остаётся за человеком. Это сознательный выбор, а не слабость технологии.
И честно про подводные камни. Чаще всего внедрения спотыкаются не о саму технологию, а о данные, которые не похожи на реальность, о забытые исключения и о чрезмерное доверие к машине. Система, которой слепо верят, опаснее той, которую держат под присмотром.
Итог
- Трудность не в том, чтобы запустить компьютерное зрение, а в том, чтобы оно надёжно работало в реальных, неидеальных условиях.
- Демонстрация это удобный случай, а реальная ценность и боль прячутся в том самом проценте промахов.
- Готовую модель почти всегда дообучают на ваших собственных данных, под вашу камеру и обстановку.
- Заранее решить, что система делает при сомнении, важнее, чем выжать максимум точности в идеале.
- Внедрения чаще рушатся из-за данных, забытых исключений и слепого доверия, а не из-за самой технологии.