Learnly

Как внедрять компьютерное зрение в реальный бизнес

Распознавание лиц на телефоне выглядит так гладко, что кажется, будто внедрить компьютерное зрение где угодно это пара дней работы. На деле путь от красивой демонстрации до системы, которая надёжно работает в реальном магазине или на заводе, оказывается долгим и неочевидным. В этом уроке разберём, почему так и из чего вообще складывается настоящее внедрение.

Демо против реальности

Представь систему распознавания лиц, которая срабатывает в 99 случаях из 100. Звучит отлично. Но «один промах из ста» означает, что каждый сотый человек каждое утро не может войти, и для большой компании это десятки злых людей у двери ежедневно.

Вот в этом вся суть. Демонстрация показывает, как технология работает в удобных условиях: хороший свет, привычные лица, чистая камера. Реальность это бесконечные исключения: кто-то в капюшоне, кто-то против солнца, камера запотела, человек держит на руках ребёнка. Главная работа при внедрении это не запустить технологию, а укротить тот самый неудобный процент, где она спотыкается.

Аналогия. Это как нанять отличника, который блестяще решает задачи из учебника. В живом, шумном офисе он сперва теряется: задачи приходят не такими аккуратными, как в учебнике. Его нужно доучить на ваших реальных случаях и подстраховать на то время, пока он осваивается. Аналогия хромает в том, что человек схватывает новое сам, а систему приходится дообучать вручную на новых примерах.

Из чего складывается внедрение

Пройдём по одному примеру. Магазин хочет камерой считать, сколько людей стоит в очереди к кассе, чтобы вовремя открывать новую.

Сначала, свои данные. Готовая модель видела толпы вообще, но не вашу конкретную камеру под потолком, ваш свет и ваши стеллажи. Нужно собрать примеры именно с этой камеры и показать модели, что считается очередью, а что люди, идущие мимо.

Потом, неудобные случаи. Что делать с человеком, который остановился поговорить, но не стоит в очереди? С коляской, которую видно то как одного человека, то как двух? Эти правила приходится продумывать и проверять отдельно.

Дальше, поведение при сомнении. Надо решить заранее: если система не уверена, она молчит, переспрашивает или зовёт человека. В ответственных местах это важнее, чем точность в идеальных условиях.

И, наконец, цена и приватность. Камеры, вычисления, хранение записей, согласие людей на съёмку, требования закона. Всё это часть проекта, а не мелкая деталь в конце.

Где это видно со стороны

Ты наверняка замечал и удачные, и кривые внедрения.

Кассы самообслуживания. Когда касса не может опознать товар и зовёт сотрудника, ты видишь ровно тот самый «неудобный процент» в действии.

Контроль качества на производстве. Камера на конвейере отбраковывает детали с дефектом. Чтобы это заработало, завод месяцами копит фотографии именно своих дефектов, а не дефектов вообще.

Медицина. Здесь компьютерное зрение почти всегда работает как помощник, а не замена: подсвечивает врачу подозрительное место, но решение остаётся за человеком. Это сознательный выбор, а не слабость технологии.

И честно про подводные камни. Чаще всего внедрения спотыкаются не о саму технологию, а о данные, которые не похожи на реальность, о забытые исключения и о чрезмерное доверие к машине. Система, которой слепо верят, опаснее той, которую держат под присмотром.

Итог

  • Трудность не в том, чтобы запустить компьютерное зрение, а в том, чтобы оно надёжно работало в реальных, неидеальных условиях.
  • Демонстрация это удобный случай, а реальная ценность и боль прячутся в том самом проценте промахов.
  • Готовую модель почти всегда дообучают на ваших собственных данных, под вашу камеру и обстановку.
  • Заранее решить, что система делает при сомнении, важнее, чем выжать максимум точности в идеале.
  • Внедрения чаще рушатся из-за данных, забытых исключений и слепого доверия, а не из-за самой технологии.