Ещё лет десять назад, чтобы компьютер находил на фото, скажем, бракованные детали, целая команда инженеров месяцами собирала примеры и обучала систему под эту одну задачу. Сегодня во многих случаях хватает пары строк запроса, и всё работает почти сразу. Что же случилось за эти годы? Произошла тихая революция, и в этом уроке разберём её суть, без единой таблицы и заумного слова.
От узкого специалиста к эрудиту
Раньше каждая система зрения была узким специалистом. Хочешь распознавать кошек, собери тысячи фото кошек и обучи отдельную систему. Нужны ещё и машины, начинай заново с нуля. Это долго, дорого и негибко.
Перелом случился, когда вместо множества узких специалистов научились делать одного эрудита. Такую систему заранее показывают невообразимому количеству картинок из интернета, миллиардам, вместе с подписями и текстами рядом с ними. В итоге она впитывает не одну задачу, а общее представление о том, как вообще выглядит мир: что такое мех, колесо, лицо, тень, текстура. Такие большие, заранее обученные системы называют базовыми моделями (по-английски foundation models).
Аналогия. Раньше под каждую мелкую задачу нанимали отдельного узкого спеца: один умеет только считать яблоки, другой только читать номера машин. А базовая модель это начитанный эрудит, который уже много где побывал и много чего видел. Ему не нужно объяснять с нуля, достаточно намекнуть, что требуется. Аналогия хромает в том, что эрудит понимает смысл, а модель лишь очень хорошо угадывает по увиденному раньше.
Главный фокус: можно объяснить словами
Самое удивительное в новых системах вот что: с ними можно общаться почти как с человеком.
Поскольку модель училась на картинках вместе с текстами, она связала слова и изображения в одно целое. Поэтому ей можно сказать обычными словами «найди на фото человека на велосипеде» или «выдели всех собак», и она справится, даже если её специально под собак и велосипеды никто не учил.
Разберём на одном примере. Тебе нужно из тысячи отпускных фото достать все снимки с едой. Раньше пришлось бы вручную обучать распознаватель еды. Теперь ты описываешь словами, что ищешь, и модель приносит нужные кадры. Тот же фокус стоит за поиском по картинке и за созданием изображений по тексту: ты пишешь «рыжий кот в шляпе», а система рисует его. Это всё та же революция, картинки и слова теперь живут в одной голове.
Где это уже работает
Эта волна уже у тебя в кармане и в браузере.
Поиск по фото. Наводишь камеру на растение, незнакомый прибор или достопримечательность, и телефон говорит, что это. Под капотом, базовая модель, которая видела миллионы похожих картинок с подписями.
Умные галереи и магазины. Поиск «покажи все чеки» или «фото с моря» работает по описанию, а не по заранее заданным меткам. Магазины подбирают похожие товары по фотографии, которую ты загрузил.
Картинки по запросу. Сервисы, которые рисуют изображение по текстовому описанию, выросли ровно из этой связки слов и картинок.
Но честно про границы. У эрудита есть своя цена. Такие модели огромные, их обучение стоит дорого и тратит много энергии. Они уверенно ошибаются: могут выдать неверный ответ с той же интонацией, что и верный, и со стороны не отличишь. А ещё они учились на том, что лежит в интернете, а значит впитали и его мусор, и его перекосы. Поэтому там, где цена ошибки высока, ответ модели всё равно перепроверяют.
Итог
- Главная перемена последних лет: вместо множества узких систем под каждую задачу появились большие базовые модели, которые уже видели почти всё и узнают новое почти без обучения.
- Они учились на картинках вместе с текстом, поэтому понимают запрос обычными словами.
- Один и тот же сдвиг стоит и за поиском по фото, и за созданием картинок по описанию.
- Платим за это размером, ценой и аппетитом к данным и энергии.
- Модель может ошибаться уверенно и тихо, поэтому в важных задачах её ответы перепроверяют.