В материале
Коротко
Главное
- Сервис визуального поиска Google Lens на базе моделей Gemini превысил отметку 90% точности для совокупности типовых запросов по местам, товарам и растениям при объеме свыше 25 млрд обращений в месяц.
- Научные эксперименты подтверждают: при распознавании точек интереса сопутствующий текст публикации дает алгоритмам более надежные ориентиры, чем исключительно визуальные признаки изображения.
- Объединение графических эмбеддингов с текстовым контекстом повышает качество классификации локаций до макро-F1 47,21, ощутимо опережая чисто текстовые модели.
- Синтетические иллюстрации перехватывают внимание пользователей без перехода на сайт, тогда как подлинные фотографии реальных объектов продолжают приводить прямой поисковый трафик.
01
Поисковый сценарий меняется: туристы наводят камеру вместо ввода текста
По данным аналитиков агентства Adfirm за май 2026 года, ежемесячный объем запросов в Google Lens превысил 25 млрд. При этом интеграция мультимодального стека Gemini подняла долю релевантных ответов выше 90% для типовых запросов в категориях товаров, мест и растений, тогда как замеры 2022 года показывали точность на уровне 60–70%. Камера устройства берет на себя роль первичного поискового фильтра непосредственно на улице.1
02
Почему алгоритмам недостаточно одной только фотографии
Компьютерное зрение сталкивается со сложностями при попытке идентифицировать локацию исключительно по визуальным параметрам. В исследовании Луиса Лукаса и его коллег, опубликованном издательством Springer в декабре 2022 года, ученые протестировали распознавание популярных точек интереса по массивам социальных сетей с помощью модели CLIP. Эксперименты показали: текстовое сопровождение публикации оказывается более точным и информативным ориентиром для модели, чем изолированные визуальные признаки.2
Исследователи Шеффилдского университета Данаэ Санчес Вильегас и Николаос Алетрас подтвердили эту закономерность на задаче классификации типов точек интереса по восьми категориям. Совместное использование текстовых признаков и изображений позволило достичь показателя макро-F1 47,21, что достоверно превзошло результаты изолированных текстовых классификаторов. Для команд отелей и музеев отсюда следует рабочий вывод: изображение передает визуальные характеристики строения, но коммерческое и функциональное назначение объекта нейросеть считывает из текстового окружения.3
03
Имена файлов, текстовый контекст и подлинность кадров
Поскольку поисковые системы связывают графику с сущностями через семантику, базовые правила оформления файлов сохраняют решающее значение. В руководстве Digital Applied за февраль 2026 года ключевыми сигналами названы понятные имена файлов и содержательный атрибут alt. Вместо стандартных технических кодов авторы рекомендуют информативные названия: например, blue-running-shoes-mens-size-10.webp. По аналогии, для гостиницы или галереи логично использовать файлы с явным указанием названия и адреса, чтобы алгоритмы считывали контекст еще до полного парсинга страницы.5
- Описательные имена файлов: отказ от автоматических номеров камеры в пользу понятных слов с обозначением объекта.
- Информативный атрибут alt: добавление точного описания кадра без поискового спама для помощи скринридерам и поисковым роботам.
- Структурированные данные: применение разметки Schema.org со свойством image, что по данным Digital Applied открывает путь к расширенным результатам поиска.
- Смысловой контекст страницы: как отмечает агентство Tangence, текст вокруг снимка и заголовки разделов помогают системам определить тему изображения.
В июле 2026 года компания Google обновила Google Images, добавив генерацию картинок моделью Nano Banana с маркировкой SynthID. Аналитики PikaSEO подчеркнули, что искусственные изображения способны удовлетворять общие визуальные запросы без перехода на сайты. При этом пользователи продолжают переходить по ссылкам, когда ищут подлинные и заслуживающие доверия кадры. В туризме это дает четкий ориентир: фотографии реальных зданий и интерьеров выигрывают у рендеров и типовой стоковой графики.6
04
Проверочные шаги для туристических проектов и границы применимости данных
При оценке этих выводов важно учитывать ограничения доказательной базы. Академические работы Шеффилдского университета и публикация Springer проводились на пользовательских публикациях из социальных сетей, чья специфика отличается от официальных сайтов туристических компаний. Кроме того, показатель точности Google Lens выше 90% из отчета Adfirm охватывает общую группу типовых запросов по товарам, местам и растениям. Для объектов в плотной исторической застройке с похожими фасадами надежность идентификации может существенно колебаться.123
Проверяемая основа
Источники
- 01AdfirmVisual search optimization in 2026: ranking in Google Lens
Опубликовано 21 мая 2026 · Проверено 21 сентября 2026
- 02SpringerCity Classifier: Multimodal travel POI recognition
Опубликовано 20 декабря 2022 · Проверено 21 сентября 2026
- 03University of Sheffield via arXivPoint-of-Interest Type Prediction using Text and Images
Проверено 21 сентября 2026
- 04TangenceImage SEO Guide for Google Images, Lens and AI Search
Опубликовано 9 сентября 2026 · Проверено 21 сентября 2026
- 05Digital AppliedImage SEO 2026: Visual Search Optimization Guide
Опубликовано 19 февраля 2026 · Проверено 21 сентября 2026
- 06PikaSEOGoogle Images AI Redesign 2026: SEO Impact and Playbook
Опубликовано 15 июля 2026 · Проверено 21 сентября 2026



