От поиска похожих картинок к диалогу с ИИ по фото: специалист по поисковой оптимизации Demis Group, Фёдорова Юлия, рассказывает, как мультимодальные модели (VLM) меняют логику видимости, трафика и доверия, и почему оптимизация изображений теперь требует не только технической грамотности, но и стратегического мышления.
До 2024 года поиск по изображениям в Яндексе оставался инструментом ретроспективного сравнения: пользователь загружал фото – система находила визуально схожие объекты. Это был поиск по внешнему признаку, а не по смыслу. Он работал хорошо для задач вроде «найти ту же футболку» или «определить модель смартфона», но не позволял задавать вопросы о содержании самого изображения.
Всё изменилось с запуском мультимодальных нейроответов в рамках «Поиска с Алисой» и обновлением «Умной камеры» в мобильном приложении Яндекса (осень 2024 – весна 2025). Теперь пользователь может сфотографировать объект, например, натюрморт в музее, неизвестное растение в лесу, техническое устройство на производств, и спросить:
-
«Что это?»
-
«Для чего служит?»
-
«Что символизируют элементы картины?»
Это уже диалог с ИИ на основе визуального контекста. Система сама интерпретирует смысл, опираясь на объединенную модель зрения и языка (VLM).
Такой сдвиг кардинально меняет поведенческие паттерны:
-
Пользователи все чаще начинают взаимодействие с брендом не через текстовый запрос, а через фото.
-
Визуальные запросы становятся первичным точками входа, особенно в e-commerce, туризме, образовании и B2B.
-
Доля «нулевых кликов» растет: если ИИ дает развернутый ответ прямо в интерфейсе (включая название товара, цену, назначение), переход на сайт становится опциональным.
Ключевое отличие новой парадигмы – переход от сопоставления к пониманию.
Именно поэтому SEO для изображений теперь часть мультимодальной стратегии цитируемости, где каждое фото должно быть не просто найдено, а понято и процитировано ИИ как достоверный источник информации.
Технология VLM в Яндексе: архитектура и принципы работы
Мультимодальный поиск в Яндексе – это результат интеграции визуальной лингвистической модели (VLM), системы, способной одновременно обрабатывать визуальную и текстовую информацию, чтобы сформировать осмысленный, контекстуально точный ответ. В отличие от классических систем компьютерного зрения, которые ограничиваются детекцией объектов («это чашка»), или языковых моделей (LLM), оперирующих только текстом, VLM объединяет оба мира, что делает ее ключевым компонентом «Нейро» и «Умной камеры».
Архитектура Яндекс.VLM
Согласно публичным данным и техническим презентациям Яндекса (2024–2025), архитектура VLM состоит из трех ключевых компонентов:
-
Энкодер изображений – основан на Vision Transformer (ViT) или глубокой CNN-сети. Он преобразует пиксели изображения в плотное векторное представление (embedding), фиксируя не только форму и цвет, но и семантические признаки: «кофейная чашка», «музейный натюрморт», «технический узел».
-
Языковая модель (LLM) – в роли выступает YandexGPT 3+. Она генерирует естественный язык, но не из внутренней памяти, а на основе внешних источников и визуального контекста.
-
Адаптер (projection layer) – нейросетевой мост между двумя модальностями. Именно он проецирует визуальные эмбеддинги в семантическое пространство языковой модели, позволяя LLM «понимать» содержание изображения так, как если бы оно было описано словами.
Такой подход позволяет модели не просто сказать «на фото кофе», а ответить на вопрос пользователя:
«Для чего служит этот предмет?» → «Это керамическая чашка для горячих напитков, обычно используется для кофе или чая».
От распознавания к интерпретации
Ключевое преимущество VLM – контекстуальная интерпретация. Например:
-
Если пользователь фотографирует растение и спрашивает «Это съедобно?», модель не просто называет вид, а добавляет ботаническую справку и предостережение (если применимо).
-
При съемке картины в музее запрос «Что символизируют лимоны на этом натюрморте?» приводит к ответу, основанному на историко-культурных данных, а не на визуальной классификации.
Это особенно важно для e-commerce: VLM может анализировать фото товара и автоматически генерировать SEO-описание с указанием материала, функций и применения – что уже внедрено в внутренние инструменты Яндекс Маркета.
Ограничения и вызовы
Несмотря на мощь, современные VLM все еще сталкиваются с трудностями:
-
Низкокачественные изображения (размытость, плохое освещение) снижают точность анализа.
-
Отсутствие текстового контекста на странице делает невозможным связь изображения с брендом или ценой.
-
Сложные сцены (например, переполненная полка в магазине) могут привести к ошибочной идентификации объекта.
Поэтому успех в мультимодальном поиске зависит не только от алгоритмов Яндекса, но и от того, насколько сайт помогает модели «понять» изображение – через структурированные данные, качественные фото и семантическое окружение.
Новые возможности «Умной камеры» и нейроответов: практические сценарии
С выходом обновленной «Умной камеры» в мобильном приложении Яндекса (осень 2024 – весна 2025) визуальный поиск превратился в интерактивного ассистента, способного не только распознавать объекты, но и отвечать на вопросы о них в естественном языке. Эта функция, построенная на той же VLM-архитектуре, что и «Нейро» в десктопном поиске, открывает десятки новых пользовательских сценариев – и, соответственно, точек входа для брендов.
Как это работает на практике
Пользователь наводит камеру на:
-
Растение в парке → спрашивает: «Что это за цветок? Ядовит ли он?» → получает ботаническое описание, уровень токсичности и советы по уходу.
-
Экспонат в музее → спрашивает: «Кто художник? Что символизируют лимоны на этой картине?» → получает историко-культурный контекст.
-
Техническое устройство на производстве → спрашивает: «Для чего эта деталь? Где купить аналог?» → получает функциональное описание и ссылки на поставщиков.
-
Упаковку товара в магазине → спрашивает: «Какие аналоги дешевле? Есть ли отзывы?» → получает сравнение цен и цитаты из обзоров.
Во всех этих случаях ИИ не просто идентифицирует объект – он формирует нарратив, опираясь на структурированные данные из открытых источников. И если ваш сайт содержит авторитетную, хорошо размеченную информацию о растениях, картинах, промышленных компонентах или товарах – он может стать источником цитирования в таком ответе.
Сценарии по отраслям:
|
Ниша |
Пример использования |
Возможность для бренда |
|
E-commerce |
Покупатель сканирует упаковку конкурента и спрашивает: «Есть ли органическая альтернатива?» |
Ваш продукт может быть предложен как решение – если его фото и описание оптимизированы под VLM и размещены с микроразметкой Product + ImageObject. |
|
Туризм / Музеи |
Турист фотографирует архитектурный элемент и спрашивает: «Кто построил этот собор?» |
Официальный сайт музея или гид-сервис может быть процитирован – при наличии качественных изображений с подписями и исторической справкой. |
|
Образование |
Студент сканирует формулу на доске и спрашивает: «Что означает этот символ?» |
Учебный портал с размеченными FAQ и научными пояснениями может попасть в ответ. |
|
B2B / Промышленность |
Инженер фотографирует запчасть без маркировки и спрашивает: «Подходит ли она к насосу X?» |
Каталог с техническими чертежами, совместимостью и структурированными спецификациями становится источником доверия. |
Почему одни сайты попадают в ответы, а другие – нет
Анализ нейроответов показывает, что ИИ выбирает источники, которые:
-
Содержат изображение, максимально близкое к запросу (по визуальным признакам).
-
Окружены текстом, прямо отвечающим на вопрос (не общие слова, а конкретика: «лимон в натюрмортах XVII века символизировал богатство и тщетность земных благ»).
-
Имеют микроразметку (ImageObject, Question, Answer, FAQPage).
-
Принадлежат авторитетным доменам (часто – .edu, .gov, известные СМИ, официальные сайты).
Оптимизация изображений под мультимодальный поиск: технический блок
В эпоху VLM техническая оптимизация изображений становится фундаментом видимости в мультимодальных ответах. Если изображение не проиндексировано корректно или загружается медленно, оно исключается из пула источников для генеративных ответов в «Нейро» и «Умной камере». Ниже – ключевые технические требования, которые напрямую влияют на шансы попасть в AI-цитирование.
Форматы, качество и скорость загрузки
VLM-модели Яндекса требуют четких, хорошо освещенных изображений с высоким разрешением. Однако скорость загрузки остается критичной для UX и индексации:
-
Используйте современные форматы: WebP и AVIF обеспечивают на 30–50% меньший размер при том же качестве по сравнению с JPEG/PNG.
-
Оптимизируйте сжатие: баланс между качеством и весом – целевой размер для hero-изображения: ≤300 КБ при разрешении ≥1200px по ширине.
-
Адаптивные изображения: используйте < picture > с srcset, чтобы подавать оптимальный размер под устройство.
Медленная загрузка = низкий сигнал качества → снижение вероятности цитирования.
Специфические требования Яндекс Маркета (с мая 2025)
Для e-commerce-проектов, интегрированных с Яндекс Маркетом, введены обязательные рекомендации:
-
Вертикальный формат 3×4 (например, 1200×1600 px) вместо квадратного.
-
Белый или нейтральный фон без посторонних объектов.
-
Товар должен занимать ≥85% площади кадра.
Эти правила стандартизируют входные данные для VLM, что повышает точность распознавания и генерации описаний.
Инструменты диагностики
-
Яндекс Вебмастер → «Анализ сайта» → «Изображения»:
Показывает, какие картинки проиндексированы, есть ли ошибки в alt/title, как часто они появляются в выдаче. -
PageSpeed Insights / Lighthouse:
Анализирует эффективность форматов и сжатия. -
Семантический аудит через эмбеддинги:
Сравните векторное представление вашего изображения (через CLIP API) с запросами вроде «кофейная чашка» – чем ближе совпадение, тем выше шанс попасть в релевантный ответ.
Контентная оптимизация изображений: от alt-текста к визуальному E-E-A-T
Если техническая подготовка изображения обеспечивает его индексируемость, то контентная оптимизация определяет его цитируемость в мультимодальных ответах Яндекса.
Alt-текст: не ключи, а семантическое ядро
Традиционный подход – заполнение alt списком ключевых слов («купить чашку кофе керамика ручная работа») – теперь работает против вас. VLM интерпретирует такой текст как спам или низкокачественный контент. Вместо этого alt должен быть естественным, фактологичным и структурированным:
Правильно:
< img alt="Керамическая чашка для кофе с ручной росписью 'Морская волна', объем 300 мл, произведена в мастерской Artisan Ceramics (Санкт-Петербург)" >
Этот alt:
-
содержит конкретные данные (объем, название коллекции);
-
указывает источник происхождения (мастерская, город);
-
использует естественный язык, понятный как человеку, так и ИИ.
Такой подход напрямую усиливает E-E-A-T (Experience, Expertise, Authoritativeness, Trustworthiness) – критерий, который Яндекс явно использует при отборе источников для «Нейро».
Роль окружающего текста и подписей
VLM анализирует не только само изображение, но и его семантическое окружение:
-
заголовок (< h1 >–< h3 >), в котором упоминается объект;
-
подпись под фото (< figcaption > или < p class="caption" >);
-
основной текст страницы, описывающий функции, историю, применение.
Как фотографировать для VLM
Не все изображения одинаково «понятны» нейросети. Чтобы повысить шансы на корректную интерпретацию:
-
Показывайте объект целиком – без обрезки важных деталей.
-
Используйте нейтральный фон – особенно для товаров (требование Яндекс Маркета с 2025 г.).
-
Делайте крупные планы ключевых элементов – например, роспись на чашке, логотип, швы.
-
Добавляйте контекстные сцены – чашка в руке, на столе с кофе, в подарочной упаковке.
VLM лучше распознает объекты в естественной среде, но при этом требует четкой фокусировки на основном предмете.
Типичные ошибки, убивающие видимость
-
Пустой или шаблонный alt: alt="изображение" или alt="товар".
-
Отсутствие подписей и заголовков: фото «висит» в тексте без пояснений.
-
Несоответствие изображения и текста: на фото – чашка, в тексте – общие слова о «керамике» без привязки к объекту.
-
Использование стоковых фото без указания происхождения: VLM не может подтвердить достоверность.
Все эти ошибки сигнализируют модели: «этот источник не заслуживает доверия» – и исключают вас из пула цитирования.
Заключение
Мультимодальность Яндекса – это фундаментальный сдвиг в логике поисковой видимости. Изображение становится самостоятельной точкой входа, через которую пользователь начинает диалог с ИИ о мире вокруг него. В 2026 году бренд, чье фото не оптимизировано под VLM (Visual Language Model), рискует остаться невидимым даже при идеальном текстовом SEO.
Ключевой вывод прост: чтобы быть цитируемым в нейроответах, нужно говорить на языке, понятном одновременно человеку и машине.
Теги:
