Не все чувства одинаково полезны для искусственного интеллекта, хотя бы потому, что он не видит мир так же, как человек. Когда мультимодальная модель получает текст, изображение и звук одновременно, она вынуждена решить: кому довериться больше. На практике выбор делается в пользу текста — независимо от того, насколько явно видео или аудио противоречат ему.
Это не баг, это особенность архитектуры. Современные мультимодальные большие языковые модели (MLLM) построены на основе трансформеров, где само-внимание работает над объединённым контекстом всех модальностей. Проблема в том, что текстовый поток подавляет другие сигналы. Модель видит картинку, слышит голос, но если в подсказке сказано «на столе лежит яблоко», а на видео — апельсин, она всё равно ответит «яблоко». Визуальный и аудиальный конфликт игнорируется.
Такая предвзятость проявляется не только в зарубежных системах вроде GPT-5 или Gemini 2.5 Pro. Российские решения сталкиваются с теми же ограничениями. Kandinsky 5.0, который пообещали значительно улучшить семантическое заземление, всё ещё чувствителен к конфликтующим текстовым подсказкам при генерации видео. GigaChat в конфигурации визуального понимания показывает аналогичный уклон — текст оказывается приоритетным источником истины даже при неоднозначном визуальном контексте.
Механизм конфликта модальностей
В основе проблемы лежит способ, которым мультимодальные модели интегрируют информацию из разных каналов. Обычно используется механизм кросс-модального внимания: токены изображения или звука проецируются в пространство текста, и модель вычисляет, какие визуальные паттерны соответствуют какому слову. Но этот процесс не симметричен.
Когда модальности расходятся — например, текст описывает сцену, а видео показывает другую — модель не пытается найти компромисс. Она либо игнорирует одну из них, либо выбирает «более надёжную». Исследования показывают, что визуальная модальность сохраняет стабильность при конфликте, но аудиальный канал резко теряет в точности. Это подтверждает правило: когда есть разногласия между видео и звуком, модель идёт на компромисс, жертвуя аудио. Текстовый сигнал оказывается наиболее устойчивым — возможно, потому что он явственно сформулирован, а не распознан из шума или артефактов сжатия.
Тепловая карта внимания модели Qwen2.5-Omni на 28-м слое демонстрирует этот эффект наглядно: большая часть внимания сосредоточена на текстовых токенах, даже если визуальный контекст содержит прямые опровержения. Это не случайность — архитектура просто устроена так, что текст задаёт каркас рассуждений, а другие модальности подстраиваются под него.
Методы выравнивания приоритетов
Исследователи предлагают несколько путей решения проблемы несимметричного внимания. Один из них — AutoSteer, метод динамической корректировки весов модальностей в процессе декодирования. Он не меняет архитектуру, но учит модель перераспределять внимание, если одна модальность явно противоречит другой. Другой подход — MC2 (Cross-Modal Calibration), который вводит ограничения согласованности в функцию потерь при обучении.
Есть также Bridging Ears and Eyes — фреймворк дистилляции, где представления аудио и видео выравниваются на уровне кодировщиков до того, как попадут к языковой модели. Результат: семантическое совпадение между модальностями растёт, а количество галлюцинаций падает. Тесты показывают улучшение точности ответов до 90,27% при нулевом обучении — то есть без переподготовки всей модели, только с дополнительными модулями для балансировки.
В России эти подходы тоже внедряются. GigaChat в последних версиях значительно улучшил механизм отказа от ответа: если модель понимает, что данные противоречивы и не может дать надёжный ответ, она это заявляет вместо того, чтобы выдумывать факты. В Kandinsky 5.0 экспериментируют со стратегиями регулировки веса текстовых и визуальных подсказок при генерации сложных мультимодальных композиций — например, если пользователь просит создать видео по описанию, которое явно расходится с тем, что показывает камера.
Тестирование на прочность: MMA-Bench
Для оценки устойчивости мультимодальных моделей к искажениям и несогласованности модальностей создан специализированный бенчмарк — MMA-Bench. Он включает тесты, где вводится преднамеренный конфликт между каналами: видео показывает одно действие, текст описывает другое, звук содержит третье. Задача модели — не галлюцинировать и не выбирать случайный ответ, а признавать неопределённость или указывать на расхождение.
На платформе Qwen2.5-Omni применение методов выравнивания модальностей дало существенный рост точности ответов по сравнению с базовой версией модели. Однако даже после улучшений модель всё ещё склонна игнорировать визуальные сигналы, если они противоречат тексту — и это остаётся зоной риска при реальных задачах вроде мониторинга безопасности или анализа видеопотоков в режиме реального времени.
Авторы отмечают, что тепловые карты внимания подтверждают: даже на глубоких слоях (28-й из 30) модель продолжает фокусироваться на тексте. Это не просто поверхностная проблема — она укоренена в способах вычисления представлений и агрегации признаков.
Отказ от ответа как защитный механизм
Модели, способные отказываться от ответа в условиях конфликта данных или недостатка информации, ведут себя значительно надёжнее. Такие схемы реализуются через модули мета-обучения: модель не пытается «угадать», что правильно, а оценивает уверенность в каждом источнике. Если визуальный и аудиальный каналы расходятся, а текст остаётся единственным согласованным сигналом — модель может выбрать его, но с оговоркой. Если же все три канала противоречат друг другу — она заявляет об ошибке.
Схемы декодирования AVCD и Fork-Merge позволяют снизить склонность к галлюцинациям без дорогостоящей переподготовки всей архитектуры. В базовой модели при конфликте модальностей часто возникает цепочка выдумок: модель берёт за основу текст, добавляет детали из видео, игнорирует звук, потом пытается всё соединить — и получает абсурд. Модель с механизмом отказа от ответа просто говорит «не могу ответить уверенно» или указывает на источник противоречия.
Эти подходы постепенно внедряются в российские решения. GigaChat в последних обновлениях значительно улучшил механизм отказа от ответа, а Kandinsky 5.0 экспериментирует со стратегиями регулировки весов модальностей. Это не панацея — проблема остаётся фундаментальной, но она становится управляемой.
Что дальше: от имитации к согласованию
Описанное исследование поднимает вопрос о природе понимания в мультимодальных системах. Корректная интеграция модальностей — это не просто оптимизация метрик точности или F1-меры, а создание систем, способных к непротиворечивому рассуждению при наличии неполных данных. Пока что MLLM скорее имитируют когнитивные способности, чем обладают ими: они работают по шаблону «текст задаёт правду, остальные подстраиваются», и это работает до поры до времени.
Российские модели неизбежно столкнутся с теми же ограничениями, что и зарубежные. Если вектор развития продолжит смещаться от добавления новых модальностей к строгим методам их синхронизации — мы получим поколение систем, способных к гораздо более надёжному восприятию. Если же продолжим просто «натаскивать» на больше данных без переосмысления архитектуры — галлюцинации при конфликте модальностей останутся проблемой.
До тех пор мультимодальные модели будут оставаться сложными, но несовершенными системами. Настоящий прорыв потребует не только новых методов обучения, но и формальной модели семантического согласования модальностей — способа сказать системе: «если видишь одно, слышишь другое и читаешь третье — что делать?». Пока такой модели нет.