Ложная уверенность в цифрах
В 2018 году исследователи Массачусетского технологического института изучили распространение новостей в Twitter за десятилетие. Они проанализировали примерно 126 тысяч сообщений и сделали вывод: ложные истории ретвитили на 70% чаще правдивых, а правде требовалось в шесть раз больше времени, чтобы дойти до одинакового числа людей.
Проблема не в том, что нейросеть придумала фейк. Проблема в том, что она подхватила уже существующий миф и начала его распространять как факт. Языковая модель за минуты может собрать тезисы, найти источники и оформить текст. Она видит, что утверждение повторяется на нескольких сайтах, что рядом стоят цифры и имена экспертов. И тогда она пишет это в ответе с уверенностью, даже если этот факт изначально был ошибочным.
Скучная ошибка остаётся незаметной. Яркая же становится вирусной: её обсуждают отдельно от текста, а опровержение уже не успевает догнать первую волну. В эпоху искусственного интеллекта риск усиливается. Если пользовательская база или обучающие данные содержат ложь, модель начинает её использовать как сырьё.
Граница ошибки не всегда очевидна
Большинство оценок сегодня даёт общий вердикт для всего ответа: «правильно» или «неправильно». Но проблема часто кроется в одном-двух словах внутри длинного текста. Команда PsiloQA построила автоматизированный конвейер, который фокусируется не на грубой ложности, а на точных фрагментах, где модель ошиблась.
Конвейер работает так: сначала GPT-4o по фрагментам Википедии создаёт вопросы и эталонные ответы разной сложности. Затем десятки разных моделей отвечают на те же вопросы без контекста — это провоцирует уверенные, но необоснованные утверждения. После этого та же модель сравнивает гипотезу с эталоном и помечает участки текста, где есть несоответствие. В финале удаляются странные вопросы, отказы отвечать и технические огрехи разметки.
В итоге получается корпус реальных ошибок на уровне отдельных слов или коротких фраз — спанов. Часто встречаются галлюцинации длиной до нескольких слов: «Blackpool Stadium» вместо Bloomfield Road, «Amanita rubescens-Team» вместо Russula font-queri. Ошибка в одном токене меняет смысл всего факта.
Важно видеть эти ошибки на уровне фрагментов, а не только по вердикту «правильный/неправильный». В продуктивных сценариях это критично: пользователь читает длинный ответ и может пропустить одну фразу, где нейросеть уверенно сказала неправду.
Три подхода к поиску ошибок
Команда сравнивала три класса методов оценки качества генерации текстовых моделей. Быстрые меры неопределённости по токенам — это простые алгоритмы, которые пытаются уловить неуверенность модели. Они дают средние результаты: ловят часть проблем, но плохо держат точные границы ошибки.
Самыми точными оказались энкодеры, специально обученные на датасетах с разметкой. В работе обучали ModernBERT и многоязычный mmBERT. Последний оказался лучшим в 12 из 14 языков по обеим ключевым метрикам: площади под кривой precision–recall и пересечению спанов (Intersection over Union). Это подтверждает, что предобучение на многих языках помогает видеть ошибки даже там, где данных мало.
Подходы с внешними знаниями и LLM-верификаторами иногда дают высокий показатель точности, но страдают по IoU — сложно аккуратно очертить место ошибки. Модель может сказать, что ответ неверный, но указать слишком широкую область или пропустить часть проблемы внутри длинного ответа.
Мультиязычное обучение работает лучше, чем учить отдельную модель на каждый язык. Один mmBERT переносится надёжнее и на близкородственные, и на отличные по письму языки. Ещё важнее — перенос за пределы самого датасета. Модель, обученная только на английской части PsiloQA, существенно обогнала аналоги на сопоставимых бенчмарках вроде Mu‑SHROOM и HalluEntity.
Стоимость разметки и масштабирование
Получение качественной разметки реальных ошибок стоит денег. Автоматическая разметка PsiloQA обошлась примерно в 535 долларов. Это по сравнению с 3000 на сопоставимый объём ручной аннотации в английской разметке RAGTruth. Разница существенная, особенно если речь о многоязычных проектах или задачах, где данных мало.
Но автоматизация не всегда дешевле, чем ожидают. Если нужно найти ошибки только по одному языку, ручная работа может быть быстрее и точнее. Если же цель — покрыть 14 языков сразу, то мультиязычные модели типа mmBERT выигрывают за счёт переноса знаний.
Важно также помнить, что аннотатор в PsiloQA один и автоматический. Фокус сделан только на ответах из Википедии. Но даже такие ограничения говорят о том, что подход практичен. Качественные результаты и хорошая адаптация к разным доменам показывают, что метод уже сегодня можно использовать вне исследований.
Реальные кейсы: когда факты не спасают от ошибки
CNET в 2023 году опубликовало серию материалов, написанных с помощью ИИ-инструментов. Редакторы давали модели наброски, но финальные тексты проверяли недостаточно глубоко. После того как к одной из статей появились вопросы, фактчекинг начался всерьёз и выявил проблемы в 41 из 77 материалов.
В текстах была не столько прямая ложь, сколько ошибки рассуждений: модель брала реальные финансовые понятия и делала из них неверные практические выводы. Такие промахи сложнее заметить, чем выдуманную цифру или несуществующий источник. Первые материалы «проскочили» незаметно, а потом пришлось исправлять большую часть контента.
Ещё один пример — AI Overviews в поиске Google. Исследователи изучили 55 393 трендовых запроса и разложили ответы на 98 020 атомарных утверждений. По их оценке, 11% этих утверждений не поддерживались процитированными страницами. Качество источника и точность пересказа оказались независимыми вещами. Модель могла найти источник, но неверно передать из него мысль или добавить лишнюю деталь.
В таких случаях хороший источник рядом с ответом ещё не гарантирует правдивость вывода. Модели часто правильно называют объект, но неверно понимают его статус в задаче: что можно делать с ним, где применимо, какие есть ограничения. Если модель дала ссылку и по ней мы нашли нужное утверждение, это ещё не значит, что утверждению можно верить без проверки контекста.
Как редактору работать с AI-текстом
Проверка AI-генерации начинается не с фактов, а с логики их сборки. Сначала нужно понять жанр и статус источника: это официальный документ, исследование, медиа, блог или форум? Автор говорит как эксперт, очевидец, пользователь или шутник? Факт, мнение, реклама, инструкция, кейс или личный опыт? Есть ли у источника заинтересованность?
Мини-чек-лист для редактора: не выглядит ли факт слишком «драматически хорошим» или «плохим»? Как потенциально отреагируют люди, которые разбираются в теме глубже редакции? Что произойдёт, если именно этот факт начнут обсуждать отдельно от статьи?
Не принимай сарказм или пользовательскую шутку за рекомендацию. Не давай модели формально логичное решение, которое неприменимо в реальности. Например, если нейросеть предложила UTM-метку для контента, который появляется в AI-выдаче, это технически невозможно без ручной разметки. Модель просто хорошо выполнила плохо поставленную задачу и достроила схему там, где нужно было уточнить ограничение.
Модели все реже грубо придумывают факты и всё чаще находят информацию, которая действительно где-то есть. Но они пока не всегда понимают разницу между реальной инструкцией от эксперта и форумным троллингом, шуткой или устаревшим советом. Совпадение ответа с чем-то в интернете ещё не делает утверждение пригодным для деловой статьи.
Итоги: что значит качество генерации
Оценка качества текстовых моделей по логическим ошибкам — это не только про метрики типа AP и IoU. Это про то, насколько модель способна сохранять последовательность в рассуждениях, правильно трактовать статус источников и не допускать ошибок на уровне отдельных фраз.
Быстрые методы неопределённости работают, но они плохо держат границы ошибки. Энкодеры обученные на размеченных данных показывают лучшие результаты. Мультиязычное обучение помогает переносить знания между языками, что важно для глобальных проектов. LLM-верификаторы иногда дают высокий AP, но страдают по IoU — сложно аккуратно очертить место ошибки внутри длинного текста.
Важно также понимать, что стоимость автоматической разметки может быть ниже ручной, особенно если речь о многоязычных задачах. Но качество аннотации и глубина понимания контекста остаются критичными факторами. Модель может найти источник, но неверно передать из него мысль или добавить лишнюю деталь.
Качество генерации — это не только точность фактов, но и способность модели сохранять логику в условиях неполных данных. В эпоху нейросетей редактору нужно больше времени на проверку не столько фактов, сколько смысловой связности ответа. Яркий фейк опасен не только как разовая публикация: он может стать сырьём для будущих ошибочных нейроответов.