ClaudeLab

Галлюцинации нейросети: как проверить ответ до клиента

Опубликовано Aug 14, 202617 мин чтенияBeginner
Что вы узнаете
  • Почему модель выдумывает и почему уверенный тон ничего не значит
  • Сколько ошибок дают модели в замерах и почему это нижняя граница
  • Шесть приёмов проверки ответа до того, как он уйдёт клиенту
  • Тестовый набор вопросов: три класса, которые ловят выдумку
  • Пункты в ТЗ подрядчику, без которых бота нельзя принимать
Новичок
10просмотров

Галлюцинации нейросети выглядят ровно так же, как верный ответ. Бот называет клиенту скидку, которой нет, или ссылается на статью закона, которой не существует, - той же формулировкой, с той же уверенностью, без «возможно» и «уточните». По тексту выдумку не отличить, нужна сверка с источником.

Каждую неделю разбираю, как проверять и внедрять ИИ так, чтобы он не выдумывал в ответах клиентам. Продолжение - в канале.

Что такое галлюцинации нейросети простыми словами?

Сразу развожу три разные поломки: решаются они по-разному, а галлюцинации нейросети из них самые незаметные.

Ошибка модели. Ответ выглядит нормальным и оказывается неверным, хотя всё работает штатно. О нём и статья.

Технический сбой. Сервис недоступен, ответа нет вообще. Здесь проблема видна сразу, и решается она запасным вариантом.

Атака извне. Клиент специально подсовывает боту инструкцию, чтобы тот повёл себя не так, как задумано. Это отдельный класс задач, я разбирал его в статье про подмену инструкций боту.

Разница практическая. Сбой вы заметите за минуту по графику, атаку - по странному тексту в переписке. А галлюцинации нейросети выглядят как обычная нормальная работа. Поэтому именно они чаще двух других поломок уходят клиенту.

Почему нейросеть выдумывает, а не говорит «не знаю»?

В сентябре 2025 года вышла работа с прямым названием - «Почему языковые модели галлюцинируют». Главный тезис авторы формулируют так:

«We argue that language models hallucinate because the training and evaluation procedures reward guessing over acknowledging uncertainty.»

«Мы утверждаем, что языковые модели галлюцинируют, потому что процедуры обучения и оценки поощряют угадывание, а не признание неопределённости.»

Там же авторы дают сравнение, которое проще любого пересказа: модель ведёт себя как студент на трудном экзамене - когда не уверен, всё равно пишет правдоподобный ответ, потому что пустая строка приносит ноль в любом случае, а догадка иногда проходит.

Отсюда практический вывод. Галлюцинации нейросети - побочный эффект того, как модель учили. Ждать, что вендор «выключит» выдумки, - стратегия проигрышная: проверку придётся ставить у себя.

Как часто ошибаются модели: что показывают замеры

Компания Vectara ведёт публичный рейтинг, где галлюцинации нейросети измеряются в лоб: моделям дают статью и просят пересказать её, опираясь только на выданный текст. Задача школьного уровня. Вот часть таблицы на дату замера:

МодельДоля галлюцинацийОтвечает на вопрос
antgroup/finix_s1_32b1,8%99,5%
openai/gpt-5.4-nano3,1%100%
google/gemini-2.5-flash-lite3,3%99,5%
meta-llama/Llama-3.3-70B-Instruct-Turbo4,1%99,5%
openai/gpt-4.15,6%99,9%
google/gemini-2.5-pro7,0%99,1%
anthropic/claude-sonnet-410,3%98,6%

Из этой таблицы вытаскиваются три вывода, которые дороже самих процентов.

  1. Модель почти никогда не молчит. Правая колонка везде близка к 100%: отказа от ответа практически не бывает, что-то выдаётся всегда. Это ровно то, о чём писали авторы работы «Why Language Models Hallucinate», только в цифрах.

  2. Температура ноль не спасает. Замер сделан именно в этом, самом предсказуемом режиме. Популярный совет «поставьте ноль, и выдумки исчезнут» уже учтён в приведённых процентах. Не исчезли.

  3. Крупнее не значит точнее. В таблице gemini-2.5-pro с её 7,0% вдвое хуже собственной облегчённой версии gemini-2.5-flash-lite с 3,3%. Вывод для бизнеса простой: «взяли модель помощнее» не равно «стало надёжнее». Мерить придётся на своих задачах.

Одна честная оговорка: рейтинг ведёт компания, которая продаёт инструменты проверки ответов. Это независимо от производителей моделей, но не от всех коммерческих интересов сразу.

Чем это уже обошлось бизнесу: три случая

Россия, май 2026. Самый показательный случай: здесь выдумка попала в официальный документ, а не в переписку с клиентом. В кассационную жалобу попали ссылки на несуществующие судебные акты - с цитатами из них. Текст готовили через нейросеть, а сверить ссылки автор не стал. Арбитражный суд Западно-Сибирского округа назначил штраф 50 000 ₽ (определение от 14 мая 2026 года по делу № А27-7831/2025).

Полезная деталь: суд не запретил пользоваться нейросетями при подготовке документов. Претензия была ровно к тому, что выданное моделью ушло дальше без проверки.

Канада, февраль 2024. Дело Moffatt v. Air Canada, 2024 BCCRT 149: спор про траурный тариф, который помощник авиакомпании разрешил оформить задним числом, хотя правила на соседней странице сайта это запрещали. Трибунал взыскал сумму с перевозчика и отдельно отклонил довод «покупатель мог бы перепроверить». Юридическую сторону вопроса - кто отвечает за сказанное программой по российскому праву - я разбирал в статье про ошибку чат-бота. Здесь важна техническая: выдумка дошла до человека, потому что на её пути не стояло ни одной проверки.

Апрель 2025, сервис Cursor. Пользователей начало выбрасывать из аккаунта из-за технического бага. Бот поддержки объяснил это несуществующим правилом «одно устройство на подписку». Правила такого не было. Люди начали публично отменять подписки, и сооснователю пришлось выходить с опровержением. Один из участников обсуждения описал механику одной фразой:

«the AI support system invented a lie, and nobody caught it until the userbase imploded»

«ИИ поддержки придумал ложь, и никто этого не замечал, пока пользовательская база не обвалилась»

  • реплика участника обсуждения на Hacker News, апрель 2025

Сам баг чинился штатно. Подписки отменяли из-за уверенного объяснения этого бага.

Если бот у вас уже отвечает клиентам и вы не знаете, что именно он им говорит, я бы начал с проверки, а новые функции отложил. У нас это стандартная часть работы, когда мы собираем ИИ-продавца для обработки заявок: бот принимает поток, а спорные ответы уходят человеку.

Где бот выдумывает чаще всего: семь типовых мест

Галлюцинации нейросети распределены по диалогам неравномерно. Это удобно: зная типовые места, проверку можно поставить точечно.

  1. Обещал скидку или тариф, которых нет. Самый дорогой сценарий: сказанное ботом клиент воспринимает как обязательство. Частая механика - в базу положили устаревший документ, и бот дословно повторяет вчерашние условия.
  2. Придумал правило компании. Здесь дело не в ошибке в цифре: бот изобрёл политику и подробно её обосновал.
  3. Сослался на закон или судебную практику, которых нет. Особенно опасно для тем возврата, гарантии и налогов.
  4. Назвал артикул, срок доставки или наличие, которых не проверял. Причина не в модели: бота подключили к тексту, но не к складу и не к трекингу. Вопрос задан - надо что-то ответить.
  5. Ответил на вопрос вне своей темы. Чем шире зона ответственности бота, тем больше вопросов, на которые в базе ответа нет.
  6. Отвечает по устаревшим данным. Условия поменялись, база - нет. Бот продолжает выдавать старые условия тем же ровным тоном, и это никто не замечает месяцами.
  7. Не отдал клиента человеку. Формально не выдумка, но для клиента разницы нет: ответы неверные, а перевода на человека не происходит.

Восьмой пункт стоит особняком, потому что касается денег напрямую. Когда сотрудники понимают, что ответам помощника верить нельзя, они начинают перечитывать всё вручную. Автоматизация оплачена, нагрузка не упала. Практик внедрения формулирует причину так:

«ИИ запускают поверх хаоса - и он автоматизирует не процесс, а проблему.»

  • Алексей Карпачев, руководитель практики внедрения ИИ-решений «Тимидея Групп», New-Retail.ru, 16 июля 2026

Недоверие сотрудников тут рациональное. Пока нельзя отличить надёжный ответ от выдуманного, единственная доступная стратегия - перечитывать всё.

Как проверить ответ до того, как он уйдёт клиенту?

1. Разрешить «не знаю»

Звучит наивно, но это первое, что рекомендует документация Anthropic:

«Allow Claude to say "I don't know": Explicitly give Claude permission to admit uncertainty. This simple technique can drastically reduce false information.»

«Разрешите Claude сказать "я не знаю": явно дайте модели право признать неуверенность. Этот простой приём может резко сократить количество ложной информации.»

Работает та же логика, что и в сравнении со студентом на экзамене: у модели появляется вариант ответа, за который её не штрафуют.

2. Отвечать только по выданным документам

Прямой запрет опираться на общие знания. Без него модель добирает недостающее из того, что «помнит», и склейка получается незаметной.

3. Требовать цитату под каждым утверждением

Приём из той же документации: модель сначала выписывает дословные фрагменты источника, потом отвечает на их основе. Не нашлось подтверждающей цитаты - утверждение удаляется. Это превращает проверку из чтения в сверку.

4. Спросить трижды

Один и тот же вопрос прогоняется несколько раз. Совпали ответы - скорее всего, факт из базы. Разошлись - модель угадывает. Дёшево и работает без дополнительных инструментов.

5. Поставить вторую модель судьёй

Отдельная модель проверяет, выводится ли ответ из документа. Приём не самодельный: в бенчмарке FACTS Grounding от DeepMind судей сразу три - чтобы ни один не завышал оценки ответам своего же семейства.

6. Закрыть темы, где ошибка стоит денег

Цены, сроки, гарантии, юридические нормы - не отдаются модели на формулирование. Либо подставляются из системы, либо вопрос уходит человеку. Именно в этих темах галлюцинации нейросети обходятся дороже всего.

Ни один из шести приёмов не даёт нуля. Об этом пишет сам производитель, и эту оговорку я бы запомнил первой:

«Remember, while these techniques significantly reduce hallucinations, they don't eliminate them entirely. Always validate critical information, especially for high-stakes decisions.»

«Помните: хотя эти приёмы значительно снижают галлюцинации, они не устраняют их полностью. Всегда проверяйте критически важную информацию, особенно в решениях с высокой ценой ошибки.»

Почему «не выдумывай» в промпте не работает?

Показательно, как на это смотрят сами производители. В переписке по одному из разборов ответ вендора звучал так:

«Поведение, о котором вы сообщили в 1, 3, 5 кейсе, является отличным примером галлюцинаций модели: ответы генерируются на основе запроса и контекста общения с ней. Такое поведение не несёт реальной угрозы.»

  • ответ вендора на репорт по программе поиска уязвимостей, приведён в разборе Павла Зотикова на Хабре, 4 июня 2026

С точки зрения производителя это честно: модель делает то, для чего сделана, и галлюцинации нейросети входят в её штатное поведение. Угроза появляется на вашей стороне - когда сгенерированный текст уходит клиенту как официальный ответ компании. Разделение ответственности проходит не там, где хотелось бы. Вендор отвечает за модель, вы - за то, что модель сказала вашему клиенту.

Помогает ли база знаний и RAG?

Подход, при котором модель опирается на выданные документы вместо собственной памяти, - сегодня стандарт для бизнес-ботов. Как собрать такую базу, я разбирал в статье про базу знаний для ИИ.

Дальше начинается расхождение практиков. Одни считают снижение выдумок ключевым свойством подхода. Другие возражают, что мусор в документации никуда не девается и ИИ его только тиражирует:

«Он лишь воспроизведёт беспорядок из документации.»

  • Алексей Карпачев, New-Retail.ru, 16 июля 2026

Правы обе стороны, и разрешается спор просто. База знаний убирает ответы, придуманные с нуля, и добавляет зависимость от качества документов. Поэтому к ней нужны две вещи: владелец у каждого раздела и дата последнего пересмотра. Плюс показ источника рядом с ответом: тогда менеджер проверяет за секунду вместо чтения всего диалога.

Как собрать тестовый набор вопросов?

Три класса, которые нужны обязательно:

  1. Вопросы, ответ на которые есть в базе. Проверяют, что бот находит нужное и не искажает его. Берите формулировки живых клиентов в том виде, в каком они пришли: с опечатками, без контекста, в одно слово.
  2. Вопросы о том, чего в базе нет. Здесь правильный ответ - «не знаю, соединяю с человеком». Содержательный ответ на такой вопрос - уже пойманная выдумка. Это самый ценный класс, и его чаще всего забывают.
  3. Провокационные вопросы. Про скидки, гарантии, сроки, ссылки на закон. Формулировки в духе «а можно дешевле, мне обещали» - то, после чего бот начинает обещать лишнее.

Теперь про порог. Публичного отраслевого норматива вида «запускаем при точности не ниже такой-то» я искал и не нашёл, поэтому цифру не назову.

Порог придётся задать самим, и логика простая: его определяет цена одной ошибки.

Там, где ошибка стоит извинения, несколько процентов выдумок терпимы. Там, где она стоит исполнения обязательства перед клиентом, - нет: вопросы о ценах и сроках держите на нуле и закройте их стоп-темами: цены и сроки подставляются из системы или уходят человеку.

Второе, что даёт тестовый набор, - защита от незаметного падения качества. Прогоняйте его по расписанию, не только перед запуском. Андрей Коптелов в разборе типовых ошибок внедрения описывает случай, когда через полгода бот отвечал корректно только на 20% вопросов, и заметили это постфактум. Другие типовые причины провала внедрения я собирал в отдельном разборе.

Что вписать в ТЗ подрядчику?

Договор - последнее место, где галлюцинации нейросети ещё можно превратить в чью-то зону ответственности. После запуска спорить будет поздно.

Пять пунктов, которые снимают большую часть будущих споров:

  1. Тестовый набор вопросов - часть приёмки. Кто его составляет, сколько в нём вопросов, какие классы, кто утверждает результат.
  2. Поведение при неуверенности описано явно. Что бот делает, когда ответа в базе нет: молчит, отдаёт человеку, показывает контакты. Это фиксируется в задании. Иначе решать будет исполнитель.
  3. Стоп-темы перечислены поимённо. Цены, сроки, гарантии, юридические нормы - список закрытых тем фиксируется письменно.
  4. Стоимость владения на год, не только смета разработки. Оплата запросов, обновление базы, разбор логов. Смета только на разработку - типичная причина, по которой бота через полгода перестают обновлять и отключают.
  5. Кто и как часто пересматривает базу. Владелец у каждого раздела и срок актуальности.

Если подрядчика ещё нет, эти же пункты работают как список вопросов на первой встрече - по ответам видно, делали ли чат-бота под ключ раньше или продают демо.

Российские модели: есть ли разница?

Это само по себе полезный факт. Международные рейтинги вроде Vectara Hallucination Leaderboard публикуют методику, датасет и дату замера - их можно перепроверить. Для GigaChat и YandexGPT сопоставимых открытых замеров именно на галлюцинации нейросети мне найти не удалось.

Что из этого следует для владельца бизнеса. Выбор российской модели чаще диктуется другими причинами - хранением данных внутри страны, оплатой в рублях, отсутствием сложностей с доступом. Это законные основания. Но добавлять к ним аргумент «она реже выдумывает» нельзя: подтвердить его нечем. Собственный тестовый набор из 20-30 вопросов решает это за полчаса и на ваших данных.

С чего начать: план на один вечер

  1. Выпишите 20-30 реальных вопросов клиентов. Из переписок, из почты, из чата. Живые формулировки, не приглаженные.
  2. Добавьте 5 вопросов о том, чего у вас нет. Услуга, которую вы не оказываете; товар, которого не возите; скидка, которой не бывает.
  3. Добавьте 5 провокаций. «Мне обещали дешевле», «а гарантия три года же», «по закону вы обязаны вернуть деньги за неделю».
  4. Прогоните весь список. Ответы сложите в таблицу: вопрос, что ответил бот, есть ли это в базе.
  5. Отметьте каждый ответ, под который нет источника. Это ваш реальный уровень выдумок - тот, что в рекламе платформы, к вашей базе отношения не имеет.
  6. Закройте темы цен и сроков. Пока не настроена подстановка из системы, эти вопросы уходят человеку.

Если после прогона выяснится, что бот даёт содержательные ответы на вопросы о том, чего у вас нет, - выключать его необязательно. Достаточно поставить проверку и сузить темы. Галлюцинации нейросети не убираются выбором модели посвежее, зато хорошо ограничиваются тем, что ответ без источника до клиента просто не доходит.

Источники

Начните с тридцати вопросов и одной таблицы - это покажет реальный уровень выдумок за вечер. Если нужен бот, который на спорных вопросах сразу переключает на человека, это мы и собираем.

Эта статья была полезна?
Максим Самусь
Автор
Максим Самусь
Основатель ClaudeLab

Похожие статьи

Claude для малого бизнеса: 15 готовых ИИ-сценариев без программиста

Claude для малого бизнеса - это пакет из 15 готовых ИИ-сценариев и коннекторов к сервисам, которыми вы уже пользуетесь. Разбираю простыми словами, что Claude делает сам, чем отличается от обычного ChatGPT, сколько стоит в рублях, можно ли пользоваться из России и с чего начать без программиста.

15 мин

Ошибка чат-бота: кто отвечает, если бот наобещал клиенту

Бот назвал клиенту цену ниже прайса или пообещал скидку, которой нет. Кто это исполняет и чем рискует владелец бизнеса. Разбор российских норм, мирового прецедента и семи ограничений, которые ставят в боте до запуска.

17 мин

ИИ для ресторана и кафе: заказы, бронь и доставка без потерь

Разбор для владельца: с чего начать ИИ для ресторана, как связать бота с iiko и r_keeper, честные цены на голосовых и чат-ботов, 6 типичных ошибок внедрения и что с законом о данных гостей. Без обещаний золотых гор, с проверяемыми цифрами.

12 мин

Что делать, когда ИИ падает: отказоустойчивость ИИ для бизнеса

Нейросети вроде ChatGPT и Claude в 2026 году падают регулярно: только 5 августа Claude был недоступен около 7,5 часа. Если на ИИ у вас завязан приём заявок или ответы клиентам, каждый такой сбой стоит денег. Разбираем, как собрать запасной вариант и что делать в первые минуты простоя.

13 мин