Fail-closed фактчекинг: как я строю пайплайн, в котором LLM не может соврать про цифры
visa-expert 6 минут назад Fail-closed фактчекинг: как я строю пайплайн, в котором LLM не может соврать про цифры Простой 5 мин 47 Копирайт Мнение Я веду базу знаний по тайским визам и пишу справочный контент с помощью...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. visa-expert 6 минут назад Fail-closed фактчекинг: как я строю пайплайн, в котором LLM не может соврать про цифры Простой 5 мин 47 Копирайт Мнение Я веду базу знаний по тайским визам и пишу справочный контент с помощью LLM. Ниша неприятная тем, что ошибка в цифре это не опечатка, а чей-то испорченный переезд: человек прочитает про «минимальный остаток 300 тысяч бат», принесёт консульству на 200 тысяч меньше, чем нужно, и получит отказ с невозвратным сбором. Поэтому за год у меня собрался пайплайн, в котором модель физически не может протащить выдуманное число в публикацию.
Расскажу архитектуру: она не привязана ни к визам, ни к конкретной модели, и подойдёт любой нише, где факты дороже стиля медицина, налоги, финансы. Почему «не выдумывай» в промпте не работаетНачну с наблюдения из практики. Визовые правила волатильны, а поисковая выдача по ним токсична: SEO-сайты штампуют «обновления», не ссылаясь ни на что.
Технические детали
В моём ресёрче был показательный случай: по запросу об изменениях одной визы на 2026 год выдача возвращала несколько страниц одного и того же сайта, противоречащих друг другу одна писала про ужесточение финансовых требований, вторая про него не знала, и ни одна не ссылалась на официальный источник. Теперь представьте, что на этом корпусе учат модель или, хуже, дают ей это в RAG. Модель не врёт в привычном смысле, она честно усредняет мусор.
Инструкция «не выдумывай факты» тут бесполезна: модель и не считает, что выдумывает. Значит, запрет должен быть не в промпте, а в архитектуре. Принцип 1: у чисел есть единственный источник истины, и это не модельЦентральная идея: в генерируемом тексте не бывает чисел «из головы».
Все факты живут в базе записей примерно такой структуры:{ "key": "visa. min", "value": 500000, "display": "500,000 THB", "updatedAt": "2026-07-17", "source": " "attribution": "official", "approvedBy": , "history": }Модель при генерации не «вспоминает» сумму, а подставляет запись по ключу. Гейт на выходе проверяет обратное соответствие: каждое число в тексте обязано матчиться на запись из базы.
Отраслевые последствия
Число без записи блокировка, независимо от того, насколько правдоподобно оно выглядит. Особенно если правдоподобно: самые опасные галлюцинации те, что похожи на правду. Приятный побочный эффект поле history.
Когда сбор меняется, старое значение не затирается, а уезжает в историю, и из этого бесплатно рождается контент, которого нет у конкурентов: «сбор вырос с X до Y в таком-то месяце» это данные, которые нельзя нагуглить одной страницей. Принцип 2: у каждого факта есть уровень доверия, и он не повышается молчаВторая типовая ошибка LLM-контента тоньше галлюцинаций: смешение статусов. «Требуется страховка» это официальное требование, практика конкретного консульства или чей-то пересказ с форума?
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






