Любое коммерческое предложение по AI держится на утверждении о том, что модель умеет делать. Большинство разочарований в этой индустрии начинаются не с обмана, а с того, что это утверждение никто не проверил заранее — ни продавец, ни заказчик. Устройство трансформера знать не обязательно. Обязательно знать, с чем именно работает LLM в момент ответа, потому что именно это определяет, что ей можно доверить, а что нет.
Что модель делает на самом деле
Большая языковая модель обучена предсказывать следующий фрагмент текста по всему, что было до него, — миллиарды раз подряд, пока предсказания не начинают звучать как связная, компетентная речь. Это весь механизм целиком. Модель не заучивала «факты» так, как база данных хранит строки таблицы: она впитала закономерности языка из огромного объёма текста и убедительно их воспроизводит.
Отсюда следствие, которое стоит проговорить заказчику прямым текстом: в момент генерации модель не отличает «уверенно и правильно» от «уверенно и неправильно». Оба варианта звучат одинаково гладко. Гладкость речи — не признак точности. Это признак того, что фраза похожа на язык, который модель уже видела.
Токен — это единица, за которую вы платите
Токен — это кусок текста: часто слово, иногда часть слова, иногда один знак препинания. Правила разбиения на токены знать не нужно. Нужны два факта о токенах, потому что оба всплывают и в счёте от поставщика, и в разговоре с инженером.
Первое: токенами измеряется цена. Практически любой API тарифицируется потокенно, причём вход и выход обычно считаются отдельно. Длинный системный промпт, документ на двадцать страниц, вставленный в запрос, разговорчивый диалог с моделью — всё это меряется токенами, и счётчик крутится и на том, что вы отправили, и на том, что вам ответили.
Второе: в токенах измеряется и контекстное окно — а это уже более важное ограничение.
Контекстное окно — это оперативная память, а не знания
Контекстное окно — это весь объём текста, который умещается в одном обращении к модели: запрос, история переписки, любые вложенные документы и сам ответ модели. Как только этот бюджет исчерпан, старое содержимое выпадает из поля зрения.
Если считать окно оперативной памятью, а не долговременным знанием, остальное поведение модели перестаёт удивлять. Всё, чем модель пользуется, чтобы построить ответ, попало к ней ровно одним из двух путей: либо это было в обучающих данных — и зафиксировано на момент окончания обучения, либо это положили в запрос именно сейчас. Третьего пути нет. Модель не может сама заглянуть в вашу CRM, прочитать сегодняшние новости или вспомнить разговор недельной давности, если только кто-то — система, промпт, конвейер обработки — не подложил ей эту информацию прямо сейчас.
Именно этот разрыв закрывает механизм из раздела 5 под именем RAG: способ найти нужные фрагменты и подложить их в запрос в момент вопроса, потому что другого пути дотянуться до внутренних документов заказчика у модели нет. Если поставщик обещает, что его ассистент «просто знает» договоры компании, хотя эти договоры ему никто не передавал, стоит спросить, каким механизмом это достигается. Механизм обязан существовать.
Придуманные факты — это не баг-репорт
Модель, которая выдумывает факты, не сломана. Она делает единственное, для чего создана, — строит статистически вероятное продолжение текста, — просто в данном случае вероятное продолжение оказывается неправдой. У модели нет аварийного состояния, в которое она проваливается, нет исключения, которое она бросает, когда чего-то не знает. Она продолжает генерировать гладкий текст в любом случае, потому что генерация гладкого текста — это весь механизм целиком, а не опция, которая отключается, когда заканчиваются факты.
Поэтому слово «галлюцинация» в разговоре с заказчиком часто вызывает не тот вопрос: «а когда это починят?» Это не чинится как баг, потому что это не отклонение от правильной работы — это и есть правильная работа, если правильная работа определена как «сгенерировать правдоподобный текст», применённая к случаю, когда в запросе нет ответа. Никакие обещания поставщика этого не меняют по сути: механизм, который выдаёт гладкий верный ответ, — ровно тот же, что выдаёт гладкий неверный. Что бы ни было написано в анонсе очередной версии, систему заказчика проектируют исходя из того, что уверенная ошибка возможна: убрать саму эту возможность никто не предлагает.
Отсюда вывод, который стоит унести с собой в предложение клиенту. Там, где цена неправильного ответа низкая — черновик поста для соцсетей, сводка, которую всё равно пробежит глазами и поправит человек, — лёгкая проверка или её отсутствие вполне разумны. Там, где цена ошибки высокая — цифра, которая идёт в договор, рекомендация клиенту по деньгам или здоровью, всё, что уходит наружу без редактуры, — шаг проверки должен быть частью архитектуры и частью цены, а не костылём, который приделали после первого инцидента. Продавать систему для ответственных решений, не заложив в неё проверку, значит продавать систему, которую вы ещё не спроектировали.
Что из этого следует для разговора с заказчиком
Сложите всё вместе — и получится один чёткий вывод: LLM действительно хорошо работает с информацией, которую ей дали, — суммирует её, сравнивает, готовит по ней черновик, отвечает на вопросы прямо сейчас. Она плохо справляется с тем, чего ей никто не передавал, и не впитывает экспертизу заказчика просто оттого, что её направили на его бизнес. Модель не узнает сама, что в конкретной компании считается «активным клиентом», как выглядели три последних сложных продления контракта или какой пункт типового договора всегда вычёркивают при переговорах, — если только это знание не встроено намеренно: в промпт, в слой поиска или в сценарий вокруг модели.
Если кто-то говорит заказчику, что его AI «уже понимает бизнес», прежде чем в систему попал хоть один документ, обращение или описанный процесс, — он выдаёт будущее состояние за текущее. Именно на этом разрыве — между тем, что модель умеет делать с уже имеющейся информацией, и тем, что ей приписывают, — построены следующие разделы этой книги: как найти данные, которые модели действительно нужны, и какой класс решения подходит под вопрос, который вам реально задали.
Три вопроса, которые стоит задать себе до того, как писать коммерческое предложение:
- Откуда на самом деле возьмётся информация для этого ответа — из обучения, из запроса, или из системы, которую ещё никто не подключил?
- Что произойдёт в тот день, когда модель уверенно ошибётся, и кто в этот момент окажется рядом, чтобы это заметить?
- Кто-нибудь проверил, что экспертиза, на которую опирается это предложение, действительно доступна модели, а не просто подразумевается?