ИИ-ассистент
ИИ-ассистент это программа, которая принимает вопрос человека на обычном языке и отвечает текстом или действием: находит нужное место в документах компании, считает, оформляет заявку, обращается к внешнему сервису. Внутри у неё четыре сменные части: языковая модель, системная инструкция, база знаний с поиском по ней и набор внешних инструментов.
Владельцу ассистента полезно знать, какая часть чья. Модель приходит готовой от поставщика, и её поведение заказчик меняет только косвенно. Инструкция, состав базы знаний, список инструментов и правило «когда звать человека» задаются на его стороне целиком. Там же находится и вся ответственность за ответ.
Отсюда растёт главный риск. Ответ собирается по вероятностям следующего слова, а не извлекается из документа куском, поэтому уверенный тон ответа не говорит о его правильности ничего. Сбер пишет об этом в документации своего сервиса прямо: «Модель может „фантазировать“».

Чем отличается от чат-бота, языковой модели и ИИ-агента
Четыре понятия подставляют одно вместо другого, хотя отвечают они на разные вопросы.
| Понятие | Что это | Чем не является |
|---|---|---|
| Языковая модель | ядро, которое продолжает текст по вероятностям | не знает ваших документов и ничего не запускает само |
| Сценарный чат-бот | дерево вопросов, кнопок и заранее написанных ответов | не отвечает на непредусмотренное, зато не выдумывает |
| ИИ-ассистент | модель плюс инструкция, база знаний и инструменты | не решает, какие шаги делать: их задал человек |
| ИИ-агент | сам дробит задачу на шаги и выполняет их подряд | не набор готовых ответов, поведение меняется от запуска к запуску |
Граница между ассистентом и агентом подвижная, и поставщики размывают её в рекламе, называя агентом любую сборку, где к модели подключили две функции и память о прошлых сообщениях. Рабочий признак простой: если шаги перечислил человек и ассистент только выбирает из них, это ассистент. Если программа сама планирует последовательность и идёт по ней до результата, это агент. Что вообще умеют модели в бизнесе и во сколько обходится пилот, разобрано в статье Нейросети для бизнеса.
Откуда взялось
Точка отсчёта у темы ранняя. Джозеф Вейценбаум описал в январе 1966 года программу ELIZA, которая поддерживала беседу без всякого понимания смысла: работала шаблонная подстановка слов из реплики пользователя. Русскоязычный голосовой помощник Яндекса, Алиса, запущен 10 октября 2017 года. Массовый интерес к разговору с моделью начался с ChatGPT, открытого 30 ноября 2022 года, и корпоративные проекты пошли уже после этой даты, хотя приём работы с документами был описан двумя годами раньше.
Современный корпоративный ассистент невозможен без трёх технических дат. 22 мая 2020 года вышла работа Патрика Льюиса и соавторов, описавшая генерацию с опорой на найденные документы. 13 июня 2023 года OpenAI выпустила вызов функций: модель научилась возвращать структурированную заявку на действие. 25 ноября 2024 года Anthropic открыла протокол Model Context Protocol, чтобы один и тот же инструмент подключался к разным ассистентам без переписывания кода.
Как это устроено
Модель и токены
Текст режется на токены. Один токен в русском тексте это в среднем 3-4 символа, так пишет документация GigaChat. Модель по очереди предсказывает следующий токен, опираясь на всё, что уже лежит перед ней.
Отсюда два свойства, которые настройкой не убираются. Одинаковый вопрос даёт разные ответы, и документация Сбера это подтверждает: результат зависит от контекста предыдущего диалога. Второе свойство неприятнее: у модели нет отдельного признака «я не знаю». В сентябре 2025 года исследователи OpenAI объяснили механизм так: принятые способы обучения и оценки награждают догадку выше, чем признание неуверенности, потому что в тестах угаданный ответ приносит балл, а отказ не приносит ничего.
Системная инструкция
Это отдельное сообщение, которого читатель не видит. В Yandex AI Studio оно передаётся параметром instructions, и пример из документации выглядит буквально так: «Отвечай только данными о погоде, которые вернула функция». Здесь же задаются тон, запретные темы и правило передачи диалога человеку.
Инструкция это самая дешёвая часть ассистента и самая недооценённая: именно в ней прописывается, что делать, когда ответа в базе знаний нет, и от этих двух строк зависит, скажет ассистент «данных нет» или соберёт условие сам.
База знаний и поиск по ней
Приём называется генерация с опорой на поиск. Документы режутся на фрагменты, каждый переводится в числовой вектор и складывается в поисковый индекс. На вопрос система подбирает несколько ближайших фрагментов и подмешивает их в запрос к модели вместе с исходной формулировкой.
Ограничения тут не абстрактные, они опубликованы. В Yandex AI Studio максимальная длина одного фрагмента 8000 символов, поисковых индексов на каталог до 150, файлов в индексе до 10 000, размер файла до 128 МБ. Хранение индекса стоит 10,6 ₽ за гигабайт в сутки, перевод текста в векторы 0,0101 ₽ за 1000 токенов.
Что этот слой даёт: ответ по вашим документам, со ссылкой на источник, без обучения модели заново. Чего не даёт: гарантии. Если поиск вернул фрагмент, похожий по словам и неприменимый к случаю клиента, модель ответит по этому фрагменту и на него же сошлётся, а читатель увидит ссылку на внутренний документ и поверит ответу.
Вызов внешних инструментов
Инструмент описывается тремя вещами: имя, текстовое описание и схема параметров. Модель не выполняет функцию, она возвращает заявку на вызов с именем и аргументами. Дальше работает код заказчика: он проверяет аргументы, выполняет действие и возвращает результат модели отдельным сообщением. Документация GigaChat формулирует это так: «Модели не выполняют функции самостоятельно, а принимают решения об их использовании».
Практический вывод простой. Право ассистента менять данные в системах компании определяется не моделью, а списком функций, которые ему дали.
Контекстное окно
Окно это предел, сколько токенов модель видит за один заход. У YandexGPT Pro 5.1 и Lite 5 это 32 768 токенов, у Alice AI LLM 131 072. В окно входит всё сразу: инструкция, история диалога, найденные фрагменты базы и сам ответ.
Большое окно не означает ровного внимания по всей длине. Нельсон Лиу с соавторами показали на двух задачах и шести семействах моделей, что качество выше, когда нужный факт стоит в начале или в конце поданного текста, и заметно падает, когда он лежит в середине. Практическое следствие: сто страниц регламента, уложенные в окно целиком, не гарантируют, что модель заметит нужный абзац в середине.
Что делать на практике
- Выписать 20-30 реальных формулировок вопросов, которые приходят в поддержку. Берутся они из переписок и звонков, а не из головы, и собираются так же, как семантическое ядро: важна формулировка клиента, а не внутренний термин. У разных сегментов целевой аудитории формулировки расходятся сильно.
- Разделить эти вопросы на три группы: ответ есть в документе, ответ требует расчёта или запроса в систему, ответ требует решения человека. Распределение подсказывает путь клиента: до покупки спрашивают про наличие и сроки, после неё про возврат и гарантию.
- Собрать базу знаний из действующих документов и назначить владельца каждого. Устаревший прайс в индексе опаснее отсутствия ассистента.
- Прописать в инструкции правило на случай пустого поиска: сказать, что данных нет, и передать диалог человеку. Без этого правила модель заполнит пустоту сама.
- Закрыть темы, где ошибка стоит денег: цены под расчёт, сроки поставки, гарантии, персональные данные клиента.
- Включить журнал всех диалогов до запуска, а не после первой жалобы.
- Каждую неделю проверять руками случайную выборку ответов, сверяя их с документом-источником. Выборка нужна постоянно, а не в первые дни.
- Сравнить два варианта страницы или сценария через A/B-тестирование, если ассистент стоит на пути к заявке.
- Поставить ассистента в общий контур автоматизации бизнес-процессов, а не рядом с ним: иначе оператор будет переносить данные руками из чата в учётную систему.
Чем измеряют
- Доля диалогов, закрытых без человека, и доля переданных оператору.
- Доля ошибочных ответов в недельной выборке, проверенной вручную.
- Доля отказов «не знаю»: слишком высокая говорит о дырах в базе, слишком низкая о том, что правило отказа не работает.
- Время первого ответа и время до решения вопроса.
- Стоимость ответа в рублях. Считается по прайсу поставщика: у YandexGPT Pro 5.1 синхронный режим стоит 0,8 ₽ за 1000 токенов на входе и столько же на выходе, у GigaChat Pro в режиме оплаты по факту 0,5 ₽ за 1000 токенов при минимальном месячном платеже 600 ₽. Диалог на 2000 токенов входа и 300 выхода по прайсу YandexGPT Pro 5.1 обходится в 1,84 ₽; числа в этом примере модельные и служат порядком величины, а не отраслевым эталоном. Пробный объём есть у обоих поставщиков: физическим лицам GigaChat отдаёт в бесплатном режиме 250 млн токенов линейки Lite на 12 месяцев.
- Задачи в рекламе и контенте измеряются иначе, чем поддержка: применение моделей там разобрано в статьях ИИ в маркетинге и контент-маркетинг.
- Влияние на деньги: изменение конверсии сайта и стоимости обращения. Связь ответа ассистента с оплаченным заказом видна только при сквозном учёте, поэтому нужны сквозная аналитика и коллтрекинг, а окупаемость считается через юнит-экономику и ROMI.
Частые ошибки
Базу собрали один раз. Документы меняются, индекс остаётся прежним, и ассистент месяцами повторяет отменённое условие. Поэтому у каждого документа в индексе есть владелец и срок пересмотра.
Всё засунули в инструкцию вместо базы знаний. Инструкция уходит в контекстное окно при каждом запросе, поэтому длинный регламент внутри неё съедает место и деньги. Регламент это база знаний, инструкция это правила поведения.
Не задали правило отказа. Вопрос вне базы модель закроет догадкой, и звучать она будет так же уверенно, как верный ответ.
Поставили ассистента отвечать про цены и сроки. Это те самые ответы, которые клиент цитирует потом, и по которым спорят.
Проверяли только на старте. Поставщик обновляет модель, база пополняется, формулировки клиентов меняются. Качество без выборочного контроля незаметно уезжает.
Посчитали, что поиск по базе отменяет проверку. Это заблуждение уже измерено, и числа стоят ниже.
Ограничения и спорные места
Поиск по базе снижает выдумки, но не убирает их. Исследователи Стэнфорда и Йеля проверили три юридических сервиса на 202 вопросах по заранее зарегистрированной методике. Lexis+ AI и Ask Practical Law AI выдали неверное утверждение либо ложную ссылку на источник в 17% ответов, Westlaw AI-Assisted Research в 33%, а GPT-4 без поиска по базе в 43%. Опора на документы снизила долю таких ответов, но не убрала их: ошибка осталась у каждого шестого ответа в лучшем сервисе выборки и у каждого третьего в худшем.
Замер сделан на юридических текстах, и переносить его на другие отрасли нельзя. Авторы отдельно называют выборку в 202 вопроса небольшой. Сопоставимого публичного замера по русскоязычным корпоративным ассистентам с описанной методикой нет, а значит числа про службу поддержки магазина никто пока не мерил.
Отказ отвечать это тоже отказ работать. В том же исследовании Ask Practical Law AI дал неполный ответ или отказ в 62% случаев против 18% у Lexis+ AI. Осторожная настройка снижает выдумки и одновременно поднимает долю ответов, за которыми всё равно идут к человеку. Где остановиться, каждый решает на своих вопросах.
Причину выдумок объясняют по-разному. Исследователи OpenAI в сентябре 2025 года связали её с системой оценки моделей, которая награждает догадку, и предложили менять сами тесты. Это объяснение спорное и не единственное, а на стороне заказчика оно ничего не меняет: правило отказа и проверка выборки нужны при любой версии причин.
Длинное окно не заменяет поиск. U-образная зависимость из работы Лиу измерена на искусственных задачах, а не на базе знаний компании, и авторы этого не скрывают.
Ответ ассистента это ответ компании. Гражданский трибунал Британской Колумбии в деле 2024 BCCRT 149 взыскал с авиакомпании убытки пассажира, которому бот на сайте пообещал условие, отсутствовавшее в правилах перевозчика; довод о том, что бот отвечает за себя сам, трибунал отклонил. Юрисдикция чужая, прямого действия в России у решения нет, и трактовать российскую практику по нему нельзя.
Персональные данные клиентов ограничены законом. Часть 5 статьи 18 закона 152-ФЗ не допускает при сборе персональных данных граждан России их запись, хранение и извлечение с использованием баз, находящихся за пределами страны, кроме случаев, названных в статье 6. Прежде чем отдавать переписку с клиентами внешнему сервису, эту норму читают с юристом.
Терпимость к ИИ выше там, где решение остаётся за человеком. ВЦИОМ в опросе 21-24 ноября 2024 года (1601 респондент от 18 лет, телефонное интервью по стратифицированной случайной выборке) получил 52% доверия технологиям искусственного интеллекта, а в медицине 76% допускают применение ИИ при условии, что решение принимает врач; полную замену врача поддерживают 5%. Про службу поддержки магазина в этом опросе не спрашивали, и на поведение при покупке цифры не переносятся.
Стоимость владения видна не вся. Прайсы поставщиков считают токены, а подготовка документов, разметка, проверка выборки и работа оператора в тарифе не лежат. Публичной методики полного расчёта для российского рынка нет.
Что здесь быстро устаревает
- Цены за токены и правила тарификации у Yandex AI Studio и GigaChat, включая объёмы бесплатного режима.
- Размеры контекстного окна и состав доступных моделей.
- Лимиты поисковых индексов: число индексов, размер фрагмента, объём файла.
- Наборы встроенных инструментов и поддержка протокола Model Context Protocol.
- Требования к обработке персональных данных и условия их передачи внешним сервисам.
См. также
- Нейросети для бизнеса
- Автоматизация бизнес-процессов
- ИИ в маркетинге
- Путь клиента
- Целевая аудитория
- Контент-маркетинг
Источники
- Weizenbaum J. ELIZA: a computer program for the study of natural language communication between man and machine: описание шаблонного механизма. Communications of the ACM, январь 1966, т. 9, № 1, с. 36-45, doi:10.1145/365153.365168. https://dl.acm.org/doi/10.1145/365153.365168
- «Яндекс» объявил о запуске голосового помощника «Алиса»: дата запуска. РБК, 10 октября 2017 года. https://www.rbc.ru/technology_and_media/10/10/2017/59dc6c179a794798683018c3
- Introducing ChatGPT: дата открытия публичного доступа. OpenAI, 30 ноября 2022 года. https://openai.com/index/chatgpt/
- Lewis P., Perez E., Piktus A. и др. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks: работа, описавшая генерацию с опорой на найденные документы. arXiv:2005.11401, 22 мая 2020 года; NeurIPS 2020. https://arxiv.org/abs/2005.11401
- Function calling and other API updates: выпуск вызова функций. OpenAI, 13 июня 2023 года. https://openai.com/index/function-calling-and-other-api-updates/
- Introducing the Model Context Protocol: открытие протокола подключения инструментов. Anthropic, 25 ноября 2024 года. https://www.anthropic.com/news/model-context-protocol
- «Примеры использования GigaChat в чат-боте»: предупреждения о том, что модель может «фантазировать» и давать разные ответы на один вопрос, рекомендация сочетать с интентами и FAQ. Документация для разработчиков, Сбер. https://developers.sber.ru/docs/ru/salutebot/gigachat-in-salutebot
- «Квоты и ограничения»: один токен в среднем 3-4 символа, число потоков для физических и юридических лиц. Документация GigaChat, Сбер. https://developers.sber.ru/docs/ru/gigachat/limitations
- «Работа с функциями»: модели не выполняют функции самостоятельно, роль
functionв ответе. Документация GigaChat, Сбер. https://developers.sber.ru/docs/ru/gigachat/api/function-calling - «Тарифы GigaChat API для юрлиц»: оплата по факту 0,065 ₽, 0,5 ₽ и 0,65 ₽ за 1000 токенов в синхронном режиме, минимальный платёж 600 ₽ в месяц. Документация для разработчиков, Сбер. https://developers.sber.ru/docs/ru/gigachat/tariffs/legal-tariffs
- «Тарифы GigaChat API для физлиц»: объёмы бесплатного режима и цены пакетов. Документация для разработчиков, Сбер. https://developers.sber.ru/docs/ru/gigachat/tariffs/individual-tariffs
- «Обзор AI-моделей сервиса Yandex AI Studio»: контекст 32 768 токенов у YandexGPT Pro 5.1 и Lite 5, 131 072 у Alice AI LLM. Документация AI Studio, Яндекс. https://aistudio.yandex.ru/docs/ru/ai-studio/concepts/generation/
- «Квоты и лимиты»: до 150 поисковых индексов, до 10 000 файлов в индексе, файл до 128 МБ. Документация AI Studio, Яндекс. https://aistudio.yandex.ru/docs/ru/ai-studio/concepts/limits
- «Обзор технологий поиска AI Search»: разбиение данных на фрагменты, максимальная длина фрагмента 8000 символов, хранение в поисковом индексе. Документация AI Studio, Яндекс. https://aistudio.yandex.ru/docs/ru/ai-studio/concepts/search/
- «Правила тарификации Yandex AI Studio»: 0,8 ₽ за 1000 токенов у YandexGPT Pro 5.1, 0,2 ₽ у Lite, 0,0101 ₽ за перевод текста в векторы, 10,6 ₽ за гигабайт поискового индекса в сутки. Документация AI Studio, Яндекс. https://aistudio.yandex.ru/docs/ru/ai-studio/pricing
- «Создать текстового агента с вызовом функции»: параметр
instructions, описание функции со схемой параметров, возвратfunction_callи выполнение функции на стороне разработчика. Документация AI Studio, Яндекс. https://aistudio.yandex.ru/docs/ru/ai-studio/operations/agents/create-function-text-agent.html - Magesh V., Surani F., Dahl M., Suzgun M., Manning C. D., Ho D. E. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools: 202 вопроса, доли неверных ответов 17%, 17%, 33% и 43%, доли неполных ответов 18%, 25% и 62%. Journal of Empirical Legal Studies, 2025, doi:10.1111/jels.12413, принято 14 марта 2025 года. https://onlinelibrary.wiley.com/doi/full/10.1111/jels.12413
- Liu N. F., Lin K., Hewitt J. и др. Lost in the Middle: How Language Models Use Long Contexts: качество выше, когда нужная информация стоит в начале или в конце контекста. Transactions of the ACL, 2024, т. 12, с. 157-173; arXiv:2307.03172, 6 июля 2023 года. https://aclanthology.org/2024.tacl-1.9/
- Kalai A. T., Nachum O., Vempala S., Zhang E. Why Language Models Hallucinate: обучение и оценка награждают догадку выше признания неуверенности. arXiv:2509.04664, 5 сентября 2025 года. https://arxiv.org/abs/2509.04664
- «Доверие к ИИ»: 52% доверия технологиям, 94% информированности, 76% принятия ИИ в медицине при решении врача, 5% за полную замену врача. Опрос 21-24 ноября 2024 года, 1601 респондент от 18 лет, телефонное интервью по стратифицированной случайной выборке. ВЦИОМ. https://wciom.ru/analytical-reviews/analiticheskii-obzor/doverie-k-ii
- Федеральный закон от 27 июля 2006 года № 152-ФЗ «О персональных данных», статья 18 часть 5: запрет записи, хранения и извлечения персональных данных граждан России с использованием баз за пределами страны, кроме случаев по статье 6; редакция части 5 действует с учётом закона от 28 февраля 2025 года № 23-ФЗ. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/cbf4e15b7c330f9372e876cdf2bc928bad7950ef/
- Moffatt v. Air Canada, 2024 BCCRT 149: Гражданский трибунал Британской Колумбии, февраль 2024 года, взыскание убытков за неверную информацию чат-бота на сайте перевозчика. CanLII. https://www.canlii.org/en/bc/bccrt/doc/2024/2024bccrt149/2024bccrt149.html
Смотрите также