Большая языковая модель
Большая языковая модель (LLM, от английского large language model) это программа, которая предсказывает следующий фрагмент текста по предыдущему и за счёт этого составляет связные ответы. Внутри она устроена как нейросеть архитектуры Transformer, обучена на очень большом корпусе текстов и хранит статистику языка в миллиардах числовых коэффициентов. Знаний в человеческом смысле у неё нет. Есть распределение вероятностей, из которого модель раз за разом достаёт очередной кусочек текста.
Устройство трансформера разобрано в статьях Нейросеть и Машинное обучение, и повторять его здесь незачем. Прикладная половина темы устроена иначе, и именно она решает судьбу внедрения: модель продаётся по токенам, дорожает от длины документа, ошибается с измеримой частотой и по-разному обращается с данными, которые в неё загрузили.
Ниже собраны цены вендоров на 11 сентября 2026 года, размеры контекстных окон из их же документации и доли галлюцинаций по двум разным бенчмаркам. Цены на этом рынке меняются несколько раз в год, поэтому дата снятия указана прямо в таблице и повторена в разделе об устаревании.

Чем отличается от соседних понятий
- Нейросеть это общий класс алгоритмов. Большая языковая модель это частный случай нейросети, обученный на тексте.
- Машинное обучение это способ построить такую модель: алгоритм подбирает коэффициенты по данным, а не получает их от программиста.
- Генеративный ИИ это модели, которые создают новый контент. Языковая модель работает с текстом, соседние по классу модели с изображением, звуком и видео.
- Чат-бот это интерфейс. Он может работать на кнопочных сценариях без всякой модели, а может вызывать LLM на каждое сообщение.
- ИИ-агент это модель плюс право вызывать инструменты и выполнять действия по шагам, а не только отвечать текстом.
- RAG это способ заставить модель отвечать по документам компании: нужные фрагменты находятся поиском и подкладываются в запрос. Сама модель при этом не дообучается и ничего нового не запоминает.
Откуда взялось
Архитектура, на которой держатся все современные языковые модели, описана в работе «Attention Is All You Need», поданной в arXiv 12 июня 2017 года группой авторов из Google (Ашиш Васвани и соавторы). Её идея в том, чтобы отказаться от рекуррентных и свёрточных слоёв и оставить только механизм внимания. Статье девять лет. Дальнейшие годы это масштабирование той же схемы: больше параметров, больше данных, длиннее контекст.
Как это устроено
Токен, а не слово
Модель не видит букв и слов. Текст режется на токены: частые куски символов, из которых язык собирается чаще всего. Счёт идёт именно в них. В них же выставляется счёт за работу. Документация Яндекса приводит замер на русском тексте: 501 символ превращается в 96 токенов при работе с YandexGPT Pro, то есть около 5,2 символа на токен. У Anthropic в глоссарии для английского названа другая величина, примерно 3,5 символа на токен, и сравнивать эти числа между собой нельзя: у каждого вендора свой токенизатор.
Контекстное окно
Контекстное окно это объём текста, который модель удерживает в работе одновременно: ваш запрос, приложенные документы, история переписки и сам ответ. Всё, что не влезло, для модели не существует. Разброс тут в десятки раз. У YandexGPT Pro 5.1 окно составляет 32 768 токенов, у GigaChat 2 Max 128 000, у Claude Opus 5 и Gemini 3.8 Flash порядка миллиона.
Это не абстрактная характеристика. Договор на сорок страниц в окно на 32 тысячи токенов целиком не поместится, и придётся резать его на части или строить RAG.
Почему ответ каждый раз разный
За разнообразие отвечает параметр «температура»: чем он выше, тем охотнее модель выбирает менее вероятное продолжение. Anthropic в своей документации предупреждает отдельно: даже при нулевой температуре одинаковый запрос может дать разные ответы. Полной детерминированности нет. Для справочного бота это означает, что один и тот же вопрос клиента иногда получит два разных ответа.
Что делать на практике
Сколько стоит обращение к модели
Зарубежные вендоры считают вход и выход отдельно, цены в долларах за миллион токенов. Данные сняты со страниц тарифов вендоров 11 сентября 2026 года.
| Модель | Вход, $ за 1 млн | Выход, $ за 1 млн | Окно контекста | Под какую задачу |
|---|---|---|---|---|
| GPT-6 Astra (OpenAI) | 10 | 50 | 1,05 млн | сложные рассуждения, длинные агентские сценарии |
| GPT-5.6 Terra (OpenAI) | 2 | 12 | 1,05 млн | основная содержательная работа с текстом |
| GPT-5.6 Luna (OpenAI) | 0,20 | 1,20 | 1,05 млн | массовая механика: разметка, классификация |
| Claude Opus 5 (Anthropic) | 5 | 25 | 1 млн | код, длинные документы, агентские задачи |
| Claude Sonnet 5 (Anthropic) | 2 | 10 | 1 млн | повседневная работа, где важна скорость |
| Claude Haiku 4.5 (Anthropic) | 1 | 5 | 200 тыс. | быстрые короткие ответы |
| Gemini 3.8 Flash (Google) | 0,75 | 3,75 | 1 048 576 | большой объём при длинном контексте |
Цена Gemini 3.8 Flash действует до 31 декабря 2026 года, с 1 января 2027 года вендор объявил удвоение: 1,50 и 7,50 доллара.
Российские вендоры считают иначе: цена одна за тысячу токенов, без разделения на вход и выход, в рублях и с НДС.
| Модель | Цена за 1000 токенов, ₽ | Окно контекста | Под какую задачу |
|---|---|---|---|
| YandexGPT Pro 5.1 | 0,8 | 32 768 | работа с текстом внутри контура Яндекса |
| YandexGPT Lite | 0,2 | 32 768 | простые короткие задачи |
| GigaChat 2 Max | 0,65 | 128 000 | самые сложные задачи линейки |
| GigaChat 2 Pro | 0,5 | 128 000 | ресурсоёмкие задачи |
| GigaChat 2 Lite | 0,065 | 128 000 | простые повседневные задачи |
Две закономерности видны прямо из таблиц. Первая: у зарубежных вендоров выходной токен стоит ровно в пять раз дороже входного почти у всех перечисленных моделей, а у GPT-5.6 Luna и GPT-5.6 Terra в шесть раз. Значит длинный ответ бьёт по бюджету сильнее, чем длинный вопрос. Вторая: разрыв внутри одной линейки достигает пятидесяти раз по входу, если сравнить GPT-6 Astra и GPT-5.6 Luna. У Сбера разрыв между Lite и Max десятикратный.
Расчёт на тысячу ответов
Возьмём типовой сценарий поддержки: в модель уходит 2000 входных токенов (вопрос плюс кусок инструкции), обратно приходит 500. Тысяча таких обращений это 2 млн входных и 500 тыс. выходных токенов. По ценам из таблиц выше получается:
- GPT-5.6 Luna: 1,00 доллара
- Gemini 3.8 Flash: 3,38 доллара
- Claude Sonnet 5: 9,00 долларов
- Claude Opus 5: 22,50 доллара
- GPT-6 Astra: 45,00 долларов
- GigaChat 2 Lite: 162,50 ₽
- YandexGPT Pro 5.1: 2000 ₽
Между крайними долларовыми строками разрыв в сорок пять раз. Курсовую конвертацию здесь сознательно не делаем: курс меняется ежедневно и превратил бы таблицу в устаревшую на следующий день. Считайте по своему курсу на день расчёта.
Что происходит с данными компании
Вопрос, который решается до выбора модели, а не после. У OpenAI в документации сказано прямо: с 1 марта 2023 года данные, отправленные в API, не используются для обучения моделей, если клиент сам не согласился ими делиться. При этом логи для контроля злоупотреблений по умолчанию хранятся до 30 дней, а режим нулевого хранения включается отдельно и по согласованию с вендором.
Для российской компании к этому добавляется вопрос размещения. Часть 5 статьи 18 закона «О персональных данных» (152-ФЗ) требует, чтобы запись, хранение и уточнение персональных данных граждан России шли в базах на территории России. Соглашение Сбера об использовании GigaChat от 6 февраля 2026 года содержит пункт 6.3: контент клиента не используется правообладателем в собственных целях, не связанных с предоставлением сервиса.
Практический вывод один. Условия хранения проверяются по документу вендора. До загрузки первого клиентского файла, а не после.
Чем измеряют
- Доля галлюцинаций. Сколько ответов содержат выдуманный факт. Числа по разным бенчмаркам различаются на порядок, см. ниже.
- Время до первого токена (TTFT). Задержка между запросом и началом ответа. Для чата критична, для ночной пакетной обработки безразлична.
- Цена решённой задачи. Не цена за миллион токенов, а сумма за один полезный результат: разобранное письмо, размеченный отзыв, готовое описание товара.
- Доля ответов, дошедших до человека. Сколько обращений бот закрыл сам, а сколько передал оператору.
Про галлюцинации есть свежий замер, и он показывает главную ловушку темы. В отчёте AI Index Report 2026 (Стэнфордский институт HAI, глава 3) приведены два бенчмарка сразу. Бенчмарк AA-Omniscience компании Artificial Analysis проверяет фактическую надёжность на 6000 вопросов в шести областях, от права и медицины до разработки и математики, причём за отказ отвечать баллы не снимаются. По 26 моделям доля галлюцинаций там разошлась от 22% до 94%. Разброс больше чем вчетверо. Ниже всех доля у Grok 4.20 Beta 0305 (22%), затем Claude 4.5 Haiku (26%) и MiMo-V2-Pro (30%). Выше всех у gpt-oss-20B в режиме high (94%) и Gemini 3 Flash (92%).
Второй бенчмарк, HHEM от Vectara, меряет другое: как часто модель придумывает факты, пересказывая поданный ей документ. Там у 15 моделей верхней части рейтинга доли укладываются в 1,8-5,4%, и большинство сидит в коридоре 4-5%.
Разница между 94% и 5% это не противоречие. Это разные задачи. Авторы отчёта оговаривают прямо, что шкалы двух бенчмарков напрямую не сопоставимы. Отвечать по памяти модель не умеет. Пересказывать поданный текст умеет неплохо, и на этом построен RAG.
Частые ошибки
- Выбор модели по названию, а не по расчёту. Разница в цене между флагманом и младшей моделью той же линейки доходит до сорока пяти раз на одной и той же тысяче ответов. Даёт ли флагман выигрыш на вашей задаче, покажет только замер на своей выборке.
- Оплата длинного промпта на каждом запросе. Инструкция на три страницы уходит в модель с каждым обращением и оплачивается каждый раз.
- Попытка вместить корпус документов в контекстное окно. Для этого существует RAG, а не окно на миллион токенов.
- Вера в фактическую точность без проверки. Верный и выдуманный ответ выглядят одинаково уверенно.
- Загрузка персональных данных клиентов до чтения условий вендора. Порядок обратный: сперва документ, потом файл.
- Замер качества на десяти примерах. Разброс между моделями виден на сотнях, а не на десятке.
Ограничения и спорные места
Числа из бенчмарков не переносятся на ваш случай. AA-Omniscience меряет знание фактов в шести областях, от права до математики. Ваша задача может быть про разбор писем клиентов, и доля ошибок там будет своя. Бенчмарк показывает относительный порядок моделей, а не вероятность ошибки в вашем сценарии.
Про русский язык данных нет. HHEM построен на англоязычном корпусе CNN/Daily Mail, это сказано в отчёте прямо. Язык вопросов AA-Omniscience там не назван вовсе. Публичного замера галлюцинаций сопоставимого масштаба на русском в открытых источниках найти не удалось, поэтому переносить 22% или 5% на русскоязычную задачу нельзя.
Цены живут месяцами. Google в той же таблице тарифов объявил удвоение цены Gemini 3.8 Flash с 1 января 2027 года. Anthropic в документации отдельно отметил, что запланированное на 1 сентября 2026 года повышение цены Claude Sonnet 5 отменено. Прайс двигается в обе стороны.
Сравнение вендоров по цене за токен хромает. Токенизаторы разные, и один и тот же русский текст у разных вендоров даёт разное число токенов. Anthropic прямо предупреждает, что новый токенизатор моделей 4.7 и новее даёт примерно на 30% больше токенов на том же тексте. Честное сравнение делается на своей выборке запросов, а не по прайсу.
Число инцидентов растёт. База AI Incident Database зафиксировала 362 случая в 2025 году против 233 в 2024. Что именно попадает в базу, решают её составители, поэтому рост числа записей отражает и внимание к теме, а не только рост числа сбоев.
Спор про природу ошибки не закрыт. Отдельный бенчмарк KaBLE из того же отчёта показал, что точность модели падает, когда ложное утверждение подаётся как убеждение самого пользователя. У GPT-4o она упала с 98,2% до 64,4%. У DeepSeek R1 с показателя выше 90% до 14,4%. Считать это дефектом обучения или свойством самой архитектуры, отрасль не договорилась.
Что здесь быстро устаревает
- Обе таблицы цен. Сняты 11 сентября 2026 года со страниц тарифов вендоров. Признак протухания: в таблице стоит модель, которой нет в текущем прайсе вендора.
- Названия и версии моделей. Линейки переименовываются и снимаются с поддержки несколько раз в год.
- Размеры контекстных окон. Растут скачками, у российских вендоров с заметным отставанием от зарубежных.
- Доли галлюцинаций. Привязаны к отчёту 2026 года и к составу моделей в нём. Следующая редакция AI Index пересобирает выборку, и числа сместятся.
- Условия хранения данных. Правила вендоров и тексты соглашений правятся без анонсов, дата документа Сбера в статье указана намеренно.
См. также
Источники
- OpenAI. Pricing. Страница тарифов API, данные сняты 11.09.2026. https://developers.openai.com/api/docs/pricing
- OpenAI. Models. Размеры контекстных окон, сняты 11.09.2026. https://developers.openai.com/api/docs/models
- OpenAI. Data controls in the OpenAI platform. Условия использования и хранения данных API, сняты 11.09.2026. https://developers.openai.com/api/docs/guides/your-data
- Anthropic. Pricing. Страница тарифов Claude API, данные сняты 11.09.2026. https://platform.claude.com/docs/en/about-claude/pricing
- Anthropic. Models overview. Контекстные окна и максимальная длина ответа, сняты 11.09.2026. https://platform.claude.com/docs/en/about-claude/models/overview
- Anthropic. Glossary. Определения токена, контекстного окна и температуры, сняты 11.09.2026. https://platform.claude.com/docs/en/about-claude/glossary
- Google. Gemini API pricing. Тарифы, данные сняты 11.09.2026. https://ai.google.dev/gemini-api/docs/pricing
- Google. Gemini 3.8 Flash. Лимиты входных и выходных токенов, сняты 11.09.2026. https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash
- Яндекс. Правила тарификации Yandex AI Studio. Цены за 1000 токенов с НДС, сняты 11.09.2026. https://aistudio.yandex.ru/docs/ru/ai-studio/pricing
- Яндекс. Модели генерации текста. Размеры контекстных окон, сняты 11.09.2026. https://aistudio.yandex.ru/docs/ru/ai-studio/concepts/generation/models
- Яндекс. Токены. Замер числа токенов на русском тексте, снят 11.09.2026. https://aistudio.yandex.ru/docs/ru/ai-studio/concepts/generation/tokens
- Сбер. Тарифы GigaChat API для юрлиц. Обновлено 07.09.2026. https://developers.sber.ru/docs/ru/gigachat/tariffs/legal-tariffs
- Сбер. Модели GigaChat 2 Max, GigaChat 2 Pro, GigaChat 2 Lite. Размеры контекстных окон, сняты 11.09.2026. https://developers.sber.ru/docs/ru/gigachat/models/main
- Сбер. Соглашение об использовании сервиса GigaChat для физических лиц от 06.02.2026, пункт 6.3. https://developers.sber.ru/docs/ru/policies/gigachat-agreement/individuals
- Stanford HAI. AI Index Report 2026, глава 3 «Responsible AI»: бенчмарки AA-Omniscience (рисунок 3.2.6), HHEM (рисунок 3.2.5), KaBLE (рисунок 3.2.8), статистика AI Incident Database. https://hai.stanford.edu/assets/files/ai_index_report_2026_chapter_3_responsible_ai.pdf
- Vaswani A. и соавторы. Attention Is All You Need. arXiv:1706.03762, подана 12.06.2017. https://arxiv.org/abs/1706.03762
- Федеральный закон «О персональных данных» от 27.07.2006 № 152-ФЗ, статья 18. https://www.consultant.ru/document/cons_doc_LAW_61801/cbf4e15b7c330f9372e876cdf2bc928bad7950ef/