Большая языковая модель

Материал из Самая полная в Рунете энциклопедия интернет-маркетинга
Перейти к навигации Перейти к поиску

Большая языковая модель (LLM, от английского large language model) это программа, которая предсказывает следующий фрагмент текста по предыдущему и за счёт этого составляет связные ответы. Внутри она устроена как нейросеть архитектуры Transformer, обучена на очень большом корпусе текстов и хранит статистику языка в миллиардах числовых коэффициентов. Знаний в человеческом смысле у неё нет. Есть распределение вероятностей, из которого модель раз за разом достаёт очередной кусочек текста.

Устройство трансформера разобрано в статьях Нейросеть и Машинное обучение, и повторять его здесь незачем. Прикладная половина темы устроена иначе, и именно она решает судьбу внедрения: модель продаётся по токенам, дорожает от длины документа, ошибается с измеримой частотой и по-разному обращается с данными, которые в неё загрузили.

Ниже собраны цены вендоров на 11 сентября 2026 года, размеры контекстных окон из их же документации и доли галлюцинаций по двум разным бенчмаркам. Цены на этом рынке меняются несколько раз в год, поэтому дата снятия указана прямо в таблице и повторена в разделе об устаревании.

Контекстное окно из четырёх частей, разной штриховкой отмечено, что тарифицируется как вход, а что как выход
Почему инструкция оплачивается на каждом запросе, а длинный ответ дороже длинного вопроса

Чем отличается от соседних понятий

  • Нейросеть это общий класс алгоритмов. Большая языковая модель это частный случай нейросети, обученный на тексте.
  • Машинное обучение это способ построить такую модель: алгоритм подбирает коэффициенты по данным, а не получает их от программиста.
  • Генеративный ИИ это модели, которые создают новый контент. Языковая модель работает с текстом, соседние по классу модели с изображением, звуком и видео.
  • Чат-бот это интерфейс. Он может работать на кнопочных сценариях без всякой модели, а может вызывать LLM на каждое сообщение.
  • ИИ-агент это модель плюс право вызывать инструменты и выполнять действия по шагам, а не только отвечать текстом.
  • RAG это способ заставить модель отвечать по документам компании: нужные фрагменты находятся поиском и подкладываются в запрос. Сама модель при этом не дообучается и ничего нового не запоминает.

Откуда взялось

Архитектура, на которой держатся все современные языковые модели, описана в работе «Attention Is All You Need», поданной в arXiv 12 июня 2017 года группой авторов из Google (Ашиш Васвани и соавторы). Её идея в том, чтобы отказаться от рекуррентных и свёрточных слоёв и оставить только механизм внимания. Статье девять лет. Дальнейшие годы это масштабирование той же схемы: больше параметров, больше данных, длиннее контекст.

Как это устроено

Токен, а не слово

Модель не видит букв и слов. Текст режется на токены: частые куски символов, из которых язык собирается чаще всего. Счёт идёт именно в них. В них же выставляется счёт за работу. Документация Яндекса приводит замер на русском тексте: 501 символ превращается в 96 токенов при работе с YandexGPT Pro, то есть около 5,2 символа на токен. У Anthropic в глоссарии для английского названа другая величина, примерно 3,5 символа на токен, и сравнивать эти числа между собой нельзя: у каждого вендора свой токенизатор.

Контекстное окно

Контекстное окно это объём текста, который модель удерживает в работе одновременно: ваш запрос, приложенные документы, история переписки и сам ответ. Всё, что не влезло, для модели не существует. Разброс тут в десятки раз. У YandexGPT Pro 5.1 окно составляет 32 768 токенов, у GigaChat 2 Max 128 000, у Claude Opus 5 и Gemini 3.8 Flash порядка миллиона.

Это не абстрактная характеристика. Договор на сорок страниц в окно на 32 тысячи токенов целиком не поместится, и придётся резать его на части или строить RAG.

Почему ответ каждый раз разный

За разнообразие отвечает параметр «температура»: чем он выше, тем охотнее модель выбирает менее вероятное продолжение. Anthropic в своей документации предупреждает отдельно: даже при нулевой температуре одинаковый запрос может дать разные ответы. Полной детерминированности нет. Для справочного бота это означает, что один и тот же вопрос клиента иногда получит два разных ответа.

Что делать на практике

Сколько стоит обращение к модели

Зарубежные вендоры считают вход и выход отдельно, цены в долларах за миллион токенов. Данные сняты со страниц тарифов вендоров 11 сентября 2026 года.

Модель Вход, $ за 1 млн Выход, $ за 1 млн Окно контекста Под какую задачу
GPT-6 Astra (OpenAI) 10 50 1,05 млн сложные рассуждения, длинные агентские сценарии
GPT-5.6 Terra (OpenAI) 2 12 1,05 млн основная содержательная работа с текстом
GPT-5.6 Luna (OpenAI) 0,20 1,20 1,05 млн массовая механика: разметка, классификация
Claude Opus 5 (Anthropic) 5 25 1 млн код, длинные документы, агентские задачи
Claude Sonnet 5 (Anthropic) 2 10 1 млн повседневная работа, где важна скорость
Claude Haiku 4.5 (Anthropic) 1 5 200 тыс. быстрые короткие ответы
Gemini 3.8 Flash (Google) 0,75 3,75 1 048 576 большой объём при длинном контексте

Цена Gemini 3.8 Flash действует до 31 декабря 2026 года, с 1 января 2027 года вендор объявил удвоение: 1,50 и 7,50 доллара.

Российские вендоры считают иначе: цена одна за тысячу токенов, без разделения на вход и выход, в рублях и с НДС.

Модель Цена за 1000 токенов, ₽ Окно контекста Под какую задачу
YandexGPT Pro 5.1 0,8 32 768 работа с текстом внутри контура Яндекса
YandexGPT Lite 0,2 32 768 простые короткие задачи
GigaChat 2 Max 0,65 128 000 самые сложные задачи линейки
GigaChat 2 Pro 0,5 128 000 ресурсоёмкие задачи
GigaChat 2 Lite 0,065 128 000 простые повседневные задачи

Две закономерности видны прямо из таблиц. Первая: у зарубежных вендоров выходной токен стоит ровно в пять раз дороже входного почти у всех перечисленных моделей, а у GPT-5.6 Luna и GPT-5.6 Terra в шесть раз. Значит длинный ответ бьёт по бюджету сильнее, чем длинный вопрос. Вторая: разрыв внутри одной линейки достигает пятидесяти раз по входу, если сравнить GPT-6 Astra и GPT-5.6 Luna. У Сбера разрыв между Lite и Max десятикратный.

Расчёт на тысячу ответов

Возьмём типовой сценарий поддержки: в модель уходит 2000 входных токенов (вопрос плюс кусок инструкции), обратно приходит 500. Тысяча таких обращений это 2 млн входных и 500 тыс. выходных токенов. По ценам из таблиц выше получается:

  • GPT-5.6 Luna: 1,00 доллара
  • Gemini 3.8 Flash: 3,38 доллара
  • Claude Sonnet 5: 9,00 долларов
  • Claude Opus 5: 22,50 доллара
  • GPT-6 Astra: 45,00 долларов
  • GigaChat 2 Lite: 162,50 ₽
  • YandexGPT Pro 5.1: 2000 ₽

Между крайними долларовыми строками разрыв в сорок пять раз. Курсовую конвертацию здесь сознательно не делаем: курс меняется ежедневно и превратил бы таблицу в устаревшую на следующий день. Считайте по своему курсу на день расчёта.

Что происходит с данными компании

Вопрос, который решается до выбора модели, а не после. У OpenAI в документации сказано прямо: с 1 марта 2023 года данные, отправленные в API, не используются для обучения моделей, если клиент сам не согласился ими делиться. При этом логи для контроля злоупотреблений по умолчанию хранятся до 30 дней, а режим нулевого хранения включается отдельно и по согласованию с вендором.

Для российской компании к этому добавляется вопрос размещения. Часть 5 статьи 18 закона «О персональных данных» (152-ФЗ) требует, чтобы запись, хранение и уточнение персональных данных граждан России шли в базах на территории России. Соглашение Сбера об использовании GigaChat от 6 февраля 2026 года содержит пункт 6.3: контент клиента не используется правообладателем в собственных целях, не связанных с предоставлением сервиса.

Практический вывод один. Условия хранения проверяются по документу вендора. До загрузки первого клиентского файла, а не после.

Чем измеряют

  • Доля галлюцинаций. Сколько ответов содержат выдуманный факт. Числа по разным бенчмаркам различаются на порядок, см. ниже.
  • Время до первого токена (TTFT). Задержка между запросом и началом ответа. Для чата критична, для ночной пакетной обработки безразлична.
  • Цена решённой задачи. Не цена за миллион токенов, а сумма за один полезный результат: разобранное письмо, размеченный отзыв, готовое описание товара.
  • Доля ответов, дошедших до человека. Сколько обращений бот закрыл сам, а сколько передал оператору.

Про галлюцинации есть свежий замер, и он показывает главную ловушку темы. В отчёте AI Index Report 2026 (Стэнфордский институт HAI, глава 3) приведены два бенчмарка сразу. Бенчмарк AA-Omniscience компании Artificial Analysis проверяет фактическую надёжность на 6000 вопросов в шести областях, от права и медицины до разработки и математики, причём за отказ отвечать баллы не снимаются. По 26 моделям доля галлюцинаций там разошлась от 22% до 94%. Разброс больше чем вчетверо. Ниже всех доля у Grok 4.20 Beta 0305 (22%), затем Claude 4.5 Haiku (26%) и MiMo-V2-Pro (30%). Выше всех у gpt-oss-20B в режиме high (94%) и Gemini 3 Flash (92%).

Второй бенчмарк, HHEM от Vectara, меряет другое: как часто модель придумывает факты, пересказывая поданный ей документ. Там у 15 моделей верхней части рейтинга доли укладываются в 1,8-5,4%, и большинство сидит в коридоре 4-5%.

Разница между 94% и 5% это не противоречие. Это разные задачи. Авторы отчёта оговаривают прямо, что шкалы двух бенчмарков напрямую не сопоставимы. Отвечать по памяти модель не умеет. Пересказывать поданный текст умеет неплохо, и на этом построен RAG.

Частые ошибки

  • Выбор модели по названию, а не по расчёту. Разница в цене между флагманом и младшей моделью той же линейки доходит до сорока пяти раз на одной и той же тысяче ответов. Даёт ли флагман выигрыш на вашей задаче, покажет только замер на своей выборке.
  • Оплата длинного промпта на каждом запросе. Инструкция на три страницы уходит в модель с каждым обращением и оплачивается каждый раз.
  • Попытка вместить корпус документов в контекстное окно. Для этого существует RAG, а не окно на миллион токенов.
  • Вера в фактическую точность без проверки. Верный и выдуманный ответ выглядят одинаково уверенно.
  • Загрузка персональных данных клиентов до чтения условий вендора. Порядок обратный: сперва документ, потом файл.
  • Замер качества на десяти примерах. Разброс между моделями виден на сотнях, а не на десятке.

Ограничения и спорные места

Числа из бенчмарков не переносятся на ваш случай. AA-Omniscience меряет знание фактов в шести областях, от права до математики. Ваша задача может быть про разбор писем клиентов, и доля ошибок там будет своя. Бенчмарк показывает относительный порядок моделей, а не вероятность ошибки в вашем сценарии.

Про русский язык данных нет. HHEM построен на англоязычном корпусе CNN/Daily Mail, это сказано в отчёте прямо. Язык вопросов AA-Omniscience там не назван вовсе. Публичного замера галлюцинаций сопоставимого масштаба на русском в открытых источниках найти не удалось, поэтому переносить 22% или 5% на русскоязычную задачу нельзя.

Цены живут месяцами. Google в той же таблице тарифов объявил удвоение цены Gemini 3.8 Flash с 1 января 2027 года. Anthropic в документации отдельно отметил, что запланированное на 1 сентября 2026 года повышение цены Claude Sonnet 5 отменено. Прайс двигается в обе стороны.

Сравнение вендоров по цене за токен хромает. Токенизаторы разные, и один и тот же русский текст у разных вендоров даёт разное число токенов. Anthropic прямо предупреждает, что новый токенизатор моделей 4.7 и новее даёт примерно на 30% больше токенов на том же тексте. Честное сравнение делается на своей выборке запросов, а не по прайсу.

Число инцидентов растёт. База AI Incident Database зафиксировала 362 случая в 2025 году против 233 в 2024. Что именно попадает в базу, решают её составители, поэтому рост числа записей отражает и внимание к теме, а не только рост числа сбоев.

Спор про природу ошибки не закрыт. Отдельный бенчмарк KaBLE из того же отчёта показал, что точность модели падает, когда ложное утверждение подаётся как убеждение самого пользователя. У GPT-4o она упала с 98,2% до 64,4%. У DeepSeek R1 с показателя выше 90% до 14,4%. Считать это дефектом обучения или свойством самой архитектуры, отрасль не договорилась.

Что здесь быстро устаревает

  • Обе таблицы цен. Сняты 11 сентября 2026 года со страниц тарифов вендоров. Признак протухания: в таблице стоит модель, которой нет в текущем прайсе вендора.
  • Названия и версии моделей. Линейки переименовываются и снимаются с поддержки несколько раз в год.
  • Размеры контекстных окон. Растут скачками, у российских вендоров с заметным отставанием от зарубежных.
  • Доли галлюцинаций. Привязаны к отчёту 2026 года и к составу моделей в нём. Следующая редакция AI Index пересобирает выборку, и числа сместятся.
  • Условия хранения данных. Правила вендоров и тексты соглашений правятся без анонсов, дата документа Сбера в статье указана намеренно.

См. также

Источники

  1. OpenAI. Pricing. Страница тарифов API, данные сняты 11.09.2026. https://developers.openai.com/api/docs/pricing
  2. OpenAI. Models. Размеры контекстных окон, сняты 11.09.2026. https://developers.openai.com/api/docs/models
  3. OpenAI. Data controls in the OpenAI platform. Условия использования и хранения данных API, сняты 11.09.2026. https://developers.openai.com/api/docs/guides/your-data
  4. Anthropic. Pricing. Страница тарифов Claude API, данные сняты 11.09.2026. https://platform.claude.com/docs/en/about-claude/pricing
  5. Anthropic. Models overview. Контекстные окна и максимальная длина ответа, сняты 11.09.2026. https://platform.claude.com/docs/en/about-claude/models/overview
  6. Anthropic. Glossary. Определения токена, контекстного окна и температуры, сняты 11.09.2026. https://platform.claude.com/docs/en/about-claude/glossary
  7. Google. Gemini API pricing. Тарифы, данные сняты 11.09.2026. https://ai.google.dev/gemini-api/docs/pricing
  8. Google. Gemini 3.8 Flash. Лимиты входных и выходных токенов, сняты 11.09.2026. https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash
  9. Яндекс. Правила тарификации Yandex AI Studio. Цены за 1000 токенов с НДС, сняты 11.09.2026. https://aistudio.yandex.ru/docs/ru/ai-studio/pricing
  10. Яндекс. Модели генерации текста. Размеры контекстных окон, сняты 11.09.2026. https://aistudio.yandex.ru/docs/ru/ai-studio/concepts/generation/models
  11. Яндекс. Токены. Замер числа токенов на русском тексте, снят 11.09.2026. https://aistudio.yandex.ru/docs/ru/ai-studio/concepts/generation/tokens
  12. Сбер. Тарифы GigaChat API для юрлиц. Обновлено 07.09.2026. https://developers.sber.ru/docs/ru/gigachat/tariffs/legal-tariffs
  13. Сбер. Модели GigaChat 2 Max, GigaChat 2 Pro, GigaChat 2 Lite. Размеры контекстных окон, сняты 11.09.2026. https://developers.sber.ru/docs/ru/gigachat/models/main
  14. Сбер. Соглашение об использовании сервиса GigaChat для физических лиц от 06.02.2026, пункт 6.3. https://developers.sber.ru/docs/ru/policies/gigachat-agreement/individuals
  15. Stanford HAI. AI Index Report 2026, глава 3 «Responsible AI»: бенчмарки AA-Omniscience (рисунок 3.2.6), HHEM (рисунок 3.2.5), KaBLE (рисунок 3.2.8), статистика AI Incident Database. https://hai.stanford.edu/assets/files/ai_index_report_2026_chapter_3_responsible_ai.pdf
  16. Vaswani A. и соавторы. Attention Is All You Need. arXiv:1706.03762, подана 12.06.2017. https://arxiv.org/abs/1706.03762
  17. Федеральный закон «О персональных данных» от 27.07.2006 № 152-ФЗ, статья 18. https://www.consultant.ru/document/cons_doc_LAW_61801/cbf4e15b7c330f9372e876cdf2bc928bad7950ef/