Промпт-инжиниринг

Материал из Самая полная в Рунете энциклопедия интернет-маркетинга
Перейти к навигации Перейти к поиску


Промпт-инжиниринг это подбор формулировки запроса к генеративной модели так, чтобы ответ годился в работу без переделки. Сам запрос называют промптом: это текст, который человек или программа отправляет модели, вместе с приложенными данными и требованиями к формату ответа. Дисциплина выросла из простого наблюдения. Одна и та же модель на один и тот же по смыслу вопрос отвечает по-разному, стоит переставить слова, добавить пример или попросить рассуждать вслух.

Приёмов накопилось много. Систематический обзор «The Prompt Report», собранный командой из 31 автора по 1565 отобранным работам, описывает 58 техник только для текста. Беда справочников в другом: приёмы в них перечисляют так, будто они ничего не стоят. На деле каждый меняет две вещи, которые видно в счёте и в интерфейсе, число токенов и время ответа.

Статья про разговор с моделью, а не про её устройство. Как модель обучена, разбирает Большая языковая модель, как подключить к ней свои документы, RAG, как превратить её в сценарий с инструментами, ИИ-агент. Общая рамка технологии в статье Генеративный ИИ.

Пять частей запроса слева, токенизация в середине, веер вариантов следующего кусочка и ручки управления справа
Из чего собран запрос и в какой момент модель выбирает следующий кусочек

Промпт, промт и соседние понятия

Промпт и промт. Два разных слова, и путаница здесь механическая. Промпт происходит от английского prompt, подсказка или приглашение к вводу. ПРОМТ с одной буквой «п» это петербургская компания машинного перевода, основанная в 1991 году, и её сервис Translate.ru, открытый 6 марта 1998 года. К нейросетям бренд отношения не имеет, но забирает себе выдачу. На 11 сентября 2026 года по запросу «промпт» первую десятку Яндекса занимали переводчик и материалы о нём, все десять позиций.

Промпт и поисковый запрос. В поиске запрос это ключ к уже написанным документам, промпт это инструкция на создание текста, которого до запроса не существовало. Отсюда разница в проверке: ссылку можно открыть, а сгенерированное утверждение приходится сверять отдельно. Как ведут себя поисковики с нейроответами, разобрано в статье GEO и AEO: продвижение в ответах нейросетей.

Промптинг и дообучение. Дообучение меняет веса модели и требует размеченного набора данных, см. Датасет и Машинное обучение. Промптинг весов не трогает вовсе. Он живёт в пределах одного запроса и стоит столько, сколько стоят его токены.

Промптинг и контекстная инженерия. С приходом агентских сценариев отдельной задачей стало то, что вообще попадает в контекстное окно: документы, история диалога, результаты вызова инструментов. Окно конечное. У YandexGPT Pro 5.1 и Lite 5 оно составляет 32 768 токенов, и что туда не поместилось, для модели не существует.

Откуда взялось

Точка отсчёта это статья «Language Models are Few-Shot Learners» от 28 мая 2020 года, представившая GPT-3 на 175 млрд параметров. Авторы показали, что модель решает задачу по нескольким примерам прямо в тексте запроса, без обновления весов. Настраивать её поведение словами стало возможно тогда.

Дальше всё случилось за три года. В январе 2022 года вышла работа про цепочку рассуждений: восемь примеров с расписанным ходом решения подняли точность PaLM 540B на школьных задачах GSM8K с 17,9 до 56,9%. В мае того же года обнаружилось, что похожий эффект даёт одна фраза «Let's think step by step» вообще без примеров, и на той же GSM8K модель text-davinci-002 поднялась с 10,4 до 40,7%. К 2024 году приёмов стало столько, что понадобился систематический обзор.

Как это устроено

Текст превращается в токены

Модель не видит букв. Текст режется на токены, куски в несколько символов, и счёт идёт в них же, отдельно за вход и отдельно за выход. Токенайзер у каждого семейства моделей свой, и от него цена одного и того же текста зависит сильнее, чем от длины этого текста.

Замер 11 сентября 2026 года, письмо клиента длиной 62 слова и 432 знака. Токенайзер o200k_base укладывает его в 120 токенов, cl100k_base в 207. Разница в 1,7 раза, а текст не изменился ни на символ. Тот же замер показывает, что расхожее «русский язык дороже вдвое» устарело вместе с токенайзером: в cl100k_base русское письмо стоило в 1,92 раза дороже своего английского перевода, в o200k_base только в 1,13 раза.

Разница между семействами моделей осталась, и её меряет сам поставщик. По таблице Yandex AI Studio на паре текстов примерно в 500 знаков один токен вмещает 5,2 знака русского текста у YandexGPT Pro, 4,6 у gpt-oss-120b и 3,6 у Qwen3 235B, тогда как на английском все три держатся около 5,4. Модель, которую не готовили под русский, дробит его мельче, и платите вы за это каждый раз.

Из чего собирают запрос

Документация GigaChat описывает структуру из четырёх частей: роль, входные данные, задача, индикатор вывода. Системная часть отделена от пользовательской и задаёт постоянные правила: кто отвечает, чего не делать, в каком виде отдавать результат. В GigaChat системное сообщение идёт первым и оно единственное на запрос.

Порядок частей не безразличен. Работа «Lost in the Middle» померила, как модель находит нужный факт в зависимости от его места в длинном контексте: на 20 документах GPT-3.5-Turbo давала 75,8% правильных ответов, когда факт стоял первым, и 53,8%, когда он оказывался в середине. В середине результат был хуже, чем у той же модели без документов вовсе, 56,1%. Рекомендация Anthropic совпадает с этим замером: длинные данные класть в начало запроса, а вопрос и инструкции в конец. В их тестах такой порядок давал прирост качества до 30% на сложных многодокументных входах.

Ручки сэмплирования

Кроме текста у запроса есть числовые параметры, и они меняют ответ не меньше формулировок. Диапазоны у поставщиков разные: значение из чужой инструкции переносить нельзя.

  • temperature задаёт разброс при выборе следующего токена. У GigaChat значение должно быть больше нуля, выше 2 ответы становятся чрезмерно случайными; у моделей Яндекса диапазон от 0 до 1.
  • top_p отсекает маловероятные продолжения, диапазон от 0 до 1. Сбер пишет прямо: совместно с температурой этот параметр использовать не рекомендуется.
  • repetition_penalty штрафует повторы. Единица нейтральна, больше единицы модель избегает повторений, меньше единицы допускает их охотнее.
  • max_tokens ограничивает длину ответа. Ограничение жёсткое: ответ обрывается на полуслове, а не сжимается. В gRPC-справке GigaChat по умолчанию стоит 2048 токенов.

Приёмы промптинга и цена каждого

Восемь приёмов плюс точка отсчёта, все на одной задаче: из письма клиента вытащить четыре поля, услугу, бюджет, срок и контактное лицо. Колонка «вход» это замер входных токенов относительно голой инструкции, занявшей 156 токенов; токенайзер o200k_base, 11 сентября 2026 года. Колонка «за что платим» про выход и задержку, и числа там из публикаций: выход без вызова модели померить нельзя.

Приём Что делает Вход, раз к базовому За что платим сверх
Zero-shot голая инструкция без примеров 1,0 ничем, это точка отсчёта
Роль задаёт, от чьего лица отвечать 1,5 только входом
Structured Output требует ответ строго по схеме 1,8 входом; схема ограничивает выход, замера нет
Few-shot показывает пять готовых пар вопрос-ответ 4,9 входом, и он оплачивается в каждом запросе заново
Chain-of-Thought просит рассуждать вслух 1,9 выходом: на GSM8K ответ GPT-4o занял 205 токенов и 4,2 секунды против 43,9 токена и 1,0 секунды у сжатого варианта
Декомпозиция режет задачу на три отдельных запроса 2,8 входом втрое, плюс три задержки подряд вместо одной
Самосогласованность прогоняет один промпт несколько раз и берёт частый ответ 9,5 при пяти прогонах всем сразу: в исходной работе сэмплировали 40 путей рассуждения
Tree-of-Thought строит и отбраковывает ветки рассуждения 2,5 выходом: авторы называют расход в 5-100 раз больше, чем у цепочки рассуждений
ReAct чередует рассуждение и вызов инструментов 2,8 на первом шаге каждым витком цикла: накопленная переписка уходит в модель заново

Колонка «вход» измерена здесь и повторится при любом прогоне. Числа в четвёртой колонке взяты из работ, где мерили другие задачи и другие модели, а остальное там выведено из механики приёма и не измерено.

Из таблицы видно главное. Вход дорожает предсказуемо, и его можно посчитать заранее хоть на калькуляторе. Выход ведёт себя иначе. Фраза «рассуждай шаг за шагом» добавляет к запросу 14 токенов, а ответ после неё вырастает в разы, и вместе с ним растёт ожидание: в руководстве OpenAI по задержке сказано, что генерация почти всегда самый медленный шаг и сокращение выходных токенов вдвое примерно вдвое же сокращает задержку.

Входную часть, в отличие от выходной, умеют удешевлять. Кэширование промпта у OpenAI даёт скидку до 90% на повторно отправленные токены при длине префикса от 1024 токенов для GPT-5.6 и новее, а кэш живёт 30 минут с последнего обращения. Для приёма few-shot это меняет арифметику: неизменные примеры в начале запроса попадают под скидку, меняющееся письмо клиента в конце нет.

Стоит ли доплата результата, решается по задаче. На головоломке Game of 24 разбор веток решил 74% задач против 4% у цепочки рассуждений, а по деньгам обошёлся в 0,74 доллара за задачу против 0,47 у ста прогонов той же цепочки. Такая сделка выгодна. Бывает и обратное: те же деньги, та же точность и вчетверо большее ожидание.

Что делать на практике

  1. Записать, что считается правильным ответом. Без эталона правка промпта оценивается на глаз.
  2. Собрать выборку из 20-50 реальных примеров, разных, а не удобных. Держать её неизменной.
  3. Замерить точность голой инструкции. Это база, с которой сравнивают всё остальное.
  4. Добавлять по одному приёму и мерить после каждого: точность, токены, время ответа.
  5. Требовать машинно проверяемый формат: JSON по схеме проверяет код, свободный текст только человек.
  6. Зафиксировать версию модели. При смене версии ответ меняется, и промпт перепроверяют заново.
  7. Считать стоимость задачи в рублях, а не в токенах. Токен это единица счёта поставщика, деньги это единица решения.

Чем измеряют

  • Доля ответов без правки на эталонной выборке. Главная метрика: она про то, экономит ли модель время.
  • Точность на задачах с единственным верным ответом.
  • Токены на задачу, вход и выход раздельно. Их соотношение показывает, куда уходят деньги.
  • Время ответа, медиана и 95-й процентиль. Среднее прячет длинный хвост.
  • Доля отказов и обрывов по лимиту длины.
  • Стабильность: один промпт, один вход, пять прогонов, сколько получилось разных ответов.

Частые ошибки

Промпт проверяют на удачных примерах. Десять знакомых случаев проходят, тысяча реальных нет. Выборку собирают из боевого потока, вместе с кривыми и неполными обращениями.

Правят несколько вещей разом. Поменяли формулировку, добавили примеры, покрутили температуру, стало лучше. Что именно сработало, неизвестно.

Примеры подбирают однотипные и в любом порядке. Пять похожих пар учат модель одному случаю, а не правилу. Порядок при этом не безразличен: работа 2021 года перебрала все 24 перестановки четырёх примеров, и часть порядков давала выше 85% точности, а часть около 50%, то есть уровень случайного угадывания.

Системный промпт держат за защиту. Он не защита, а один слой из нескольких.

Ограничения и спорные места

Цепочка рассуждений помогает не везде, и это измерено. Мета-анализ 2024 года отобрал 110 работ и 1218 парных сравнений, а сверх того прогнал 20 наборов данных на 14 моделях. Результат: на символьных и математических задачах цепочка даёт в среднем 11,4 процентного пункта, на всех остальных категориях 0,7 пункта. Обыденное знание, понимание языка и чтение с пониманием не выигрывают почти ничего.

На части задач она снижает точность. Работа «Mind Your Step (by Step)» проверила шесть архетипов задач, про которые у психологии есть замеры, что размышление вслух мешает и человеку. Падение нашлось в трёх. На распознавании искусственной грамматики GPT-4o упала с 87,5 до 64,4%, то есть на 23,1 пункта, на распознавании лиц с 64,0 до 51,2%. Работа новая и обсуждаемая, но сравнение там прямое, внутри одной модели.

Рассуждение вслух стоит времени, и расход бывает абсурдным. Замер конца 2024 года: на вопросе про сумму двух и трёх модели со встроенным рассуждением тратят в среднем на 1953% токенов больше обычных. На школьной арифметике верный ответ более чем в 92% случаев появляется уже в первом круге решения.

Приёмы не переносятся между моделями автоматически. Все числа выше получены на конкретных версиях моделей: PaLM 540B, text-davinci-002, GPT-4o, GPT-3.5-Turbo. Публикации, которая показала бы, что выигрыш приёма сохраняется при смене семейства моделей, в открытом доступе найти не удалось.

Инъекция в промпт не лечится формулировкой. В списке OWASP для приложений на больших языковых моделях редакции 2025 года внедрение инструкций стоит первой строкой, LLM01, а утечка самого системного промпта отдельной, LLM07. Причина структурная: инструкции и данные приходят модели по одному каналу. Сам OWASP пишет, что при вероятностной природе моделей неясно, существуют ли надёжные методы полной защиты. Отсюда практика, которую Anthropic формулирует прямо: недоверенное содержимое класть только в результаты вызова инструментов, никогда в системный промпт, и урезать права сценария до минимума. Для чат-ботов и ассистентов это значит одно: чужой текст в контексте это данные, а не команда.

Судьба самой профессии спорна. Съём выдачи Яндекса по запросу «промпт инжиниринг» 11 сентября 2026 года: пять страниц первой десятки продают обучение, а не объясняют предмет. При этом модели учат понимать короткие формулировки, и часть приёмов 2022 года на нынешних версиях прироста уже не даёт. Проверяемого прогноза здесь нет ни у кого, а цифры вакансий из рекламы курсов доказательством не являются.

Что здесь быстро устаревает

  • Все числа про токены и задержки. Они привязаны к версии модели и к токенайзеру. Признак устаревания: поставщик сменил семейство моделей или объявил новый токенайзер.
  • Соотношение цены русского и английского текста. Оно улучшалось с каждым поколением токенайзеров и, скорее всего, продолжит улучшаться.
  • Выигрыш конкретных приёмов. Цепочку рассуждений измеряли на моделях 2022-2024 годов. У моделей со встроенным рассуждением просьба рассуждать вслух может не добавлять ничего.
  • Названия параметров, их диапазоны и условия кэширования. temperature, top_p и repetition_penalty поддерживает не каждый интерфейс, границы значений у поставщиков разные, а порог кэша в 1024 токена привязан к поколению моделей.
  • Что проверить при ревизии: цены за токены и размер контекстного окна у поставщика, поддерживаемые параметры в его документации, свежую редакцию списка OWASP, появились ли замеры переноса приёмов между семействами моделей.

См. также

Источники

  1. Brown T. B. и др. Language Models are Few-Shot Learners. arXiv:2005.14165, 28.05.2020.
  2. Wei J. и др. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903, 28.01.2022. Таблица 1, GSM8K, PaLM 540B.
  3. Kojima T. и др. Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916, 24.05.2022.
  4. Wang X. и др. Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171, 21.03.2022.
  5. Yao S. и др. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601, 17.05.2023. Game of 24, расход токенов и стоимость задачи.
  6. Yao S. и др. ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629, 06.10.2022.
  7. Schulhoff S., Ilie M. и др. The Prompt Report: A Systematic Survey of Prompting Techniques. arXiv:2406.06608, 06.06.2024. 58 текстовых техник, 1565 отобранных работ.
  8. Sprague Z. и др. To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning. arXiv:2409.12183, 18.09.2024. 110 работ, 1218 парных сравнений, 20 наборов данных, 14 моделей.
  9. Liu R. и др. Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse. arXiv:2410.21333, 27.10.2024.
  10. Liu N. F. и др. Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172, 06.07.2023.
  11. Lu Y., Bartolo M. и др. Fantastically Ordered Prompts and Where to Find Them. arXiv:2104.08786, 18.04.2021.
  12. Xu S. и др. Chain of Draft: Thinking Faster by Writing Less. Zoom Communications, arXiv:2502.18600, 25.02.2025. GSM8K, GPT-4o: 205,1 токена и 4,2 с против 43,9 токена и 1,0 с.
  13. Chen X. и др. Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs. arXiv:2412.21187, 30.12.2024.
  14. LLM01:2025 Prompt Injection и OWASP Top 10 for LLM Applications 2025. OWASP GenAI Security Project, 11.09.2026.
  15. Основы промпт-инжиниринга. GigaChat, Сбер, 11.09.2026.
  16. Справка gRPC API GigaChat, параметры генерации. Сбер, 11.09.2026.
  17. Токены. Yandex AI Studio, 11.09.2026. Таблица символов на токен по трём моделям.
  18. Модели генерации текста. Yandex AI Studio, 11.09.2026. Размер контекстного окна.
  19. Latency optimization. OpenAI, 11.09.2026. Сокращение выходных токенов и задержка.
  20. Prompt caching. OpenAI, 11.09.2026. Скидка, порог префикса и срок жизни кэша.
  21. Claude prompting best practices. Anthropic, 11.09.2026. Порядок частей запроса в длинном контексте.
  22. Mitigate jailbreaks and prompt injections. Anthropic, 11.09.2026.
  23. Translate.ru. Википедия, 11.09.2026. Дата запуска сервиса и год основания компании.