Генеративный ИИ

Материал из Самая полная в Рунете энциклопедия интернет-маркетинга
Перейти к навигации Перейти к поиску


Генеративный ИИ это класс моделей машинного обучения, которые по запросу создают новый объект: текст, изображение, звук, видео, программный код, структуру молекулы. Задача у них другая, чем у привычных рабочих моделей. Классификатор отвечает на вопрос «что это такое», генеративная модель отвечает «вот ещё один такой же».

За словом стоит не одна технология. Под ним живут четыре семейства архитектур, пришедших из разных областей математики: состязательные сети, вариационные автокодировщики, диффузионные модели и авторегрессионный трансформер. Ведут они себя по-разному, и разница видна на счёте за вычисления и на том, насколько результатом вообще можно управлять.

Про область целиком, её историю и классы задач написано в статье Искусственный интеллект. Здесь разобран механизм генерации: четыре семейства и их цена, метрики качества, нормы российского права о сгенерированном.

Верхняя лента ведёт изображение к ряби, нижняя встречная возвращает его обратно, текстовое условие входит стрелками в каждый шаг
Обучение идёт с конца: сеть учится узнавать шум, чтобы потом его вычитать

Чем отличается от соседних понятий

От искусственного интеллекта. Искусственный интеллект это название области. Генеративные модели её часть, причём не самая старая: символьные системы появились на десятилетия раньше.

От машинного обучения. Машинное обучение это способ получить модель из данных. Генеративность это свойство задачи, а не способа обучения.

От дискриминативных моделей. Скоринг, антифрод и прогноз спроса тоже учатся на данных, но выдают метку или число, поэтому проверяются просто: есть правильный ответ, считается ошибка. У генерации правильного ответа нет вовсе, и это меняет всю приёмку работы.

От большой языковой модели. Большая языковая модель это текстовая ветка генеративного ИИ, построенная на авторегрессионном трансформере. Обратное неверно. Диффузионная модель изображений языковой моделью не является, хотя запрос принимает такой же.

От дипфейка. Дипфейк это применение генерации к лицу и голосу конкретного человека. Механизм тот же, предмет и правовые последствия другие.

Откуда взялось

Точки отсчёта четыре, и в один год они не сходятся.

Генеративно-состязательные сети описаны 10 июня 2014 года в работе Яна Гудфеллоу и соавторов: генератор создаёт образец, дискриминатор пытается отличить его от настоящего, и обучаются они одновременно. Вариационный автокодировщик появился раньше, 20 декабря 2013 года, в работе Дидерика Кингмы и Макса Веллинга. Диффузионный подход впервые изложен 12 марта 2015 года в статье Яши Соль-Дикстайна и соавторов, которые взяли идею из неравновесной термодинамики. Рабочим для картинок он стал только 19 июня 2020 года, когда Джонатан Хо, Аджай Джайн и Питер Аббил показали качество на уровне тогдашних состязательных сетей.

Архитектуру трансформера описали 12 июня 2017 года, и авторы отказались сразу и от рекуррентности, и от свёрток, оставив в сети один только механизм внимания. Через три года на этой архитектуре собрали GPT-3 со 175 миллиардами параметров, и стало ясно, что текстовая генерация упирается не в идею, а в масштаб.

Последний сдвиг был экономический. 20 декабря 2021 года вышла работа Робина Ромбаха и соавторов про латентную диффузию: шум убирают не в пикселях, а в сжатом пространстве автокодировщика. Требования к вычислениям упали, и генерация картинок разошлась по массовым сервисам.

Как это устроено

Четыре семейства и их сравнение

Семейство Механизм Чем управляют результатом Цена вычислений Типичная модальность
Генеративно-состязательная сеть (GAN) Генератор делает образец, дискриминатор отличает подделку от настоящего, обе сети учатся друг против друга Латентный вектор и условная метка Обучение неустойчиво и дорого, зато генерация идёт одним проходом сети и стоит меньше всех Лица, увеличение разрешения, перенос стиля
Вариационный автокодировщик (VAE) Кодировщик сжимает объект в распределение, декодировщик восстанавливает объект из точки этого распределения Латентное пространство непрерывно, по нему можно двигаться плавно и смешивать признаки Самое дешёвое семейство и в обучении, и в генерации. Детали при этом смазываются Сжатие, поиск похожего, латентный слой внутри диффузионных моделей
Диффузионная модель Прямой процесс превращает картинку в шум, обратный убирает шум пошагово; сеть предсказывает добавленный шум Текстовое условие, сила следования условию, число шагов, начальное зерно Самая дорогая генерация: у авторов исходной работы обратный процесс занимает 1000 шагов сети Изображения, видео, звук
Авторегрессионный трансформер Модель предсказывает следующий элемент последовательности по всем предыдущим и дописывает результат по одному токену Запрос, температура, отсечение по вероятности, длина ответа, системная инструкция Генерация линейна по длине ответа, но внимание растёт квадратично от длины контекста Текст, код, разметка, речь

Семейства не конкуренты, они складываются. В латентной диффузии сжатие делает автокодировщик, шум убирает диффузионная часть, а текстовое условие подмешивает трансформер.

Как из шума получается изображение

Обучение идёт с конца. Берут настоящую картинку и порциями добавляют к ней случайный шум, пока не останется чистая рябь. Сеть смотрит на зашумлённый кадр и учится отвечать на один вопрос: какой именно шум сюда добавили. Больше она не делает ничего.

Генерация разворачивает ту же процедуру задом наперёд: сеть получает чистый шум, предсказывает его часть, вычитает, получает картинку чуть чище и повторяет всё сначала. В исходной работе 2020 года таких шагов тысяча, отсюда и главный недостаток семейства: за один результат сеть считается сотни раз.

Текстовое условие подмешивается на каждом шаге. Сила подмешивания настраивается отдельным числом, и способ описан в работе Джонатана Хо и Тима Салиманса от 26 июля 2022 года. Компромисс там прямой, и знать о нём стоит любому, кто крутит ползунки в интерфейсе: чем жёстче модель следует запросу, тем однообразнее становятся результаты.

Три ручки текстовой модели

  • Токен. Единица счёта. Кусок текста в несколько символов, на который модель делит и запрос, и ответ. В документации Yandex AI Studio приведён пример: 501 символ русского текста укладывается в 96 токенов.
  • Контекст. Сколько токенов модель видит одновременно. Всё, что не поместилось, для неё не существует, и отсюда растёт добрая половина жалоб на забывчивость модели в длинном рабочем диалоге.
  • Температура. Разброс при выборе следующего токена. Ноль даёт почти повторяемый ответ, высокое значение даёт разнообразие и заодно больше выдумки.

Из этих трёх ручек следует свойство, которое чаще всего принимают за поломку. Один и тот же запрос даёт разные ответы. Для черновика это безразлично, для расчёта губительно.

Во что обходится один результат

Столбец таблицы про вычисления виден в прайсах, и разрыв там на три порядка. Текст считают тысячами токенов: у Сбера синхронный вызов GigaChat Lite стоит 0,065 ₽ за тысячу, GigaChat Max 0,65 ₽, а YandexGPT Pro 5.1 в Yandex AI Studio 0,8 ₽ на входе и столько же на выходе, все цены с НДС. Картинку считают поштучно: один запрос на генерацию изображения в том же Yandex AI Studio стоит 2,23 ₽ с НДС.

Разрыв объясняется механизмом, и жадность поставщика тут ни при чём. Абзац текста это один проход сети на каждый токен, а картинка это десятки или сотни полных проходов подряд. Поэтому у зарубежных сервисов цена за изображение тоже привязана к качеству: Stability AI продаёт кредиты по опубликованному курсу в один цент за кредит, и генерация в Stable Image Ultra стоит 8 кредитов против 2,5 у облегчённой Stable Diffusion 3.5 Flash.

Что делать на практике

Начинать с модальности. Задача с текстом ведёт к авторегрессионной модели, задача с изображением почти всегда к диффузионной. Выбор семейства определяет и цену, и способ проверки.

Заранее решать, где окажутся данные. Облачная модель получает запрос целиком, вместе с приложенным документом, а юридическая рамка для персональных данных и порядок пилота разобраны в статье Нейросети для бизнеса.

Фиксировать зерно, когда нужен повтор. Диффузионные сервисы позволяют задать начальное число, и при тех же настройках картинка воспроизводится в точности. Иначе сравнивать две версии запроса бессмысленно.

Проверять на выборке, а не на одном примере. Удачный первый результат ничего не говорит о модели. Нужны хотя бы несколько десятков задач с известным правильным ответом.

Разделять черновик и публикацию. Сгенерированный текст без вычитки уходит в индекс поисковых систем как малополезный контент, и требования Яндекса на этот счёт сформулированы прямо. Как работает продвижение материалов в ответах самих нейросетей, разобрано в статье GEO и AEO.

Чем измеряют

  • FID для изображений. Расстояние между распределением признаков сгенерированных картинок и настоящих, введено в работе Мартина Хойзеля и соавторов 26 июня 2017 года. Чем меньше, тем ближе к настоящим.
  • Перплексия для текста. Насколько модель удивлена настоящим продолжением. Меряет языковую способность, а не правдивость.
  • Доля ответов, принятых без правки. Единственная метрика, которая напрямую переводится в сэкономленные часы. Выборка у каждой компании своя.
  • Оценка людьми. Остаётся основным способом приёмки: формальные метрики не ловят смысловые ошибки и не отличают складную выдумку от правды.

Правовая рамка в России

Ниже названы нормы. Толкования, разбора споров и советов по оформлению прав здесь нет: это работа юриста, а не справочной статьи.

Авторство в российском праве привязано к человеку. Статья 1257 Гражданского кодекса: автором произведения признаётся гражданин, творческим трудом которого оно создано. Пункт 1 статьи 1228 отдельно называет тех, кто автором не признаётся, включая лиц, оказавших только техническое содействие.

С 1 сентября 2026 года действует Федеральный закон от 26 июля 2026 года № 243-ФЗ о поддержке развития технологий искусственного интеллекта. Статья 3 вводит понятие большой фундаментальной модели: программа с не менее чем одним миллиардом параметров. Статья 9 посвящена маркировке информационного материала, созданного с применением таких моделей, статья 10 требованиям к использованию результатов интеллектуальной деятельности при их разработке и применении. Обе вступают в силу позже самого закона, с 1 марта 2027 года.

Единого ответа на вопрос, охраняется ли сгенерированный результат авторским правом, в этих нормах нет. Вопрос спорный.

Частые ошибки

Ждут от одного семейства чужих свойств. Диффузионной модели заказывают точный текст на картинке, авторегрессионной точный счёт. Обе задачи лежат в стороне от того, что эти архитектуры оптимизируют.

Берут чужое число из пересказа. Оценка доли ИИ-текста в интернете прошла путь от препринта до заголовка «треть сайтов создана нейросетями», растеряв по дороге половину условий. Ниже разобран именно этот случай.

Путают генерацию с поиском. Модель не ищет факт, она достраивает вероятное продолжение. Механизм подключения внешних документов разобран в статье ИИ-ассистент.

Ограничения и спорные места

Выдумка это свойство, а не сбой. Модель выбирает вероятное продолжение, а не проверенное. Отсутствующий факт достраивается похожим по форме, и придуманная ссылка выглядит в ответе ровно так же обыденно, как настоящая, пока её не откроешь. Отдельного режима «не знаю» у базовой модели нет.

Метрики качества косвенные. FID сравнивает распределения признаков через стороннюю сеть-классификатор и о самой картинке по существу молчит. Перплексия не отличает правду от выдумки вовсе, а общей метрики для сравнения текстовой модели с картиночной не существует.

Обучение состязательных сетей нестабильно. Проблема коллапса мод, когда генератор сваливается в узкий набор однотипных результатов, названа прямо в работе Люка Метца и соавторов от 7 ноября 2016 года. Это одна из причин, по которой изображения в массовых сервисах ушли к диффузии.

Доля ИИ-текста в интернете измерена спорно. Препринт Imperial College London, Internet Archive и Стэнфорда от 14 апреля 2026 года оценивает, что к середине 2025 года до 35% новых англоязычных веб-страниц были сгенерированы или отредактированы с участием ИИ. Оговорок к этому числу больше, чем самого числа. Оно относится к страницам, впервые попавшим в архив Internet Archive, а не к доменам; выборка только англоязычная; её итоговый размер в работе не назван; исследование не проходило рецензирование; работа выполнена при грантовой поддержке разработчика того самого детектора, которым считали. Другой препринт, от 30 апреля 2026 года, прямо спорит с методом этого класса работ и утверждает, что детекторы машинного текста работают заметно хуже заявленного, если требовать низкой доли ложных срабатываний на человеческих текстах.

Детекторы машинного текста ненадёжны на коротком тексте. В том же апрельском препринте приведён замер для одного из открытых детекторов: на фрагментах в одно-десять слов доля ложных срабатываний достигает 35%.

Оценки российского рынка расходятся в разы. РБК со ссылкой на аналитиков Onside и Just AI приводит объём рынка генеративного ИИ около 13 млрд ₽ за 2024 год и около 58 млрд ₽ по итогам 2025 года, а весь рынок ИИ за 2024 год оценивает вилкой от 130 до 305 млрд ₽. Вилка шире двукратной, и это говорит о методиках подсчёта больше, чем о самом рынке.

Авторское право не разрешено ни в одну сторону. Нормы названы выше, а единой практики их применения к машинному результату статья не приводит сознательно.

Что здесь быстро устаревает

  • Цены. Сняты с прайсов вендоров 11 сентября 2026 года и живут примерно полгода. Проверять надо и сами числа, и единицу тарификации: она меняется не реже цены.
  • Тысяча шагов диффузии. Число описывает работу 2020 года, а не нынешние сервисы: шаги сокращают дистилляцией от версии к версии, а следом падает и цена картинки. Признак протухания простой, в документации сервиса появилась генерация за единицы шагов.
  • Названия, версии моделей и даты вступления в силу статей закона № 243-ФЗ. Первое меняется быстрее всего остального в статье, поэтому имён моделей в тексте почти нет; второе проверяется по действующей редакции, где 1 марта 2027 года стоит плановой датой для статей 8, 9 и 10.
  • Оценка в 35%. Препринт не рецензирован и оспаривается. Признак протухания: появление рецензированной работы с другой методикой измерения.

См. также

Источники

  1. Kingma D. P., Welling M. Auto-Encoding Variational Bayes. arXiv:1312.6114, 20.12.2013.
  2. Goodfellow I. J. и др. Generative Adversarial Networks. arXiv:1406.2661, 10.06.2014.
  3. Sohl-Dickstein J. и др. Deep Unsupervised Learning using Nonequilibrium Thermodynamics. arXiv:1503.03585, 12.03.2015.
  4. Metz L. и др. Unrolled Generative Adversarial Networks. arXiv:1611.02163, 07.11.2016.
  5. Vaswani A. и др. Attention Is All You Need. arXiv:1706.03762, 12.06.2017.
  6. Heusel M. и др. GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium. arXiv:1706.08500, 26.06.2017, метрика FID.
  7. Brown T. B. и др. Language Models are Few-Shot Learners. arXiv:2005.14165, 28.05.2020, GPT-3 на 175 млрд параметров.
  8. Ho J., Jain A., Abbeel P. Denoising Diffusion Probabilistic Models. arXiv:2006.11239, 19.06.2020, T = 1000 шагов.
  9. Rombach R. и др. High-Resolution Image Synthesis with Latent Diffusion Models. arXiv:2112.10752, 20.12.2021.
  10. Ho J., Salimans T. Classifier-Free Diffusion Guidance. arXiv:2207.12598, 26.07.2022.
  11. Dolezal J., Alam S., Graham M., Bohacek M. The Impact of AI-Generated Text on the Internet. arXiv:2604.26965, 14.04.2026, препринт без рецензирования, Imperial College London, Internet Archive, Stanford University.
  12. He S. S. и др. DeGenTWeb: A First Look at LLM-dominant Websites. arXiv:2605.00087, 30.04.2026, препринт.
  13. Статья 1257 Гражданского кодекса РФ. КонсультантПлюс, 11.09.2026.
  14. Статья 1228 Гражданского кодекса РФ, пункт 1. КонсультантПлюс, 11.09.2026.
  15. Федеральный закон от 26.07.2026 № 243-ФЗ «О поддержке развития технологий искусственного интеллекта в Российской Федерации», статья 3. КонсультантПлюс, 11.09.2026.
  16. Статья 13 Федерального закона № 243-ФЗ, порядок вступления в силу. КонсультантПлюс, 11.09.2026.
  17. Токены. Yandex Cloud, 11.09.2026.
  18. Правила тарификации для Yandex AI Studio. Yandex Cloud, цены с НДС, снято 11.09.2026.
  19. Тарифы GigaChat API для юридических лиц. Сбер, обновлено 07.09.2026.
  20. Pricing. Stability AI, кредиты по правилу «1 credit = $0.01», снято 11.09.2026.
  21. Что такое генеративный ИИ, как он работает и каким бывает. РБК Тренды, оценки Onside и Just AI, обновлено 13.01.2026.
  22. Малополезный контент. Яндекс Вебмастер, 11.09.2026.