Машинное обучение

Материал из Самая полная в Рунете энциклопедия интернет-маркетинга
Перейти к навигации Перейти к поиску

Машинное обучение (англ. machine learning, ML) это способ получить решающее правило из примеров вместо того, чтобы записывать его руками. Разработчик готовит таблицу наблюдений с известными ответами, алгоритм подбирает функцию, которая связывает вход с ответом, и дальше эта функция применяется к новым данным. Правило никто не формулировал. Его вывели из данных.

Разница с обычным программированием видна на примере. Чтобы отсеять неплатёжеспособных клиентов, менеджер пишет условие: заявка дороже ста тысяч и город не Москва, значит проверить вручную. Это эвристика, её придумал человек. Модель вместо этого получает историю заявок за два года с отметкой «оплатил» или «не оплатил». Дальше она сама находит, какая комбинация из сорока признаков разделяет две группы. На этом в маркетинге устроены скоринг лида, прогноз оттока, прогноз спроса, антифрод и предсказание следующей покупки.

Технология распространена меньше, чем кажется по публикациям. Росстат по методологии ИСИЭЗ НИУ ВШЭ обследовал свыше 15 тысяч крупных и средних российских организаций.[1] Технологии искусственного интеллекта в 2024 году применяли 4,8% из них, причём в компаниях свыше 500 сотрудников доля составила 14,9%, а в компаниях до 100 человек 4,1%.[2] Среди тех, кто ИИ уже использует, крупный бизнес чаще всего ставит его именно в маркетинг и продажи: 47%.[2]

Ось времени с моментом прогноза посередине: честная дорожка признаков слева, утёкшая справа
Как признак из будущего попадает в модель и почему на тесте этого не видно

Чем отличается от соседних понятий

Маркетинг и продажи чаще прочего оказываются той задачей, ради которой обучение и заводят. Мешает разговору путаница в терминах: пять слов из этого круга постоянно подменяют друг друга, хотя они вложены одно в другое.

Понятие Что это Отношение к машинному обучению
Искусственный интеллект Зонтичное название для систем, решающих задачи, которые раньше требовали человека Шире. Экспертная система на правилах это ИИ без обучения
Машинное обучение Построение правила по примерам Предмет этой статьи
Нейросеть Слои связанных элементов с настраиваемыми весами Уже. Метод внутри машинного обучения, а не его синоним
Глубокое обучение Нейросети с большим числом слоёв Ещё уже. Подкласс нейросетей
Большая языковая модель Глубокая сеть, обученная предсказывать следующий фрагмент текста Частный случай глубокого обучения

Отдельно стоит развести машинное обучение и предиктивную аналитику. Первое это инструмент, второе его применение к прогнозу спроса или поведения клиента вместе с процессом вокруг прогноза. Метрики и цену ошибки прогноза разбирает соседняя статья.

Со статистикой граница мягче. Линейная регрессия живёт в обеих дисциплинах со времён XIX века, а различие проходит по цели: статистика проверяет гипотезу о связи и требует интерпретируемых коэффициентов, машинное обучение оптимизирует ошибку на новых данных и допускает модель, устройство которой человек объяснить не может.

Откуда взялось

Термин старше любого из соседних понятий, и ввёл его Артур Самуэль. В июльском выпуске IBM Journal of Research and Development за 1959 год он описал программу, игравшую в шашки и улучшавшую собственную игру по результатам партий.[3] Годом раньше Фрэнк Розенблатт опубликовал модель перцептрона, прообраз нейросетей.[4]

Рабочее определение дал Том Митчелл в учебнике 1997 года: программа обучается на опыте E применительно к классу задач T и мере качества P, если её качество на задачах T, измеренное мерой P, растёт с накоплением опыта E.[5] Три буквы важнее формулировки. Пока задача, мера и источник опыта не названы, обсуждать обучение бессмысленно.

Переломом принято считать 2012 год. Свёрточная сеть Алекса Крижевского, Ильи Суцкевера и Джеффри Хинтона выиграла конкурс ImageNet с ошибкой top-5 в 15,3% против 26,2% у ближайшего конкурента.[6] Отрыв в десять процентных пунктов на задаче, где годами боролись за доли процента, перевёл индустрию на нейросетевые методы. В 2017 году появилась архитектура Transformer,[7] на которой выросли большие языковые модели и генеративный ИИ.

Как это устроено

Три способа учиться

Способов учиться три, и различает их то, что известно про ответ.

Обучение с учителем. В данных есть колонка с правильным ответом: купил, ушёл, вернул товар, сумма чека. Модель подбирает связь между остальными колонками и этой. Сюда попадает почти вся маркетинговая практика.

Обучение без учителя. Ответа нет, алгоритм ищет структуру сам: сегменты клиентов, похожие товары, аномальные транзакции. Результат интерпретирует человек.

Обучение с подкреплением. Модель действует в среде и получает вознаграждение за результат: так настраивают ставки в аукционах.

Признаки и разметка

Всё обучение с учителем упирается в две колонки данных. Признак это колонка таблицы: возраст, источник перехода, число заказов за полгода, среднее время между покупками. Разметка это колонка с ответом. Достаётся она дороже всего: нужна либо накопленная история, либо ручной труд живых людей. Для компьютерного зрения размечают изображения, для текста категории обращений. Качество и происхождение датасета влияют на результат сильнее выбора алгоритма.

Рекомендательные системы

Рекомендации устроены на двух семействах методов. Коллаборативная фильтрация ищет похожих пользователей по истории действий: тем, кто вёл себя как вы, понравилось вот это. Контентная сравнивает сами товары по описаниям и атрибутам. На практике их совмещают и добавляют правила бизнеса: не рекомендовать то, чего нет на складе.

Ориентир масштаба дают авторы системы Netflix: Карлос Гомес-Урибе и Нил Хант оценили вклад персонализации и рекомендаций примерно в миллиард долларов в год за счёт удержания подписчиков.[8] Считала это сама компания, по своим A/B-экспериментам.

Обучение и эксплуатация это две разные системы

Модель обучается на исторической выгрузке, а работает на живом потоке. Между ними почти всегда расхождение: другой порядок полей, другие пропуски, другая логика заполнения. Документация Google зовёт это training-serving skew и советует измерять расхождение специально.[9]

Что делать на практике

  1. Сначала эвристика. Правило номер один в руководстве Google по инженерии машинного обучения звучит так: не бойтесь запустить продукт без машинного обучения.[9] Простое правило часто даёт половину эффекта и показывает, есть ли в задаче деньги.
  2. Назовите метрику бизнеса до старта. Не точность модели, а то, что изменится: доля дозвонов, стоимость заявки, LTV, выручка на письмо.
  3. Проверьте, есть ли история. Нужны примеры с ответами за период, покрывающий сезонность. Нет истории, нет задачи.
  4. Первую модель делайте простой. Четвёртое правило того же руководства: сперва простая модель и правильная инфраструктура.[9]
  5. Делите выборку по времени, а не случайно. Обучение на прошлом, проверка на будущем. Это единственная проверка, которая повторяет условия эксплуатации.
  6. Сравните с решением без модели. Прогноз обязан обыграть ориентир вроде «завтра будет как вчера», и проверяют это через A/B-тестирование.
  7. Решите, покупать или разрабатывать. По данным ИСИЭЗ НИУ ВШЭ, российские организации чаще всего заказывают разработку на стороне (56%) или покупают готовое коммерческое ПО (53%).[2] Полный цикл в облаке закрывают платформы вроде Yandex DataSphere.[10]

После запуска начинается отдельная работа: мониторинг, переобучение, регламент отката. Встраивание прогноза в процессы описано в статьях про автоматизацию и про ИИ в маркетинге.

Чем измеряют

  • Accuracy, доля верных ответов. Простая и обманчивая метрика, см. ниже.
  • Precision, точность. Какая доля объектов, помеченных моделью, помечена верно. Отвечает на вопрос, сколько денег уйдёт на ложные срабатывания.
  • Recall, полнота. Какую долю нужных объектов модель нашла. Отвечает на вопрос, сколько упущено. Компромисс между точностью и полнотой сворачивают в один показатель F1.
  • ROC-AUC. Вероятность, что случайный положительный объект получит балл выше случайного отрицательного.
  • PR-кривая. Точность против полноты. На сильно несбалансированных данных она информативнее ROC-кривой, потому что ROC-кривая на них выглядит оптимистично из-за интуитивно неверного прочтения специфичности.[11]
  • MAE и RMSE. Для прогноза чисел: средняя абсолютная ошибка и корень из средней квадратичной.

Метрика модели и метрика бизнеса связаны через порог отсечения. Один и тот же прогноз при разном пороге даёт разную цену: где-то дороже пропустить клиента, где-то дороже потратить звонок впустую. Считать это лучше в деньгах, сведя прогноз со сквозной аналитикой.

Частые ошибки

Утечка целевой переменной

Это главная ошибка, из-за которой модель показывает почти идеальный результат на тесте и бесполезна в эксплуатации. Утечка происходит, когда в признаки попадает информация, которой в момент прогноза ещё не существует.

Маркетинговый пример. Компания строит модель оттока: кто перестанет платить в следующем месяце. В выгрузку из CRM попадает статус «заявка на расторжение». Обучение проходит блестяще, ROC-AUC около 0,99, руководитель доволен. В проде модель молчит. Причина простая: заявку клиент подаёт уже после того, как решил уйти, то есть признак описывает не будущее, а прошлое. Модель научилась узнавать ушедших по следу их ухода.

Пример не выдуман. В работе по утечкам разобран ровно такой случай в задаче оттока у сотового оператора: сильным признаком там оказалось имя интервьюера, потому что отдельного сотрудника назначали на клиентов, уже заявивших об уходе.[12]

Классический разобранный случай из научной литературы выглядит так же. В соревновании KDD Cup 2008 по выявлению рака молочной железы поле «идентификатор пациента» неожиданно оказалось сильнейшим предиктором: номера выдавались последовательно по источникам данных, а часть источников состояла почти целиком из больных.[12]

Чем ловится:

  • Подозрительно сильный признак. Один признак объясняет почти всё. В работе Кауфмана, Россета и Перлич разведочный анализ данных назван основным способом заметить утечку: она видна как удивительная закономерность там, где её быть не должно.[12]
  • Разделение обучения и предсказания по времени. Авторы той же работы предлагают помечать каждое наблюдение моментом, когда оно стало известно, и пускать в признаки только то, что было доступно до прогноза.
  • Проверка на свежем периоде. Модель, обученная до марта, проверяется на апреле и мае, которых она не видела вовсе.
  • Разговор с владельцем поля. У каждой колонки в CRM есть человек, который знает, когда она заполняется. Один такой разговор дешевле месяца обучения.

Сколько это стоит. Цена складывается из списанного бюджета проекта и решений, принятых по ложному прогнозу: скидок не тем клиентам, закупок не того товара, звонков не по тем номерам. Рублёвых оценок именно по утечке никто не публикует. Порядок цены ошибки прогноза в эксплуатации виден по случаю Zillow: в третьем квартале 2021 года компания списала около 304 млн долларов на переоценке запаса домов, закрыла направление Zillow Offers и сократила примерно четверть штата, объяснив решение тем, что непредсказуемость цен на жильё превысила ожидания её прогнозной модели.[13] Причиной там называлась не утечка, но статья расходов та же.

Точность на редких событиях

Вторая по частоте ошибка выглядит безобиднее и живёт в отчётности. Отток в месяц составляет два процента. Модель, которая всегда отвечает «не уйдёт», даёт 98% верных ответов и не находит ни одного уходящего клиента. Доля верных ответов на редких событиях бессмысленна: смотреть надо на точность и полноту при выбранном пороге.

Дрейф данных

Работающая модель ломается сама, без единой правки кода. Меняются поведение аудитории, каналы, ассортимент, сезон. В обзоре по адаптации к дрейфу концепции это описано как изменение связи между входными данными и целевой переменной во времени, и лечится мониторингом с переобучением, а не разовой настройкой.[14] Признак: качество на свежем месяце ниже, чем было на валидации, при неизменном коде.

Ошибка постановки задачи

Модель оптимизирует не ту величину: отдел маркетинга хотел рост выручки, а модель училась предсказывать клик. По итогам 65 интервью с практиками корпорация RAND поставила непонимание исходной задачи на первое место среди причин провала ИИ-проектов, нехватку данных на второе.[15]

Ограничения и спорные места

Российская цифра измеряет ИИ целиком, а не машинное обучение. Доля 4,8% получена Росстатом по методологии ИСИЭЗ НИУ ВШЭ на обследовании свыше 15 тысяч крупных и средних организаций, замер относится к 2024 году, публикация вышла 18 марта 2026 года.[2][1] В понятие ИИ там входят обработка визуальных данных, текста, звука, поддержка принятия решений и технологии повышения эффективности ИИ. Отдельной строки «машинное обучение» там нет. Малые предприятия в выборку не попали. Сами ответы это самоотчёт организаций, аудита систем никто не проводил.

Утверждение «более 80% ИИ-проектов проваливаются» ходит по отрасли без замера за спиной. Его приводит отчёт RAND 2024 года, но со ссылкой на чужую оценку: сноска ведёт на заметку в журнале Fortune от 26 июля 2022 года, где цифру называет руководитель компании, продающей ИИ-решения.[15][16] Собственный вклад RAND в другом: 65 полуструктурированных интервью с практиками с августа по декабрь 2023 года, 50 в индустрии и 15 в академии. Цифра 80% и пять причин провала это разные по надёжности утверждения.

Метрики спорны сами по себе. Работа Сайто и Ремсмайера 2015 года показала преимущество PR-кривой на несбалансированных данных,[11] но у этого вывода есть оппоненты. Препринт Мэтью Макдермотта с соавторами 2024 года разбирает то же утверждение теоретически и заключает, что PR-AUC при дисбалансе не лучше в общем случае и вдобавок склоняет оценку в пользу подгрупп, где положительных примеров больше.[17] Единой нормы отрасль не выработала.

Интерпретируемость. Объяснение отдельного решения градиентного бустинга или глубокой сети строится приближёнными методами, и для скоринга или отказа в услуге это открытый вопрос, а не решённый.

Сколько данных достаточно, точного ответа нет. Норм вида «столько-то строк на признак» с доказательной базой для маркетинговых задач не публиковалось. Ответ получают экспериментом: строят кривую обучения и смотрят, растёт ли качество с ростом выборки.

Что здесь быстро устаревает

  • Доля 4,8%. Замер за 2024 год. ИСИЭЗ НИУ ВШЭ публикует экспресс-информации еженедельно, сверять там.
  • Граница с большими языковыми моделями. Часть задач классификации текста, ещё недавно требовавших своей модели, закрывается запросом к готовой языковой модели. Признак устаревания: отдельный этап разметки описан там, где практика уже перешла на готовую модель.
  • Имена платформ и тарифы. Меняются чаще всего остального в статье.
  • Числа рекордов. Результат ImageNet 2012 года это исторический факт, а не текущий уровень.
  • Регулирование. Отдельного закона о машинном обучении в России нет. Обработка персональных данных, на которых учат модели, подчиняется Федеральному закону № 152-ФЗ «О персональных данных».[18] Изменения здесь смотреть по тексту нормы, а не по пересказам.

Стабильны здесь механика утечки целевой переменной, смысл метрик и порядок работы с задачей: они не привязаны ни к модели, ни к году.

См. также

Источники

  1. 1,0 1,1 ИСИЭЗ НИУ ВШЭ. Применение искусственного интеллекта в российских компаниях. Экспресс-информация, 12 сентября 2025. https://issek.hse.ru/news/1083541394.html
  2. 2,0 2,1 2,2 2,3 ИСИЭЗ НИУ ВШЭ. Распространение ИИ в организациях разной величины. Экспресс-информация, 18 марта 2026. https://issek.hse.ru/news/1139129178.html
  3. Samuel A. L. Some Studies in Machine Learning Using the Game of Checkers. IBM Journal of Research and Development, июль 1959, т. 3, № 3, с. 210-229. https://doi.org/10.1147/rd.33.0210
  4. Rosenblatt F. The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain. Psychological Review, 1958, т. 65, № 6, с. 386-408. https://doi.org/10.1037/h0042519
  5. Mitchell T. Machine Learning. McGraw-Hill, 1997, с. 2.
  6. Krizhevsky A., Sutskever I., Hinton G. ImageNet Classification with Deep Convolutional Neural Networks. NIPS 2012. https://papers.nips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html
  7. Vaswani A. и др. Attention Is All You Need. arXiv:1706.03762, 12 июня 2017. https://arxiv.org/abs/1706.03762
  8. Gomez-Uribe C. A., Hunt N. The Netflix Recommender System: Algorithms, Business Value, and Innovation. ACM Transactions on Management Information Systems, 2015, т. 6, № 4, ст. 13. https://doi.org/10.1145/2843948
  9. 9,0 9,1 9,2 Zinkevich M. Rules of Machine Learning: Best Practices for ML Engineering. Документация Google для разработчиков, 43 правила. https://developers.google.com/machine-learning/guides/rules-of-ml
  10. Яндекс Облако. Yandex DataSphere: обзор сервиса. Документация. https://yandex.cloud/ru/docs/datasphere/
  11. 11,0 11,1 Saito T., Rehmsmeier M. The Precision-Recall Plot Is More Informative than the ROC Plot When Evaluating Binary Classifiers on Imbalanced Datasets. PLOS ONE, 2015, т. 10, № 3, e0118432. https://doi.org/10.1371/journal.pone.0118432
  12. 12,0 12,1 12,2 Kaufman S., Rosset S., Perlich C. Leakage in Data Mining: Formulation, Detection, and Avoidance. KDD '11, ACM, 2011. Журнальная версия: ACM Transactions on Knowledge Discovery from Data, 2012, т. 6, № 4. https://doi.org/10.1145/2382577.2382579
  13. Zillow Group. Zillow Group Reports Third-Quarter 2021 Financial Results and Shares Plan to Wind Down Zillow Offers Operations. Сообщение для инвесторов, 2 ноября 2021. https://investors.zillowgroup.com/investors/news-and-events/news/news-details/2021/Zillow-Group-Reports-Third-Quarter-2021-Financial-Results--Shares-Plan-to-Wind-Down-Zillow-Offers-Operations/default.aspx
  14. Gama J., Žliobaitė I., Bifet A., Pechenizkiy M., Bouchachia A. A Survey on Concept Drift Adaptation. ACM Computing Surveys, 2014, т. 46, № 4, ст. 44. https://doi.org/10.1145/2523813
  15. 15,0 15,1 Ryseff J., De Bruhl B. F., Newberry S. J. The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed. RAND Corporation, RR-A2680-1, август 2024. https://www.rand.org/pubs/research_reports/RRA2680-1.html
  16. Kahn J. Want Your Company's A.I. Project to Succeed? Don't Hand It to the Data Scientists, Says This CEO. Fortune, 26 июля 2022. Источник оценки «более 80% провалов», на который ссылается отчёт RAND. https://fortune.com/2022/07/26/a-i-success-business-sense-aible-sengupta
  17. McDermott M. и др. A Closer Look at AUROC and AUPRC under Class Imbalance. arXiv:2401.06091, 2024. https://arxiv.org/abs/2401.06091
  18. Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных». Официальный интернет-портал правовой информации. http://pravo.gov.ru/proxy/ips/?docbody=&nd=102108261