Машинное обучение
Машинное обучение (англ. machine learning, ML) это способ получить решающее правило из примеров вместо того, чтобы записывать его руками. Разработчик готовит таблицу наблюдений с известными ответами, алгоритм подбирает функцию, которая связывает вход с ответом, и дальше эта функция применяется к новым данным. Правило никто не формулировал. Его вывели из данных.
Разница с обычным программированием видна на примере. Чтобы отсеять неплатёжеспособных клиентов, менеджер пишет условие: заявка дороже ста тысяч и город не Москва, значит проверить вручную. Это эвристика, её придумал человек. Модель вместо этого получает историю заявок за два года с отметкой «оплатил» или «не оплатил». Дальше она сама находит, какая комбинация из сорока признаков разделяет две группы. На этом в маркетинге устроены скоринг лида, прогноз оттока, прогноз спроса, антифрод и предсказание следующей покупки.
Технология распространена меньше, чем кажется по публикациям. Росстат по методологии ИСИЭЗ НИУ ВШЭ обследовал свыше 15 тысяч крупных и средних российских организаций.[1] Технологии искусственного интеллекта в 2024 году применяли 4,8% из них, причём в компаниях свыше 500 сотрудников доля составила 14,9%, а в компаниях до 100 человек 4,1%.[2] Среди тех, кто ИИ уже использует, крупный бизнес чаще всего ставит его именно в маркетинг и продажи: 47%.[2]

Чем отличается от соседних понятий
Маркетинг и продажи чаще прочего оказываются той задачей, ради которой обучение и заводят. Мешает разговору путаница в терминах: пять слов из этого круга постоянно подменяют друг друга, хотя они вложены одно в другое.
| Понятие | Что это | Отношение к машинному обучению |
|---|---|---|
| Искусственный интеллект | Зонтичное название для систем, решающих задачи, которые раньше требовали человека | Шире. Экспертная система на правилах это ИИ без обучения |
| Машинное обучение | Построение правила по примерам | Предмет этой статьи |
| Нейросеть | Слои связанных элементов с настраиваемыми весами | Уже. Метод внутри машинного обучения, а не его синоним |
| Глубокое обучение | Нейросети с большим числом слоёв | Ещё уже. Подкласс нейросетей |
| Большая языковая модель | Глубокая сеть, обученная предсказывать следующий фрагмент текста | Частный случай глубокого обучения |
Отдельно стоит развести машинное обучение и предиктивную аналитику. Первое это инструмент, второе его применение к прогнозу спроса или поведения клиента вместе с процессом вокруг прогноза. Метрики и цену ошибки прогноза разбирает соседняя статья.
Со статистикой граница мягче. Линейная регрессия живёт в обеих дисциплинах со времён XIX века, а различие проходит по цели: статистика проверяет гипотезу о связи и требует интерпретируемых коэффициентов, машинное обучение оптимизирует ошибку на новых данных и допускает модель, устройство которой человек объяснить не может.
Откуда взялось
Термин старше любого из соседних понятий, и ввёл его Артур Самуэль. В июльском выпуске IBM Journal of Research and Development за 1959 год он описал программу, игравшую в шашки и улучшавшую собственную игру по результатам партий.[3] Годом раньше Фрэнк Розенблатт опубликовал модель перцептрона, прообраз нейросетей.[4]
Рабочее определение дал Том Митчелл в учебнике 1997 года: программа обучается на опыте E применительно к классу задач T и мере качества P, если её качество на задачах T, измеренное мерой P, растёт с накоплением опыта E.[5] Три буквы важнее формулировки. Пока задача, мера и источник опыта не названы, обсуждать обучение бессмысленно.
Переломом принято считать 2012 год. Свёрточная сеть Алекса Крижевского, Ильи Суцкевера и Джеффри Хинтона выиграла конкурс ImageNet с ошибкой top-5 в 15,3% против 26,2% у ближайшего конкурента.[6] Отрыв в десять процентных пунктов на задаче, где годами боролись за доли процента, перевёл индустрию на нейросетевые методы. В 2017 году появилась архитектура Transformer,[7] на которой выросли большие языковые модели и генеративный ИИ.
Как это устроено
Три способа учиться
Способов учиться три, и различает их то, что известно про ответ.
Обучение с учителем. В данных есть колонка с правильным ответом: купил, ушёл, вернул товар, сумма чека. Модель подбирает связь между остальными колонками и этой. Сюда попадает почти вся маркетинговая практика.
Обучение без учителя. Ответа нет, алгоритм ищет структуру сам: сегменты клиентов, похожие товары, аномальные транзакции. Результат интерпретирует человек.
Обучение с подкреплением. Модель действует в среде и получает вознаграждение за результат: так настраивают ставки в аукционах.
Признаки и разметка
Всё обучение с учителем упирается в две колонки данных. Признак это колонка таблицы: возраст, источник перехода, число заказов за полгода, среднее время между покупками. Разметка это колонка с ответом. Достаётся она дороже всего: нужна либо накопленная история, либо ручной труд живых людей. Для компьютерного зрения размечают изображения, для текста категории обращений. Качество и происхождение датасета влияют на результат сильнее выбора алгоритма.
Рекомендательные системы
Рекомендации устроены на двух семействах методов. Коллаборативная фильтрация ищет похожих пользователей по истории действий: тем, кто вёл себя как вы, понравилось вот это. Контентная сравнивает сами товары по описаниям и атрибутам. На практике их совмещают и добавляют правила бизнеса: не рекомендовать то, чего нет на складе.
Ориентир масштаба дают авторы системы Netflix: Карлос Гомес-Урибе и Нил Хант оценили вклад персонализации и рекомендаций примерно в миллиард долларов в год за счёт удержания подписчиков.[8] Считала это сама компания, по своим A/B-экспериментам.
Обучение и эксплуатация это две разные системы
Модель обучается на исторической выгрузке, а работает на живом потоке. Между ними почти всегда расхождение: другой порядок полей, другие пропуски, другая логика заполнения. Документация Google зовёт это training-serving skew и советует измерять расхождение специально.[9]
Что делать на практике
- Сначала эвристика. Правило номер один в руководстве Google по инженерии машинного обучения звучит так: не бойтесь запустить продукт без машинного обучения.[9] Простое правило часто даёт половину эффекта и показывает, есть ли в задаче деньги.
- Назовите метрику бизнеса до старта. Не точность модели, а то, что изменится: доля дозвонов, стоимость заявки, LTV, выручка на письмо.
- Проверьте, есть ли история. Нужны примеры с ответами за период, покрывающий сезонность. Нет истории, нет задачи.
- Первую модель делайте простой. Четвёртое правило того же руководства: сперва простая модель и правильная инфраструктура.[9]
- Делите выборку по времени, а не случайно. Обучение на прошлом, проверка на будущем. Это единственная проверка, которая повторяет условия эксплуатации.
- Сравните с решением без модели. Прогноз обязан обыграть ориентир вроде «завтра будет как вчера», и проверяют это через A/B-тестирование.
- Решите, покупать или разрабатывать. По данным ИСИЭЗ НИУ ВШЭ, российские организации чаще всего заказывают разработку на стороне (56%) или покупают готовое коммерческое ПО (53%).[2] Полный цикл в облаке закрывают платформы вроде Yandex DataSphere.[10]
После запуска начинается отдельная работа: мониторинг, переобучение, регламент отката. Встраивание прогноза в процессы описано в статьях про автоматизацию и про ИИ в маркетинге.
Чем измеряют
- Accuracy, доля верных ответов. Простая и обманчивая метрика, см. ниже.
- Precision, точность. Какая доля объектов, помеченных моделью, помечена верно. Отвечает на вопрос, сколько денег уйдёт на ложные срабатывания.
- Recall, полнота. Какую долю нужных объектов модель нашла. Отвечает на вопрос, сколько упущено. Компромисс между точностью и полнотой сворачивают в один показатель F1.
- ROC-AUC. Вероятность, что случайный положительный объект получит балл выше случайного отрицательного.
- PR-кривая. Точность против полноты. На сильно несбалансированных данных она информативнее ROC-кривой, потому что ROC-кривая на них выглядит оптимистично из-за интуитивно неверного прочтения специфичности.[11]
- MAE и RMSE. Для прогноза чисел: средняя абсолютная ошибка и корень из средней квадратичной.
Метрика модели и метрика бизнеса связаны через порог отсечения. Один и тот же прогноз при разном пороге даёт разную цену: где-то дороже пропустить клиента, где-то дороже потратить звонок впустую. Считать это лучше в деньгах, сведя прогноз со сквозной аналитикой.
Частые ошибки
Утечка целевой переменной
Это главная ошибка, из-за которой модель показывает почти идеальный результат на тесте и бесполезна в эксплуатации. Утечка происходит, когда в признаки попадает информация, которой в момент прогноза ещё не существует.
Маркетинговый пример. Компания строит модель оттока: кто перестанет платить в следующем месяце. В выгрузку из CRM попадает статус «заявка на расторжение». Обучение проходит блестяще, ROC-AUC около 0,99, руководитель доволен. В проде модель молчит. Причина простая: заявку клиент подаёт уже после того, как решил уйти, то есть признак описывает не будущее, а прошлое. Модель научилась узнавать ушедших по следу их ухода.
Пример не выдуман. В работе по утечкам разобран ровно такой случай в задаче оттока у сотового оператора: сильным признаком там оказалось имя интервьюера, потому что отдельного сотрудника назначали на клиентов, уже заявивших об уходе.[12]
Классический разобранный случай из научной литературы выглядит так же. В соревновании KDD Cup 2008 по выявлению рака молочной железы поле «идентификатор пациента» неожиданно оказалось сильнейшим предиктором: номера выдавались последовательно по источникам данных, а часть источников состояла почти целиком из больных.[12]
Чем ловится:
- Подозрительно сильный признак. Один признак объясняет почти всё. В работе Кауфмана, Россета и Перлич разведочный анализ данных назван основным способом заметить утечку: она видна как удивительная закономерность там, где её быть не должно.[12]
- Разделение обучения и предсказания по времени. Авторы той же работы предлагают помечать каждое наблюдение моментом, когда оно стало известно, и пускать в признаки только то, что было доступно до прогноза.
- Проверка на свежем периоде. Модель, обученная до марта, проверяется на апреле и мае, которых она не видела вовсе.
- Разговор с владельцем поля. У каждой колонки в CRM есть человек, который знает, когда она заполняется. Один такой разговор дешевле месяца обучения.
Сколько это стоит. Цена складывается из списанного бюджета проекта и решений, принятых по ложному прогнозу: скидок не тем клиентам, закупок не того товара, звонков не по тем номерам. Рублёвых оценок именно по утечке никто не публикует. Порядок цены ошибки прогноза в эксплуатации виден по случаю Zillow: в третьем квартале 2021 года компания списала около 304 млн долларов на переоценке запаса домов, закрыла направление Zillow Offers и сократила примерно четверть штата, объяснив решение тем, что непредсказуемость цен на жильё превысила ожидания её прогнозной модели.[13] Причиной там называлась не утечка, но статья расходов та же.
Точность на редких событиях
Вторая по частоте ошибка выглядит безобиднее и живёт в отчётности. Отток в месяц составляет два процента. Модель, которая всегда отвечает «не уйдёт», даёт 98% верных ответов и не находит ни одного уходящего клиента. Доля верных ответов на редких событиях бессмысленна: смотреть надо на точность и полноту при выбранном пороге.
Дрейф данных
Работающая модель ломается сама, без единой правки кода. Меняются поведение аудитории, каналы, ассортимент, сезон. В обзоре по адаптации к дрейфу концепции это описано как изменение связи между входными данными и целевой переменной во времени, и лечится мониторингом с переобучением, а не разовой настройкой.[14] Признак: качество на свежем месяце ниже, чем было на валидации, при неизменном коде.
Ошибка постановки задачи
Модель оптимизирует не ту величину: отдел маркетинга хотел рост выручки, а модель училась предсказывать клик. По итогам 65 интервью с практиками корпорация RAND поставила непонимание исходной задачи на первое место среди причин провала ИИ-проектов, нехватку данных на второе.[15]
Ограничения и спорные места
Российская цифра измеряет ИИ целиком, а не машинное обучение. Доля 4,8% получена Росстатом по методологии ИСИЭЗ НИУ ВШЭ на обследовании свыше 15 тысяч крупных и средних организаций, замер относится к 2024 году, публикация вышла 18 марта 2026 года.[2][1] В понятие ИИ там входят обработка визуальных данных, текста, звука, поддержка принятия решений и технологии повышения эффективности ИИ. Отдельной строки «машинное обучение» там нет. Малые предприятия в выборку не попали. Сами ответы это самоотчёт организаций, аудита систем никто не проводил.
Утверждение «более 80% ИИ-проектов проваливаются» ходит по отрасли без замера за спиной. Его приводит отчёт RAND 2024 года, но со ссылкой на чужую оценку: сноска ведёт на заметку в журнале Fortune от 26 июля 2022 года, где цифру называет руководитель компании, продающей ИИ-решения.[15][16] Собственный вклад RAND в другом: 65 полуструктурированных интервью с практиками с августа по декабрь 2023 года, 50 в индустрии и 15 в академии. Цифра 80% и пять причин провала это разные по надёжности утверждения.
Метрики спорны сами по себе. Работа Сайто и Ремсмайера 2015 года показала преимущество PR-кривой на несбалансированных данных,[11] но у этого вывода есть оппоненты. Препринт Мэтью Макдермотта с соавторами 2024 года разбирает то же утверждение теоретически и заключает, что PR-AUC при дисбалансе не лучше в общем случае и вдобавок склоняет оценку в пользу подгрупп, где положительных примеров больше.[17] Единой нормы отрасль не выработала.
Интерпретируемость. Объяснение отдельного решения градиентного бустинга или глубокой сети строится приближёнными методами, и для скоринга или отказа в услуге это открытый вопрос, а не решённый.
Сколько данных достаточно, точного ответа нет. Норм вида «столько-то строк на признак» с доказательной базой для маркетинговых задач не публиковалось. Ответ получают экспериментом: строят кривую обучения и смотрят, растёт ли качество с ростом выборки.
Что здесь быстро устаревает
- Доля 4,8%. Замер за 2024 год. ИСИЭЗ НИУ ВШЭ публикует экспресс-информации еженедельно, сверять там.
- Граница с большими языковыми моделями. Часть задач классификации текста, ещё недавно требовавших своей модели, закрывается запросом к готовой языковой модели. Признак устаревания: отдельный этап разметки описан там, где практика уже перешла на готовую модель.
- Имена платформ и тарифы. Меняются чаще всего остального в статье.
- Числа рекордов. Результат ImageNet 2012 года это исторический факт, а не текущий уровень.
- Регулирование. Отдельного закона о машинном обучении в России нет. Обработка персональных данных, на которых учат модели, подчиняется Федеральному закону № 152-ФЗ «О персональных данных».[18] Изменения здесь смотреть по тексту нормы, а не по пересказам.
Стабильны здесь механика утечки целевой переменной, смысл метрик и порядок работы с задачей: они не привязаны ни к модели, ни к году.
См. также
Источники
- ↑ 1,0 1,1 ИСИЭЗ НИУ ВШЭ. Применение искусственного интеллекта в российских компаниях. Экспресс-информация, 12 сентября 2025. https://issek.hse.ru/news/1083541394.html
- ↑ 2,0 2,1 2,2 2,3 ИСИЭЗ НИУ ВШЭ. Распространение ИИ в организациях разной величины. Экспресс-информация, 18 марта 2026. https://issek.hse.ru/news/1139129178.html
- ↑ Samuel A. L. Some Studies in Machine Learning Using the Game of Checkers. IBM Journal of Research and Development, июль 1959, т. 3, № 3, с. 210-229. https://doi.org/10.1147/rd.33.0210
- ↑ Rosenblatt F. The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain. Psychological Review, 1958, т. 65, № 6, с. 386-408. https://doi.org/10.1037/h0042519
- ↑ Mitchell T. Machine Learning. McGraw-Hill, 1997, с. 2.
- ↑ Krizhevsky A., Sutskever I., Hinton G. ImageNet Classification with Deep Convolutional Neural Networks. NIPS 2012. https://papers.nips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html
- ↑ Vaswani A. и др. Attention Is All You Need. arXiv:1706.03762, 12 июня 2017. https://arxiv.org/abs/1706.03762
- ↑ Gomez-Uribe C. A., Hunt N. The Netflix Recommender System: Algorithms, Business Value, and Innovation. ACM Transactions on Management Information Systems, 2015, т. 6, № 4, ст. 13. https://doi.org/10.1145/2843948
- ↑ 9,0 9,1 9,2 Zinkevich M. Rules of Machine Learning: Best Practices for ML Engineering. Документация Google для разработчиков, 43 правила. https://developers.google.com/machine-learning/guides/rules-of-ml
- ↑ Яндекс Облако. Yandex DataSphere: обзор сервиса. Документация. https://yandex.cloud/ru/docs/datasphere/
- ↑ 11,0 11,1 Saito T., Rehmsmeier M. The Precision-Recall Plot Is More Informative than the ROC Plot When Evaluating Binary Classifiers on Imbalanced Datasets. PLOS ONE, 2015, т. 10, № 3, e0118432. https://doi.org/10.1371/journal.pone.0118432
- ↑ 12,0 12,1 12,2 Kaufman S., Rosset S., Perlich C. Leakage in Data Mining: Formulation, Detection, and Avoidance. KDD '11, ACM, 2011. Журнальная версия: ACM Transactions on Knowledge Discovery from Data, 2012, т. 6, № 4. https://doi.org/10.1145/2382577.2382579
- ↑ Zillow Group. Zillow Group Reports Third-Quarter 2021 Financial Results and Shares Plan to Wind Down Zillow Offers Operations. Сообщение для инвесторов, 2 ноября 2021. https://investors.zillowgroup.com/investors/news-and-events/news/news-details/2021/Zillow-Group-Reports-Third-Quarter-2021-Financial-Results--Shares-Plan-to-Wind-Down-Zillow-Offers-Operations/default.aspx
- ↑ Gama J., Žliobaitė I., Bifet A., Pechenizkiy M., Bouchachia A. A Survey on Concept Drift Adaptation. ACM Computing Surveys, 2014, т. 46, № 4, ст. 44. https://doi.org/10.1145/2523813
- ↑ 15,0 15,1 Ryseff J., De Bruhl B. F., Newberry S. J. The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed. RAND Corporation, RR-A2680-1, август 2024. https://www.rand.org/pubs/research_reports/RRA2680-1.html
- ↑ Kahn J. Want Your Company's A.I. Project to Succeed? Don't Hand It to the Data Scientists, Says This CEO. Fortune, 26 июля 2022. Источник оценки «более 80% провалов», на который ссылается отчёт RAND. https://fortune.com/2022/07/26/a-i-success-business-sense-aible-sengupta
- ↑ McDermott M. и др. A Closer Look at AUROC and AUPRC under Class Imbalance. arXiv:2401.06091, 2024. https://arxiv.org/abs/2401.06091
- ↑ Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных». Официальный интернет-портал правовой информации. http://pravo.gov.ru/proxy/ips/?docbody=&nd=102108261