Датасет
Датасет это набор данных, подготовленный так, чтобы на нём можно было обучить или проверить модель: состав зафиксирован, структура описана, происхождение и права известны. В русских нормативных документах то же самое называется набором данных. ГОСТ Р 59898-2021 определяет его как «совокупность данных, в том числе соответствующих им метаданных, организованных по определённым правилам и принципам описания».
Разница между датасетом и просто данными не в объёме. Компания хранит десять лет истории заказов и не имеет ни одного набора, пригодного для обучения. Состав выгрузки плывёт от запуска к запуску. Поля не описаны. Права не проверены.
Судьбу проекта решают два вопроса, и оба лежат вне модели: можно ли этими данными пользоваться по закону и что в них сломано. Статья про них. Каталога наборов здесь нет намеренно: списки стареют за месяцы, правила и дефекты живут годами.

Чем отличается от выгрузки, базы данных и корпуса
| Понятие | Что это | Чем не является |
|---|---|---|
| Выгрузка из системы | срез рабочей базы на момент запроса | завтра тот же запрос вернёт другое, схема не записана |
| База данных | хранилище, в которое пишут и читают прямо сейчас | содержимое живое и меняется под пользователями |
| Корпус | собрание текстов или речи под задачи разбора языка | частный случай набора, чаще с лингвистической разметкой |
| Датасет | зафиксированный набор с версией, схемой, разметкой и известным происхождением | не хранилище и не отчёт |
Признаков четыре. Набор зафиксирован во времени и пронумерован версией, у него описана схема с расшифровкой каждого поля и единиц измерения, разметка либо есть, либо про её отсутствие сказано прямо, а происхождение известно вместе с правами. Фраза «у нас есть CRM, значит данные для модели есть» описывает первый шаг из четырёх.
Откуда взялось
Собирать набор ради проверки метода начали раньше компьютеров. Архив Калифорнийского университета в Ирвайне описывает набор ирисов как «a small classic dataset from Fisher, 1936»: 150 экземпляров, четыре признака, три класса ровно по пятьдесят. В той же карточке стоит оговорка, что 35-й и 38-й экземпляры расходятся с данными из статьи Фишера. Набору девяносто лет. Ошибка в нём живёт до сих пор.
Дальше пошли наборы, ставшие мерой качества: MNIST с 60 000 примеров для обучения и 10 000 для проверки, ImageNet с 1000 классов и 1 281 167 обучающими изображениями в задаче ILSVRC. Мысль, что набор обязан приходить с документацией, а не одними файлами, оформилась в марте 2018 года работой «Datasheets for Datasets».
В России у темы свои даты. ГОСТ Р 59898-2021 утверждён приказом Росстандарта от 26 ноября 2021 года № 1620-ст. А с 1 сентября 2025 года действуют новые требования к обезличиванию персональных данных и статья 13.1 закона о персональных данных, введённая законом от 8 августа 2024 года № 233-ФЗ.
Как это устроено
Строки, признаки и метки
Минимальная единица набора это объект: клиент, заказ, снимок, обращение. У объекта есть признаки, то есть измеренные свойства, и иногда метка, то есть правильный ответ, который модель учится воспроизводить. С разметкой она повторяет ответ, без разметки ищет структуру сама.
Разметку ставит человек. Это самая дорогая часть набора и самая хрупкая: ошибка разметчика неотличима от правды для любого алгоритма.
Три выборки
Обучающая часть нужна, чтобы модель подобрала параметры, проверочная чтобы выбрать между вариантами, а тестовая существует ради одного: показать качество на данных, которых модель не видела ни разу. Как только тест посмотрели, подкрутили модель и посмотрели снова, он перестал быть тестом и стал второй проверочной частью. Внешне ничего не изменилось. Доверять числу уже нельзя.
Делить набор нужно по сущностям, а не по строкам. Если у клиента сорок заказов и они разъехались по обучающей и тестовой частям, модель увидит на тесте знакомого. Это родственник более опасной ошибки, утечки целевой переменной, и её разбирает статья Машинное обучение.
Версия и паспорт набора
Файл с именем data_final_v2_new.csv это не версия. Версия это номер, дата фиксации и список изменений относительно предыдущего номера. И обученная модель знает, на каком номере обучалась.
Паспорт по образцу «Datasheets for Datasets» отвечает на семь групп вопросов: зачем набор собран, из чего состоит, как собирался, что с ним делали, для чего годится, как распространяется, кто его поддерживает.
Права на данные под российским законом
Раздел называет нормы и даёт ссылки на их тексты. Юридической консультацией он не является: применимость нормы к конкретному набору оценивает юрист.
Персональные данные и обезличивание
Закон о персональных данных в редакции на 26 июля 2026 года определяет их в пункте 1 статьи 3. Это «любая информация, относящаяся к прямо или косвенно определённому или определяемому физическому лицу». Слово «косвенно» здесь несёт вес. Признаком служит возможность определить человека, а не наличие колонки с фамилией.
Обезличивание тот же закон в пункте 9 статьи 3 определяет как «действия, в результате которых становится невозможным без использования дополнительной информации определить принадлежность персональных данных конкретному субъекту персональных данных».
Методы утверждены приказом Роскомнадзора от 19 июня 2025 года № 140, он действует с 1 сентября 2025 года и заменил приказ 2013 года. Приложение № 2 называет четыре: введение идентификаторов, изменение состава или семантики персональных данных, перемешивание и декомпозицию. Там же, в пункте 3, сказано, что при методе введения идентификаторов «должно предусматриваться создание ключа», позволяющего сопоставить идентификатор с исходными данными.
Две нормы касаются целей. Статья 5 часть 2: «Не допускается обработка персональных данных, несовместимая с целями сбора персональных данных». Пункт 9 части 1 статьи 6 разрешает обработку «в статистических или иных исследовательских целях... при условии обязательного обезличивания персональных данных».
Цена вопроса записана в КоАП. За обработку, несовместимую с целями сбора, часть 1 статьи 13.11 в редакции на 26 июля 2026 года предусматривает штраф на юридических лиц от ста пятидесяти тысяч до трёхсот тысяч рублей.
Лицензии открытых наборов
Большинство открытых наборов раздаётся под лицензиями Creative Commons версии 4.0. Читать в них нужно одно поле: разрешено ли коммерческое использование.
| Лицензия | Коммерческое использование | Главное условие | Где ломается |
|---|---|---|---|
| CC BY 4.0 | разрешено, «for any purpose, even commercially» | указать автора, дать ссылку на лицензию, отметить изменения | почти нигде |
| CC BY-SA 4.0 | разрешено | производную базу отдать на тех же условиях | публикация своего набора с существенной частью чужого |
| CC BY-NC 4.0 | запрещено | NonCommercial это «not primarily intended for or directed towards commercial advantage or monetary compensation» | платный сервис на таком наборе, причём условие действует и без публикации |
| CC BY-ND 4.0 | разрешено | переработанный материал распространять нельзя | выкладывание своей версии набора |
| CC0 1.0 | разрешено | условий нет, это отказ от прав | ничего |
| Соглашение площадки | по тексту соглашения | читать целиком | ImageNet: «Researcher shall use the Database only for non-commercial research and educational purposes» |
Раздел 4 версии 4.0 отдельно разбирает права изготовителя базы данных и объявляет базу, в которую вошла существенная часть чужого содержимого, переработанным материалом. Разницу между NC и SA справка Creative Commons проговаривает прямо: условие NC действует, даже если база нигде не публикуется, а остальные срабатывают при публичном распространении.
Лицензия может относиться не ко всему набору. У MS COCO разметка выпущена под CC BY 4.0, а изображения нет: «The COCO Consortium does not own the copyright of the images». У CelebA доступ ограничен некоммерческим исследованием, и запрет накрывает «any portion of derived data».
Поле лицензии бывает пустым. В списке Hugging Face больше восьмидесяти значений, два последних это unknown и other, а замер каталога 11 сентября 2026 года показал: из ста самых скачиваемых наборов у 36 тега лицензии нет вовсе. Набор без лицензии свободным не становится. Он становится набором с неизвестными условиями.
Площадка за ваше право пользоваться набором не отвечает. Условия Kaggle в редакции от 22 июня 2025 года: сервис «will not be responsible or liable for the accuracy, copyright compliance, legality, or decency of material».
Российские открытые данные
Государственный портал открытых данных возобновил работу 15 июля 2025 года. Поля лицензии в паспорте набора там нет, и это не упущение. Типовые условия, утверждённые протоколом Правительственной комиссии от 19 сентября 2016 года № 6, в пункте 12 говорят, что такая информация «является общедоступной... не предусматривает ограничений по ее использованию и не требует специализированных соглашений и лицензий».
У ведомств условия бывают подробнее. Росстат разрешает использовать свои открытые данные «свободно, бесплатно, бессрочно, безвозмездно», в том числе «в некоммерческих и коммерческих целях», и требует взамен не искажать их и сохранять ссылку на источник.
Лицензия на код это не лицензия на данные
Открытая лицензия распространяется на то, что в ней названо. Текст MIT говорит о «this software and associated documentation files (the "Software")». Слов data и database в нём нет вовсе. Код обучения под MIT и таблица, лежащая с ним в одной папке, могут иметь разных правообладателей и разные условия.
В российском праве у базы данных есть собственная защита, не зависящая от прав на её содержимое. Статья 1334 Гражданского кодекса в редакции на 23 июля 2025 года даёт изготовителю базы, создание которой требует существенных затрат, исключительное право «извлекать из базы данных материалы и осуществлять их последующее использование в любой форме и любым способом». Там же стоит презумпция: при отсутствии доказательств иного такой признаётся база, «содержащая не менее десяти тысяч самостоятельных информационных элементов (материалов)».
Качество: четыре дефекта, которые видно не сразу
Права на данные проверены, остаётся их качество. В 2020 году опросили 53 практиков ИИ в Индии, странах Восточной и Западной Африки и США. Хотя бы с одним каскадом дефектов данных столкнулись 92% из них, с двумя и более в рамках одного проекта 45,3%. Каскад это цепочка последствий, которая начинается в данных и проявляется позже, на работающей системе.
Дисбаланс классов
Открытый набор транзакций Université Libre de Bruxelles содержит 284 807 операций за два дня, из них 492 мошеннические, то есть 0,172%. Модель, которая на любой вопрос отвечает «не мошенничество», будет права в 99,83% случаев и не поймает ни одного мошенника. Поэтому доля верных ответов тут ничего не стоит, а смотреть надо отдельно на долю пойманных нарушений и на долю ложных тревог.
Пропуски
Пустая ячейка редко бывает случайной. Поле «доход» чаще пустует у тех, кто отказался его называть, поэтому заполнение пропуска средним значением переносит свойства ответивших на молчавших. Это не чистка данных, а выдумывание их.
Дубликаты
Дубликаты внутри набора раздувают вес повторённых объектов, а дубликаты между обучающей и тестовой частями завышают оценку качества. Величина измерена. Проверка CIFAR показала, что дубликаты или почти дубликаты в обучающей выборке имеют 3,25% тестовых изображений CIFAR-10 и 10% CIFAR-100. На той части теста, у которой дубликат в обучении есть, ResNet-110 ошибалась в 0% и 2,9% случаев против 5,3% и 26,1% на полном тесте.
Ошибки разметки
Проверка десяти эталонных наборов 2021 года нашла в среднем не менее 3,3% ошибочных меток. В проверочной части ImageNet ошибок 5,83%, то есть 2916 снимков из 50 000, в тестовой части CIFAR-100 их 5,85%, а в наборе QuickDraw 10,12%. Каждую подозрительную метку показывали пяти живым людям, и 51% подозрений подтвердился.
Последствие сильнее, чем кажется. На исправленных метках ImageNet простая сеть ResNet-18 обгоняет крупную ResNet-50, если доля изначально неверных меток вырастает всего на 6 процентных пунктов. При грязной разметке рейтинг моделей меняет порядок.
Чем измеряют
- Доля пропусков по каждому полю, а не по набору.
- Доля самого редкого класса среди всех объектов.
- Доля дубликатов внутри набора и между обучающей и тестовой частями.
- Доля объектов, по которым разметчики разошлись.
Что делать на практике
- Проверить лицензию каждого внешнего набора и сохранить её текст рядом с файлами.
- Для внутренних данных сверить новую цель с целью сбора.
- Зафиксировать версию: номер, дата, список изменений, контрольная сумма.
- Разделить выборки по сущностям, а не по строкам.
- Найти дубликаты между обучающей и тестовой частями до первого обучения.
- Разметить спорные объекты вторым человеком и посчитать долю расхождений.
- Написать паспорт набора и обновлять его вместе с данными.
Частые ошибки
- Считать выгрузку датасетом: ни схемы, ни версии.
- Удалить колонку с именем и объявить набор обезличенным, оставив рядом ключ соответствия.
- Взять набор с открытой площадки, не открыв поле лицензии.
- Решить, что открытая лицензия на код распространяется и на данные.
- Оценивать редкое событие долей верных ответов.
Ограничения и спорные места
- Числа про дефекты измерены не на ваших данных.** Доли ошибок разметки сняты с десяти англоязычных эталонных наборов, а замера по русскоязычным корпусам или по клиентским базам российских компаний в открытых источниках найти не удалось. Переносить 3,3% на свой набор нельзя. Это ориентир, а не норма.
- Опрос про каскады дефектов качественный, а не репрезентативный.** Доля 92% описывает 53 опрошенных, а не отрасль.
- Состав набора решает, на ком модель ошибётся.** Работа 2018 года «Gender Shades» измерила состав двух наборов лиц: в IJB-A светлокожих 79,6%, в Adience 86,2%. На собственном наборе авторов из 1270 человек доля ошибок трёх коммерческих классификаторов пола шла от 0,0% у светлокожих мужчин до 34,7% у темнокожих женщин. Это про Компьютерное зрение, механизм же общий: недопредставленная группа получает худшее качество, а средняя метрика этого не показывает.
- Синтетические данные спорны.** Работа 2023 года описала эффект, который авторы назвали коллапсом модели: при обучении на данных, порождённых предыдущими моделями, хвосты исходного распределения исчезают, а дефект накапливается. Насколько это ограничивает дообучение на синтетике, смешанной с живыми данными, вопрос открытый.
- Граница обезличивания оценивается по конкретному набору.** Закон формулирует критерий через возможность определить человека без дополнительной информации, приказ Роскомнадзора перечисляет методы. Вывод «этого достаточно» делает юрист, а не справочная статья.
Что здесь быстро устаревает
- **Редакции норм.** Закон о персональных данных и КоАП процитированы по редакции на 26 июля 2026 года, Гражданский кодекс на 23 июля 2025 года. Признак протухания простой: в карточке документа на сайте правовой базы стоит более поздняя дата. Требования к обезличиванию переиздаются целиком, и приказ 2025 года уже заменил приказ 2013 года.
- **Версии лицензий.** Creative Commons процитирована по версии 4.0. Выход новой версии не отменяет старую, но карточки наборов начнут указывать её.
- **Правила площадок.** Поля лицензии, условия доступа и порядок удаления наборов меняются без объявления. Проверять их надо в момент скачивания.
- **Цифры по эталонным наборам.** Доли ошибок пересчитываются с выходом новых проверок, а сами наборы переиздаются исправленными.
См. также
- Машинное обучение
- Нейросеть
- Компьютерное зрение
- Предиктивная аналитика
- RAG
- Нейросети для бизнеса
- ИИ-ассистент
- Сквозная аналитика
- A/B-тестирование
- Целевая аудитория
Источники
- ГОСТ Р 59898-2021 «Оценка качества систем искусственного интеллекта. Общие положения»: пункт 3.13, определение набора данных; пункт 3.5, определение выборки. Утверждён и введён в действие приказом Росстандарта от 26 ноября 2021 года № 1620-ст, дата введения 1 марта 2022 года. Электронный фонд нормативно-технической документации. https://docs.cntd.ru/document/1200181913
- ГОСТ Р 71484.1-2024 (ИСО/МЭК 5259-1:2024) «Искусственный интеллект. Качество данных для аналитики и машинного обучения. Часть 1. Обзор, терминология и примеры». Текст стандарта. Гарант. https://www.garant.ru/files/7/7/1799577/gost_r_71484_1_2024_iso_me_k_5259_1_2024_iskusstvenny_y_intellekt_kachestvo_danny_h_.pdf
- Федеральный закон от 27 июля 2006 года № 152-ФЗ «О персональных данных», статья 3: пункт 1, определение персональных данных; пункт 9, определение обезличивания. Редакция от 26 июля 2026 года. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/4f41fe599ce341751e4e34dc50a4b676674c1416/
- Федеральный закон от 27 июля 2006 года № 152-ФЗ, статья 5 часть 2: ограничение обработки конкретными, заранее определёнными и законными целями, запрет обработки, несовместимой с целями сбора. Редакция от 26 июля 2026 года. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/96fbc469f91f57235cc842a85e0516a99f23dc85/
- Федеральный закон от 27 июля 2006 года № 152-ФЗ, статья 6 часть 1 пункт 9: обработка в статистических или иных исследовательских целях при условии обязательного обезличивания. Редакция от 26 июля 2026 года. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/315f051396c88f1e4f827ba3f2ae313d999a1873/
- Федеральный закон от 27 июля 2006 года № 152-ФЗ, статья 13.1: особенности обработки обезличенных персональных данных, введена Федеральным законом от 8 августа 2024 года № 233-ФЗ. Редакция от 26 июля 2026 года. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/27d43d2bcea5c961cbcc538f0de794dc4646e0c3/
- Приказ Роскомнадзора от 19 июня 2025 года № 140 «Об утверждении требований к обезличиванию персональных данных и методов обезличивания персональных данных...», зарегистрирован в Минюсте 31 июля 2025 года № 83110, приложение № 2: методы введения идентификаторов, изменения состава или семантики, перемешивания, декомпозиции, преобразования массива; пункт 3 о создании ключа. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_511184/af1ceffe50ea6d5254e4b610a37dd1c42084ef96/
- Кодекс Российской Федерации об административных правонарушениях от 30 декабря 2001 года № 195-ФЗ, статья 13.11 часть 1: штраф на юридических лиц от 150 000 до 300 000 рублей. Редакция от 26 июля 2026 года. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_34661/1f421640c6775ff67079ebde06a7d2f6d17b96db/
- Гражданский кодекс Российской Федерации (часть четвёртая) от 18 декабря 2006 года № 230-ФЗ, статья 1334: исключительное право изготовителя базы данных, презумпция десяти тысяч самостоятельных информационных элементов. Редакция от 23 июля 2025 года. КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_64629/c8b26358cbae2a98f328bd8cb495a08f7e11caff/
- Attribution 4.0 International (CC BY 4.0): «for any purpose, even commercially», условия атрибуции. Creative Commons. https://creativecommons.org/licenses/by/4.0/deed.en
- Attribution-NonCommercial 4.0 International (CC BY-NC 4.0), раздел 1: «NonCommercial means not primarily intended for or directed towards commercial advantage or monetary compensation». Creative Commons. https://creativecommons.org/licenses/by-nc/4.0/legalcode.en
- Attribution 4.0 International (CC BY 4.0), раздел 4 Sui Generis Database Rights: разрешение извлекать и повторно использовать «all or a substantial portion of the contents of the database». Creative Commons. https://creativecommons.org/licenses/by/4.0/legalcode.en
- Frequently Asked Questions: разъяснение Creative Commons о том, что условие NonCommercial соблюдается и без публичного распространения, а прочие условия лицензий 4.0 срабатывают при публикации; позиция о применении лицензий к базам данных и правам изготовителя. Creative Commons. https://creativecommons.org/faq/
- Terms of Use: «will not be responsible or liable for the accuracy, copyright compliance, legality, or decency of material contained in or accessed through the Services». Редакция от 22 июня 2025 года. Kaggle. https://www.kaggle.com/terms
- COCO Terms of Use: аннотации под Creative Commons Attribution 4.0, «The COCO Consortium does not own the copyright of the images». COCO Consortium. https://cocodataset.org/#termsofuse
- Large-scale CelebFaces Attributes (CelebA) Dataset, раздел Agreement: «available for non-commercial research purposes only», запрет на «any portion of derived data». Multimedia Laboratory, The Chinese University of Hong Kong. https://mmlab.ie.cuhk.edu.hk/projects/CelebA.html
- «Портал открытых данных возобновляет свою работу»: запуск обновлённого портала 15 июля 2025 года. Минэкономразвития России. https://economy.gov.ru/material/news/portal_otkrytyh_dannyh_vozobnovlyaet_svoyu_rabotu.html
- Типовые условия использования общедоступной информации, размещаемой в сети «Интернет» в форме открытых данных, пункт 12: информация «не предусматривает ограничений по ее использованию и не требует специализированных соглашений и лицензий». Утверждены протоколом Правительственной комиссии по координации деятельности открытого правительства от 19 сентября 2016 года № 6. https://rosstat.gov.ru/storage/mediabank/tipusl_od.pdf
- Условия использования открытых данных: свободное, бесплатное, бессрочное использование в некоммерческих и коммерческих целях, обязанность не искажать данные и сохранять ссылку на источник. Федеральная служба государственной статистики. https://rosstat.gov.ru/opendata
- Замер состава каталога: из ста самых скачиваемых наборов у 36 нет тега лицензии. Официальный интерфейс каталога Hugging Face, запрос от 11 сентября 2026 года. https://huggingface.co/api/datasets?sort=downloads&direction=-1&limit=100
- The MIT License: текст разрешения относится к «this software and associated documentation files (the „Software“)». Open Source Initiative. https://opensource.org/license/mit
- Licenses: полный список идентификаторов лицензий репозитория, включая `unknown` и `other`, требование положить текст лицензии файлом при значении `other`. Документация Hugging Face Hub. https://huggingface.co/docs/hub/repositories-licenses
- Download: условия доступа к ImageNet, «Researcher shall use the Database only for non-commercial research and educational purposes». ImageNet. https://www.image-net.org/download.php
- Iris: 150 экземпляров, 4 признака, 3 класса по 50, донор R. A. Fisher, дата донации 30 июня 1988 года, оговорка о расхождении 35-го и 38-го экземпляров. UCI Machine Learning Repository. https://archive.ics.uci.edu/dataset/53/iris
- The MNIST Database of Handwritten Digits: 60 000 примеров обучающей выборки и 10 000 тестовой, подмножество набора NIST. Yann LeCun, Corinna Cortes, Christopher J. C. Burges. Страница первоисточника на 11 сентября 2026 года не отвечает, приведён архивный снимок от 2 января 2022 года. https://web.archive.org/web/20220102204051/http://yann.lecun.com/exdb/mnist/
- Russakovsky O., Deng J., Su H. и др. ImageNet Large Scale Visual Recognition Challenge: 1000 классов, 1 281 167 обучающих, 50 000 проверочных и 100 000 тестовых изображений. International Journal of Computer Vision, 2015, т. 115, № 3, с. 211-252; arXiv:1409.0575, версия от 30 января 2015 года. https://arxiv.org/abs/1409.0575
- Gebru T., Morgenstern J., Vecchione B. и др. Datasheets for Datasets: предложение прикладывать к набору паспорт, семь групп вопросов. arXiv:1803.09010, первая версия 23 марта 2018 года; Communications of the ACM, 2021, т. 64, № 12, с. 86-92. https://arxiv.org/abs/1803.09010
- Northcutt C. G., Athalye A., Mueller J. Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks: в среднем не менее 3,3% ошибок по десяти наборам, 5,83% в проверочной части ImageNet (2916 из 50 000), 5,85% в тестовой части CIFAR-100, 10,12% в QuickDraw, подтверждение пятью размечающими и доля подтверждений 51%, смена порядка ResNet-18 и ResNet-50 при росте доли на 6 процентных пунктов. arXiv:2103.14749, 26 марта 2021 года; NeurIPS 2021, Datasets and Benchmarks Track. https://arxiv.org/abs/2103.14749
- Barz B., Denzler J. Do We Train on Test Data? Purging CIFAR of Near-Duplicates: 3,25% тестовых изображений CIFAR-10 и 10% CIFAR-100 имеют дубликаты в обучающей выборке, относительный рост ошибки на 9-14% после замены дубликатов, 0% и 2,9% ошибок на подмножестве с дубликатами против 5,3% и 26,1% на полном тесте. Journal of Imaging, 2020, т. 6, № 6, статья 41, doi:10.3390/jimaging6060041; arXiv:1902.00423. https://arxiv.org/abs/1902.00423
- Sambasivan N., Kapania S., Highfill H. и др. «Everyone wants to do the model work, not the data work»: Data Cascades in High-Stakes AI: 53 полуструктурированных интервью с практиками ИИ в Индии, странах Восточной и Западной Африки и США, май-июль 2020 года; 92% сообщили хотя бы об одном каскаде, 45,3% о двух и более. CHI 2021, ACM, doi:10.1145/3411764.3445518. https://storage.googleapis.com/gweb-research2023-media/pubtools/5936.pdf
- Buolamwini J., Gebru T. Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification: состав наборов IJB-A (79,6% светлокожих) и Adience (86,2%), собственный набор из 1270 человек, доли ошибок от 0,0% до 34,7%. Proceedings of Machine Learning Research, 2018, т. 81, с. 77-91. https://proceedings.mlr.press/v81/buolamwini18a.html
- Credit Card Fraud Detection (Worldline и Machine Learning Group, Université Libre de Bruxelles): 284 807 транзакций за два дня, 492 мошеннические, 0,172%. Описание набора, OpenML. https://www.openml.org/api/v1/json/data/1597
- Shumailov I., Shumaylov Z., Zhao Y. и др. The Curse of Recursion: Training on Generated Data Makes Models Forget: описание эффекта коллапса модели при обучении на данных, порождённых предыдущими моделями. arXiv:2305.17493, 27 мая 2023 года. https://arxiv.org/abs/2305.17493