Порочный круг ИИ: как генерация данных убивает креативность алгоритмов

Журнал Nature публикует исследования в естественных науках, особое внимание уделяя темам искусственного интеллекта
Журнал Nature публикует исследования в естественных науках, особое внимание уделяя темам искусственного интеллекта

Использование сгенерированных ИИ данных для тренировки новых алгоритмов приводит к эффекту «цифрового выгорания» (Data Depletion) — потере разнообразия и креативности в ответах моделей. Об этом свидетельствует исследование Оксфордского университета, опубликованное в июле 2024 года в журнале Nature группой учёных из Англии и Канады во главе с братьями Ильёй и Захаром Шумайловыми. В нём показано, что обучение моделей на полностью синтетических данных 1 ведёт к деградации качества: с каждым новым поколением моделей наряду с уменьшением лексического разнообразия накапливаются ошибки и снижается способность уловить нюансы языка.

В экспериментах на небольших языковых моделях, обучавшихся на текстах и сгенерированных предыдущими версиями, наблюдался «коллапс модели» — постепенное ухудшение качества текстов. При этом если хотя бы 10% обучающих данных оставались человеческими, эффект деградации практически исчезал. Аналогичные эффекты известны и для генеративных моделей изображений, где уже небольшой процент ИИ-сгенерированного контента в обучающих данных приводит к ухудшению качества. По мере увеличения доли искусственного контента в интернете эта проблема будет обостряться.

«Со временем эти ошибки накладываются друг на друга, и модель в основном учится только на ошибках», — говорит Захар Шумайлов.​

Однако эксперты считают, что важно не стремиться к полностью «чистым» данным, а научиться фильтровать низкокачественный искусственный текст, который может значительно испортить обучение моделей. Присутствие значимой части человеческих текстов в датасете 2 остаётся ключевым для сохранения устойчивости моделей к коллапсу.

Писатели Гильдии авторов хотят, чтобы компании OpenAI запретили использовать без разрешения защищенные авторским правом книги, требуя возмещения ущерба в размере до $150 тыс. за каждое использованное без разрешения произведение
Писатели Гильдии авторов хотят, чтобы компании OpenAI запретили использовать без разрешения защищенные авторским правом книги, требуя возмещения ущерба в размере до $150 тыс. за каждое использованное без разрешения произведение

Юридическая сторона также осложняется: Гильдия авторов 3 выступила против OpenAI, 4 иск подан в конце сентября 2023 года в суд Южного окружного суда Нью-Йорка. Истцами являются 17 писателей фантастов. В основе дела лежат заявления о нарушении авторских прав: OpenAI обвиняется в использовании произведений, защищенных авторским правом, без разрешения для обучения своих моделей GPT. Это замедляет инновации и создаёт «регуляторный хаос», усложняя разработку новых моделей.

Параллельно отмечается, что такие требования к удалению данных существенно замедляют процесс инноваций и создают «регуляторный хаос», осложняя разработку и подготовку новых моделей ИИ.

Эксперты выделяют две основные стратегии решения проблемы с данными для обучения моделей ИИ. Во-первых, необходимо увеличивать объем и качество реальных данных, используемых для тренировки. Во-вторых, важным направлением является развитие методов отбора и фильтрации синтетических данных, что позволяет повысить эффективность обучения за счет использования искусственно сгенерированных наборов с гарантией их качества.

В исследовательском сообществе, включая блог DeepMind, отмечают перспективы гибридных подходов. В таких системах синтетические данные проходят строгую валидацию и приоритизацию 5 , что повышает стабильность и качество процесса обучения. DeepMind подтверждает, что ведутся эксперименты с гибридными методами, однако детали остаются в конфиденциальном доступе.

Комбинирование качественных реальных данных с тщательно отобранными синтетическими, опирающееся на гибридные архитектуры и методы машинного обучения, является ключевым направлением для повышения производительности моделей ИИ и стабильности их работы.

США, Великобритания и Германия успешно внедряют синтетические данные для обучения искусственного интеллекта. В США это помогает развивать медицину и финансы. Великобритания применяет технологии в здравоохранении и государственном управлении, повышая эффективность сервисов. Германия сосредоточена на промышленности и робототехнике, используя синтетику для тестирования автономных систем. Эти страны показывают, как синтетика расширяет возможности ИИ и защищает реальные данные.

  1. Синтетические данные — это искусственно сгенерированные массивы информации, которые моделируют поведение и закономерности реальных данных.
  2. Датасет — это набор собранных и упорядоченных данных, предназначенных для хранения, обработки и анализа. В него может входить числовая, текстовая, графическая или смешанная информация.
  3. Гильдия авторов — профессиональная организация публикуемых писателей, насчитывающая более 14 000 членов.
  4. OpenAI — американская научно-исследовательская организация, занимающаяся разработками в области искусственного интеллекта (ИИ).
  5. Приоритизация — это процесс ранжирования задач, требований к проекту или функций продукта по тому, насколько они важны для достижения целей.

ABOUT THE AUTHOR


Дарья Маркина

Любитель космоса и битвы экстрасенсов. Что из этого более запутанное? Скорее - белизна зубов Александра Шепса.

Leave a Comment