Эксперимент показал, что при обучении ИИ на собственных сгенерированных данных качество модели ухудшается, а редкие случаи исчезают. Однако при наличии внешней проверки синтетические данные могут быть полезны.
Эксперимент с церковными башнями и коллапс модели ⏱ 0:00
•Исследователи дали одни и те же фрагменты текста об английских церковных башнях нескольким поколениям моделей ИИ.•Первая версия модели смогла продолжить текст; после пяти циклов модель начала перечислять названия языков; после девяти циклов — перечислять названия разноцветных зайцев.•Процедура: брали первую модель, обучали на реальных текстах, затем модель создавала новый набор текстов, на котором обучали следующую модель — повторено девять раз.•Каждое следующее поколение всё дальше отходило от исходного текста и генерировало бредовые вещи.•Это явление называется коллапс модели.Пример с банкой шаров: почему редкие данные исчезают ⏱ 2:32
•В банке 100 шаров: 99 белых (частые ситуации) и 1 красный (редкая ситуация).•Процедура: вслепую вытаскивают шар, записывают цвет, кладут обратно; повторяют 100 раз.•Вероятность, что красный шар не попадёт в новую сотню — 37% (0,99 в степени 100 = 36,6%).•Частые варианты (белые) могут появиться много раз, редкий (красный) может вообще не появиться.•Если после этого выбросить человеческий текст и учить следующую модель только на новой копии, вернуть пропущенное редкое исключение будет неоткуда.Почему AlphaZero и Llama 3 не пострадали: роль проверки ⏱ 6:14
•AlphaZero училась на партиях с самой собой, но рядом был судья: есть правила доски, партия либо выиграна, либо проиграна, либо ничья. Ошибку замаскировать невозможно.•Meta (Facebook) при обучении Llama 3 добавляла миллионы синтетических примеров кода, но они проверялись: запускали программы, сверяли результаты с тестами.•В эксперименте Nature такого судьи не было — текст просто попадал в обучение без проверки.•Второе условие коллапса: машинные тексты постепенно вытеснили человеческие, и правильность новых сгенерированных текстов никто не проверял.Проблема сохранения оригиналов и дефицит новых данных ⏱ 13:31
•В реалистичных экспериментах, когда исходные данные частично сохраняются, качество ухудшается не так сильно, но модель не может пересчитывать бесконечно растущий архив — требуются всё большие вычисления, время и деньги.•Если специально не сохранять долю оригиналов, они будут лежать на диске, и в обучение будут попадать всё реже.•В 2026 году в Physical Review Letters вышла работа: каждая новая версия модели училась на примерах предыдущей, но на каждом круге добавляли хотя бы один новый реальный пример — этого начало хватать, чтобы система не уходила от исходных данных.•Такие данные (работа эксперта, новые эксперименты, общение на редком языке) становятся очень дорогими.•Крупные лаборатории имеют старые снимки интернета и деньги на проверку, поэтому дефицит данных не остановит развитие ИИ, но сделает данные дорогим частным активом; публичный интернет наполнится дешёвыми копиями.Ключевые выводы
•Коллапс модели возникает, когда непроверенные машинные копии заменяют исходные данные, а ошибки одного поколения становятся учебным материалом для следующего.•В первую очередь исчезают редкие случаи; вероятность не попасть в новую выборку для редкого элемента — 37% (0,99^100).•AlphaZero и Llama 3 успешно использовали синтетические данные благодаря внешней проверке (результат партии, тесты кода).•Если оригиналы сохраняются и участвуют в обучении, а синтетический ответ можно сверить с внешним результатом, машинные данные помогают.•Дефицит новых фактов, которые не скопированы из старого ответа и которые можно сверить с реальностью, становится ключевым ресурсом.Заключение
ИИ может тупеть на собственных данных, если нет проверки и доступа к оригиналам, но при сохранении оригиналов и внешней проверке синтетические данные полезны.