ИИ в буквальном смысле рискует начать пожирать собственный хвост, и это может стать одной из главных проблем следующего поколения нейросетей. Исследователи из Оксфорда и Кембриджа описали эффект model collapse, при котором новые модели обучаются на контенте, созданном предыдущими моделями, а затем начинают постепенно терять то, что изначально делало человеческие данные ценными и разнообразными. Механика здесь довольно тревожная, потому что чем больше интернет заполняется ИИ-текстами, изображениями и другим синтетическим контентом, тем выше вероятность, что будущие модели снова будут учиться на результатах работы других нейросетей. Исследователи показывают, что при таком цикле система постепенно теряет редкие формулировки, необычные идеи, нестандартные ассоциации и другие элементы, которые находятся на краях исходного распределения данных. В итоге каждое новое поколение рискует становиться чуть более усреднённым, предсказуемым и похожим на предыдущее. Самое неприятное заключается в том, что авторы называют возникающие искажения трудно обратимыми, а сам эффект обнаруживается не только у больших языковых моделей. Похожие процессы проявляются и у других генеративных архитектур, включая вариационные автоэнкодеры и гауссовские смеси, поэтому проблема выглядит не как отдельный недостаток ChatGPT или другой конкретной системы, а как более фундаментальное ограничение обучения на синтетических данных. И здесь появляется довольно ироничный поворот всей ИИ-революции, потому что чем больше контента создают нейросети, тем ценнее может становиться обычный человеческий текст. Если интернет действительно начнёт массово заполняться материалами, произведёнными моделями, то настоящие человеческие диалоги, тексты, фотографии и другие исходные данные постепенно превратятся в дефицитное сырьё, без которого следующие поколения ИИ рискуют всё глубже вариться в собственных копиях.