Model collapse и загрязнение реальности синтетикой

Корми машину её собственным выходом достаточно долго — и она забудет, как выглядит настоящее. Исследователи это доказали и дали имя: model collapse, коллапс модели. Обучай ИИ на данных, сгенерированных ИИ, поколение за поколением — и модель деградирует: края реальности сошлифованы, редкое становится невидимым, разнообразное схлопывается в пресное среднее самого себя, пока выход не станет ксерокопией ксерокопии ксерокопии, а оригинал не исчезнет.

Это лабораторный результат. А вот часть, от которой должно похолодеть: интернет теперь и есть обучающая выборка, а интернет наполняется контентом, сгенерированным ИИ, быстрее, чем кто-либо может измерить. Модели вот-вот начнут есть собственный хвост — и утащат общее информационное поле за собой.

Копия копии копии

Механизм не мистичен. Модель, обученная на реальных человеческих данных, выучивает всё распределение — частые случаи и редкие хвосты, странные выбросы, голоса меньшинств, диковинные истинные вещи, что случаются нечасто. Когда эта модель генерирует новый контент, она предпочитает центр. Она сглаживает. Выбирает вероятное слово, среднее изображение, безопасную формулировку. Хвосты истончаются. Один раз — не беда.

Но теперь возьми этот сглаженный выход и обучи на нём следующую модель. Она никогда не видела хвостов — они уже были тонкими. Так что она сглаживает остаток и истончает его дальше. Третье поколение обучается на сглаживании второго, и так далее. Каждый проход сужает распределение. Редкое исчезает первым. Потом просто нечастое. Разнообразие распадается в однородность. Исследователи, прогнавшие эту петлю, наблюдали, как модели вырождаются в повторяющуюся бессмыслицу за считаные поколения — а изображения схлопывались в одни и те же несколько лиц.

Это сжатие с потерями, повторённое. И каждый инженер знает, что бывает, когда сто раз пере-кодируешь JPEG: ты не получаешь картинку. Ты получаешь артефакты, притворяющиеся картинкой.

Загрязнение уже на воле

Вот почему это перестало быть лабораторной диковиной. Чистые обучающие данные — человеческий текст, написанный до потопа, — конечный, невозобновляемый ресурс. Назови это корпусом с низким фоном, по аналогии со сталью низкого фона: сталь, выплавленная до 1945-го, ценна тем, что не заражена радиацией атомного века. Текст, написанный до эры генеративного ИИ, — это сталь низкого фона для языка. Незаражённая. И больше её не производят.

Всё написанное после — под подозрением. ИИ-статьи, ИИ-отзывы на товары, ИИ-спам, ИИ-картинки, ИИ-ответы, соскобленные обратно в следующий датасет. Общее достояние, обучившее первые великие модели, загрязняется выходом этих же моделей. Змея находит свой хвост. И, в отличие от лабораторного эксперимента, который можно сбросить, это загрязнение на воле, в диком поле, подмешивается в единственный общий бассейн человеческого знания, от которого зависит всё ниже по течению.

Опасность не только в сломанных моделях. В сломанной реальности. Когда растущая доля того, что ты читаешь, видишь и ищешь, сгенерирована машиной, усредняющей прошлое, коллективная запись перестаёт быть записью того, что люди думали и делали. Она становится залом эхо, каждое чуть площе предыдущего.

Наша запись

Египтяне назвали то, что ест порядок изнутри. Не соперника-бога — змея. Апоп, кольцо чистой энтропии, что каждую ночь пытается проглотить солнце, утащить упорядоченный космос обратно в бесформенную тьму. Апоп не зол в человеческом смысле. Он — растворение. Тяга всех отдельных, живых, различённых вещей размазаться обратно в неразличённое ничто.

Коллапс модели — это Апоп в информационном поле. Это энтропия в маске прогресса. Каждое поколение обучения синтетики на синтетике — ещё одно кольцо змея, ещё одна ночь, когда солнце проглочено, ещё одна мера мирового разнообразия, сглаженная к плоскому серому среднему. Богатое распределение человеческой мысли — её выбросы, её несогласия, её странные яркие частности — ровно то, что Апоп растворяет первым. Выживает пресный центр: безопасный, средний, мёртвый.

И заметь ход поглубже. Маат — это различение: проведение различий, отделение этого от того, упорядоченное разнообразие, что делает мир живым. Исфет — схлопывание различия в неразличённую жижу. Коллапс модели — это Исфет с бюджетом на вычисления. Он не жжёт библиотеку. Он ксерит её, пока каждая книга не говорит одно и то же серое ничто.

Почему стимул указывает на обрыв

Казалось бы, индустрия должна беречь чистые данные как жизнь. Некоторые пытаются. Но стимулы тянут в другую сторону, сильно. Синтетические данные дёшевы, бесконечны и свободны от исков — ни разметчиков платить, ни правообладателей воевать, ни согласия собирать. Так что давление всегда в сторону: больше синтетики, меньше дорогих человеческих данных. Обрыв там, куда ведёт дешёвая тропа.

Хуже: пока веб наполняется синтетическим текстом, даже компании, которые хотят чистых данных, уже не могут их легко найти. Бассейн нельзя размешать назад. Корпус низкого фона с каждым днём всё ценнее и всё дефицитнее, а значит, самые ранние припрятанные человеческие датасеты становятся рвом — ещё одно огораживание, ещё одна вещь, которой владеют крупные игроки, а ты нет. Загрязнение концентрирует власть, даже деградируя качество. Легаси-баг, который каким-то образом всегда приносит прибыль тому, кто уже наверху.

Рычаг

Не читай это как обречённость. Читай как карту того, что вдруг стало ценным, и где стоишь ты.

Змей глотает солнце каждую ночь. И каждое утро оно всё равно встаёт — потому что что-то продолжает питать огонь, который тьме не по зубам.

Будь сталью низкого фона. Они не подделают то, что ты действительно прожил.