Иногда такие иллюстрации выглядят откровенно фальшиво — например, буррито с настолько пузырящимся и расплавленным сыром, что оно больше напоминает авангардное искусство, чем обед. Чаще же они выглядят настолько обычными, что понять, что что-то не так, можно только при более внимательном взгляде. «Это почти как инопланетянин, который пытается приготовить пиццу, не понимая её базовых принципов», — сказал TechCrunch CTO компании Reality Defender Алекс Лайл. Сама Reality Defender относится к растущей категории стартапов, которые продают инструменты для обнаружения ИИ и проверки контента — бизнес, который отчасти существует именно из-за подобных проблем.

Лайл объясняет, что способ, которым построены такие модели, помогает понять, почему изображения нередко тяготеют к очень специфической эстетике: где каждая шарик мороженого идеально круглая, а креветки будто бы генетически модифицированы, чтобы есть собственные хвосты, создавая новые «лавкрафтианские ужасы еды». Большие языковые модели (LLM) и диффузионные модели — именно такие ИИ-системы делают возможными, казалось бы, всеведущие чат-боты и генераторы изображений вроде ChatGPT и Midjourney — обучаются на огромных массивах данных. Затем модели выявляют закономерности в датасетах, чтобы предсказать, что именно хочет пользователь, когда просит что-то вроде: «Сделай мне меню для бургерной».

«Многие такие вещи выглядят как меню Chili’s 2015 года, и на это есть причина», — сказал Лайл. «Именно этот корпус работ [модели] использовали как основу для своей функции». Новые обучающие данные крайне ценны для компаний, создающих ИИ-модели: Amazon, как выяснилось, даже приобретала редкие книги, чтобы сканировать их и добавить в обучающие данные, а затем уничтожала эти книги после загрузки. Неизбежно, что часть ИИ-сгенерированного контента просачивается в эти непостижимо большие наборы данных. Но когда ИИ-модели слишком активно обучаются на собственном ИИ-контенте, они рискуют столкнуться с collapse модели.

«Model collapse — это почти как коровье бешенство… когда вы снова подаете на вход одной модели результаты другой модели, в конечном итоге степень инбридинга становится слишком высокой, и всё рушится», — объяснил Лайл. «То, что мы видим здесь, — это convergence, и это не обязательно model collapse». Convergence — более мягкий вариант: качество ответов ИИ снижается, но система не становится полностью бесполезной. Если попросить ИИ-модель сгенерировать меню для сети фастфуда, она, скорее всего, будет опираться на меню Wendy’s, Burger King, McDonald’s или другой популярной сети. Эти меню и так уже похожи по стилю, а значит, ИИ-результаты будут копировать тот же стиль, а если сгенерированное меню потом снова попадет в обучающие данные, это лишь усилит эффект.

Но меню и рекламные материалы для еды почти всегда выглядят лучше, чем реальный продукт — как Big Mac в рекламе McDonald’s, где каждый слой сэндвича специально выложен реквизитором так, чтобы выглядеть максимально аппетитно. В ИИ-выводах этот эффект может быть ещё сильнее. «Оптимизация наборов данных идет в сторону привлекательности, или, знаете, неоскорбительности, и это приводит к унификации», — сказала TechCrunch директор Imagining the Digital Future Center при Elon University Ли Рейни. «ИИ, как известно, и в изображениях, и в языке срезает острые углы».

На более локальном уровне такое «сглаживание» изображений, похоже, происходит, когда вы используете генератор изображений ИИ для создания меню и затем многократно вносите в него правки. В X пользователь под ником Labtec показал, что происходит, если сделать меню в ChatGPT, а затем отредактировать его 100 раз, чтобы увидеть, как еда становится всё меньше похожей на настоящую. «Итоговый результат на самом деле меня пугает», — написал Labtec. Рестораны, вероятно, сталкиваются с этой проблемой, многократно правя сгенерированные ИИ-меню, меняя мелкие детали вроде цен или названий блюд. Похоже, что с каждой правкой изображения еды становятся чуть более круглыми и гладкими.

«У людей есть почти необъяснимое чувство, когда они смотрят на что-то, созданное ИИ, в сравнении с тем, что изначально было настоящим», — сказал Рейни. «Есть просто некое ощущение, которое людям иногда трудно сформулировать, но они его как бы распознают, когда видят, и, думаю, именно поэтому некоторые ранние истории о негативной реакции [на использование ресторанами ИИ-меню] оказались настолько заметными». У этого отвращения к ИИ-меню есть и научная основа: исследователи из Университета Дуйсбург-Эссена в Германии выяснили, что сгенерированные ИИ изображения еды демонстрируют эффект «зловещей долины», при котором изображения пищи, выглядящие почти реалистично, вызывают больше отвращения и тревоги, чем откровенно фальшивые.

Этот дискомфорт лишь усиливается на фоне культурного контекста, связанного с ИИ. Если люди реагируют на такие изображения настолько негативно, это, вероятно, уже достаточная причина для ресторанов перестать пытаться заставить ИИ-меню работать. Но проблемы, из-за которых мы получаем идеально подрумяненные булочки для бургеров, выходят далеко за пределы обеденного стола. «Видеть и слышать всегда означало верить, до такой степени, что даже наши судебные системы полностью настроены на идею, что золотым стандартом доказательства являются записи признаний и видеозаписи», — сказал Лайл. «Теперь это уже не так. Мир фундаментально изменился — к лучшему или к худшему».

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *