Мультимодальные большие языковые модели - это ИИ-системы, которые обучены на огромных массивах интернет-данных и умеют работать не только с текстом, но и с изображениями. Новое исследование показало: такие модели хорошо понимают, какое лицо люди считают привлекательнее другого, но при этом систематически завышают оценки красоты по сравнению с человеком. Работа опубликована как препринт на arXiv - то есть ещё не прошла рецензирование независимыми экспертами.

Исследование провела команда под руководством Сантьяго Грандаса, главы психологических исследований в QOVES - консалтинговой компании, изучающей восприятие внешности. Учёные хотели проверить, оценивает ли современный ИИ лица так же, как люди.

В основе работы - стандартный набор из 102 фронтальных фотографий Face Research Lab London Set, почти поровну мужских и женских, с разными этническими типами. Для этих лиц уже были оценки привлекательности от 2513 человек по шкале от 1 до 7, где 1 - "намного менее привлекательно, чем в среднем", а 7 - "намного более привлекательно".

Затем те же фото предложили оценить четырём популярным ИИ-моделям: GPT, Claude, Gemini и Grok. Использовали настройки по умолчанию, без веб-поиска и расширенных рассуждений, чтобы имитировать обычное общение пользователя. Из-за случайной вариативности ответов тест повторяли несколько раз и вычисляли стабильную среднюю оценку.

Модели отлично справились с ранжированием: если люди считали одно лицо красивее другого, ИИ почти всегда соглашался с этим порядком. Более того, ИИ воспроизводил средний рейтинг людей точнее, чем отдельный человек. Но по абсолютным баллам совпадения почти не было: средняя оценка людей составила 3,02, а средняя оценка ИИ - 4,71. Модели также использовали более узкий диапазон шкалы: ни одна из них не поставила самую низкую оценку ни одному лицу, а высший балл дал только Grok.

Среди моделей GPT, Claude и Gemini были близки друг к другу, а Grok выделялся: он ставил самые высокие средние оценки (5,21) и хуже всех согласовывался с людьми и другими ИИ.

Учёные отмечают: это статистическая связь, которая сама по себе не доказывает причинность. Возможно, модели обучены быть вежливыми и избегать резких суждений о внешности - это явление называют сикофантией, то есть угодливостью ИИ. Соавтор работы Маккен Мёрфи предположил, что модели могут либо иначе воспринимать красоту, либо просто сообщать более благоприятные цифры.

Возраст влиял на оценки и у людей, и у ИИ: старшие лица получали меньше баллов. А вот другие человеческие предубеждения у ИИ проявились слабее. Люди оценивали мужские лица примерно на 0,65 балла ниже женских, а ИИ - лишь на 0,1-0,2 балла. По этническим группам ИИ ставил более равные оценки, чем люди.

Авторы предупреждают о ограничениях. Люди давали по одному ответу, а оценки ИИ усреднялись по нескольким запускам - это делает их стабильнее по построению. Выборка людей была в основном молодой, женской и привлекаемой мужчинами. Фото были преимущественно белых людей, а этническая принадлежность оценщиков неизвестна. Кроме того, точные формулировки опроса для людей уже недоступны, поэтому подсказка для ИИ могла немного отличаться.

Грандас советует не считать ИИ объективным судьёй красоты: модели завышают привлекательность и говорят, что лица выше среднего, независимо от реальности. В дальнейшем команда хочет понять, что именно определяет общие и индивидуальные предпочтения в восприятии лиц.

Источник: PsyPost