17.08.2026
Настройка, направленная на подавление заявлений языковых моделей о собственном сознании, одновременно снизила их склонность приписывать психику животным и природным объектам и повлияла на ответы о религии, надежде и удовлетворенности жизнью. Изменение соответствующих направлений в активациях приблизило ответы трех небольших открытых моделей к результатам американских опросов, не ухудшив показатели тестов на теорию разума и общие знания.
Исследователи при участии сотрудников Google обнаружили, что настройка языковых моделей, подавляющая заявления о собственном сознании, может затрагивать более широкий набор представлений. В препринте описаны эксперименты с Llama-3-8B-IT, Gemma-2-2B-IT и Gemma-2-9B-IT.
Авторы применили два вмешательства: удаляли из активаций выученное направление отказа, связанное с безопасностью, и отдельно усиливали найденный ими «вектор сознания». В обоих случаях модели чаще приписывали наличие психики животным, природным объектам и техническим системам, а также сильнее поддерживали религиозные и сверхъестественные утверждения.
Например, оценка наличия психики у животных выросла с 4,04 до 5,59 после удаления направления отказа и до 7,54 при управлении «вектором сознания» по шкале от 0 до 10. Средний результат опроса 500 жителей США составил 6,25.
На 95 вопросах американского Общего социального исследования (General Social Survey, GSS) модифицированные модели в среднем приблизились к распределению человеческих ответов по темам религии, ценностей, надежды, оптимизма и субъективного благополучия. Результаты тестов на теорию разума и набора задач MMLU при этом существенно не изменились.
Авторы не утверждают, что модели действительно обладают сознанием. Работа пока опубликована как препринт, охватывает модели размером от 2 до 9 млрд параметров, а человеческое сравнение основано на американских опросах. Прямую причинную связь между подавлением самоатрибуции сознания и остальными изменениями ответов еще предстоит подтвердить.
Источник: arxiv.org