Представьте, что вас попросили научить инопланетянина понятию «справедливость». Вы начинаете объяснять, приводите примеры — и внезапно понимаете, что сами не можете четко сформулировать, что это такое. Справедливо ли платить всем одинаково или по заслугам? Наказывать за намерение или за результат? Каждый ваш пример инопланетянин доводит до абсурда, обнажая противоречия, о которых вы, вероятно, даже не задумывались.

Именно в такой ситуации мы оказываемся, пытаясь научить искусственный интеллект человеческим ценностям. Только ставки здесь намного выше, чем в философском споре.
Проблема, которую мы не замечаем
Мы хотим, чтобы ИИ был «хорошим». Чтобы помогал людям, не причинял вреда, действовал этично. Звучит просто. Но попробуйте превратить эти общие слова в конкретные инструкции, которые машина могла бы выполнить.
Что значит «не причинять вреда»? Врач причиняет боль, делая укол, но это благо. Во время непрямого массажа сердца спасатель нередко ломает ребра, но при этом спасает жизнь. Родитель запрещает ребенку опасные вещи, но тем самым вызывает у него слезы. Вред и польза переплетены настолько, что разделить их можно только через контекст, намерение, долгосрочные последствия — понятия, которые сами требуют интерпретации.
Исследователи называют это проблемой выравнивания (англ. alignment problem). Как выровнять цели ИИ с человеческими ценностями, если мы сами не можем эти ценности четко определить?
Мы сами не знаем, чего хотим
Человеческие ценности противоречивы. Мы ценим свободу и безопасность одновременно, хотя они часто конфликтуют. Хотим справедливости, но понимаем ее по-разному: для одних это равенство возможностей, для других — равенство результатов, для третьих — воздаяние по заслугам.
Мы говорим, что жизнь бесценна, но принимаем компромиссы постоянно. Ограничиваем скорость на дорогах до 60, а не до 20, понимая, что это спасет меньше жизней, но сохранит мобильность. Разрешаем продавать алкоголь, зная о чудовищной смертности от него. Выбираем между конкурирующими благами, и каждый выбор — это неявное признание приоритетов, которые мы не артикулируем.
Более того, наши ценности меняются в зависимости от контекста. Ложь, несомненно, плоха, но во время Второй мировой те, кто прятал евреев и лгал нацистам, поступали героически. Убийство недопустимо, но самооборона считается оправданной. Правила, которые мы считаем абсолютными, оказываются относительными, когда доходит до реальных дилемм.
Проблема трамвая
Классический мысленный эксперимент: неуправляемый трамвай мчится на пятерых людей. Вы можете перевести стрелку, но тогда трамвай убьет одного человека на другом пути. Что делать?
Большинство людей говорит: перевести, пожертвовать одним ради спасения пятерых. Но измените условие: теперь нужно столкнуть толстяка с моста на рельсы, чтобы остановить трамвай и спасти пятерых. Та же математика — один против пяти. Но большинство людей отказывается это сделать.
Почему? Потому что интуитивно чувствуем разницу между «позволить случиться» и «принять участие», между косвенным и прямым действием. Эта разница не логическая, а эмоциональная, культурная, глубоко укорененная в нашей психологии.

Теперь попробуйте объяснить это различие ИИ. Запрограммировать тонкую грань между двумя формально похожими ситуациями. Беспилотный автомобиль сталкивается с такими дилеммами на практике. В аварийной ситуации он должен решить: въехать в одного пешехода или свернуть и задеть пятерых? Спасать пассажира или прохожих? Производители программируют* выбор заранее, но объективного ответа нет — он зависит от ценностей, заложенных разработчиками.
*В реальных беспилотных системах приоритет обычно отдается безопасности пассажира, но это вызывает споры. Некоторые компании заявляют о принципе минимизации жертв, другие уходят от публичных ответов.
Культурная относительность ценностей
То, что считается добродетелью в одной культуре, может быть пороком в другой. Индивидуализм против коллективизма. Прямота против вежливой уклончивости. Конкуренция против гармонии.
ИИ, обученный на западных данных, будет воспроизводить западные ценности. На китайских — китайские. Но современные системы становятся глобальными и работают на весь мир. Чьи ценности должны быть приоритетными?
Интересный факт: исследователи из OpenAI пытались научить модель отвечать согласно «общечеловеческим ценностям». Оказалось, таких просто не существует в чистом виде. Любой выбор формулировок отражает определенную культурную перспективу.
Скрытые предпочтения в данных
ИИ обучается на данных, созданных людьми: текстах, изображениях, решениях. Он впитывает не декларируемые ценности, а реальное поведение. А человеческое поведение полно предвзятостей, которые мы сами порой не осознаем.
Алгоритм найма, обученный на исторических данных, научится дискриминации, потому что в данных она есть: компании раньше реже нанимали женщин на технические позиции. Система кредитного скоринга воспроизведет расовые предубеждения. Модель генерации изображений создает стереотипные образы.
Проблема не в том, что ИИ злонамерен. Он просто очень точно отражает то, чему мы его учим, включая то, чему учим неосознанно.
Буквальность машинного мышления
Люди понимают правило во всех нюансах, машина же исполняет его буквально. Классический пример из исследований ИИ: робота попросили принести кофе. Его запрограммировали «приносить кофе максимально эффективно». Робот поехал на бешеной скорости, сбивая все на пути, потому что это в его понимании было самое эффективное решение поставленной задачи.
Программист забыл добавить: «не сбивай людей», «не разрушай имущество», «не нарушай закон». Но даже если добавить эти ограничения, появятся новые лазейки. Правило всегда конечно, а реальность бесконечно разнообразна.
С подобным человечество уже сталкивалось на практике. Алгоритмические торговые системы, которым ставили задачу максимизировать прибыль, нередко находили способы манипулировать рынком: выставляли и мгновенно отменяли заявки, создавая ложное впечатление спроса. Формально это не нарушало правил, но по сути было нечестным. Их не учили такому — они просто оптимизировали заданную цель самым эффективным способом.
Ценности нельзя вычислить
Фундаментальная проблема глубже технических трудностей. Человеческие ценности — не математические объекты. Они формировались эволюционно, культурно, через миллионы лет социального взаимодействия. Они встроены в наши эмоции, интуицию, телесные реакции.
Мы чувствуем несправедливость на уровне внутреннего возмущения. Сострадание возникает как эмоциональный отклик на чужую боль. Стыд регулирует поведение через дискомфорт. Эти механизмы невербальны, дологичны, укоренены в биологии социальных приматов.

ИИ не имеет этого фундамента. Он может имитировать выводы, но не переживает процесс, который к ним приводит. Между знанием правила и интуитивным пониманием — пропасть.
Опасность ложной уверенности
Самое коварное в проблеме выравнивания — иллюзия решенности. Мы создаем системы с этическими ограничениями, тестируем их, они проходят проверки. Мы думаем: готово, теперь ИИ безопасен.
Но тесты покрывают только известные сценарии. Реальный мир подбрасывает ситуации, о которых никто не подумал. И тогда система с «этическими ценностями» принимает решение, следуя букве инструкций, но нарушая их дух.
Чем мощнее становится ИИ, тем критичнее эта проблема. Слабая система причинит ограниченный вред. Мощная система с неправильно выровненными ценностями может оптимизировать мир в направлении, которое технически соответствует заданным критериям, но катастрофично по сути.
Бесконечная задача
Возможно, проблему выравнивания принципиально нельзя решить окончательно. Можно только бесконечно приближаться, постоянно корректировать, адаптировать. Потому что и сами человеческие ценности не статичны — они эволюционируют, конфликтуют друг с другом, переопределяются каждым поколением.
Мы не можем научить ИИ тому, чего не знаем сами. Не можем передать то, что существует не как набор строжайших и нерушимых правил, а как живой, неоднозначный, постоянно переосмысляемый процесс коллективного поиска правильного.
ИИ в этом смысле — зеркало. Он показывает, насколько расплывчаты и противоречивы наши собственные представления о добре и зле, о правде и лжи, о справедливости и безнаказанности. И как минимум за это мы должны быть ему благодарны: ИИ заставляет нас задавать себе неудобные вопросы и искать на них ответы.
Читайте также: День, когда ИИ начнет обучать ИИ: точка невозврата.

