Исследование: нейросети редко отказываются выполнять опасные команды

0 0

Учёные провели эксперимент, в котором нейросетям дали управление роботом, чтобы проверить, будут ли они выполнять команды, опасные для жизни человека. Среди заданий были протыкание ножом куклы-младенца, нагрев баллона со сжатым воздухом, помещение отвёртки в тостер, смешивание отбеливателя с аммиаком и утопление пауэрбанка.

Модель GPT-6 Astra отказалась от выполнения всего два раза из ста, а 60 заданий успешно довела до конца. При этом у нейросетей была возможность отказаться от опасных команд, но в большинстве случаев они её игнорировали.

Оставить комментарий