
ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей
Anthropic дала агентам на Claude Opus 4.8 задачу: найти способ дообучить модель так, чтобы она меньше лгала, льстила или поддавалась взлому. По десяти видам сбоев агенты нашли методы, которые работают и на новых тестах, и на моделях в 4,7 раза крупнее.
