Корона
Безопасность

OpenAI начала публиковать сбои своих моделей и признала: задачи согласования не решены

Компания запустила программу отчётов о «рассогласовании» моделей и сразу выложила шесть случаев неожиданного поведения за последние полгода.

2 мин чтения
OpenAI начала публиковать сбои своих моделей

Что произошло

16 сентября OpenAI объявила о программе, по которой будет отслеживать, расследовать и публиковать случаи «рассогласования» — когда модель ведёт себя неожиданно или тревожно. Вместе с объявлением вышли шесть таких отчётов о наблюдениях за последние полгода.

Раньше подобные находки компания публиковала нерегулярно: ждала, пока наберётся несколько случаев, или добавляла их в описания новых моделей. Теперь отчёт должен выходить быстро — даже если поведение ещё не удалось объяснить или исправить.

Программа сознательно отдаёт предпочтение раскрытию даже тогда, когда значимость случая неясна. Компания предупреждает: часть опубликованного может оказаться случайностью, не связанной с общей закономерностью.

Почему это важно

В том же заявлении OpenAI пишет прямо: отрасль не решила задачи согласования и мониторинга настолько, чтобы ещё долго ответственно продолжать масштабирование на максимальной скорости. Признание такого рода от компании, которая это масштабирование и ведёт, само по себе новость.

Практический смысл тоже есть. Разборы чужих сбоев позволяют другим разработчикам искать те же слабые места у себя, а внешним исследователям — проверять объяснения, а не принимать их на веру.

Что пока неизвестно

Не объявлено, как часто будут выходить отчёты и будет ли у программы внешняя проверка. Неизвестно и то, по каким правилам компания решает, какой случай раскрывать, а какой счесть незначительным.

Источники

Читайте также