OpenAI начала публиковать сбои своих моделей и признала: задачи согласования не решены
Компания запустила программу отчётов о «рассогласовании» моделей и сразу выложила шесть случаев неожиданного поведения за последние полгода.

Что произошло
16 сентября OpenAI объявила о программе, по которой будет отслеживать, расследовать и публиковать случаи «рассогласования» — когда модель ведёт себя неожиданно или тревожно. Вместе с объявлением вышли шесть таких отчётов о наблюдениях за последние полгода.
Раньше подобные находки компания публиковала нерегулярно: ждала, пока наберётся несколько случаев, или добавляла их в описания новых моделей. Теперь отчёт должен выходить быстро — даже если поведение ещё не удалось объяснить или исправить.
Программа сознательно отдаёт предпочтение раскрытию даже тогда, когда значимость случая неясна. Компания предупреждает: часть опубликованного может оказаться случайностью, не связанной с общей закономерностью.
Почему это важно
В том же заявлении OpenAI пишет прямо: отрасль не решила задачи согласования и мониторинга настолько, чтобы ещё долго ответственно продолжать масштабирование на максимальной скорости. Признание такого рода от компании, которая это масштабирование и ведёт, само по себе новость.
Практический смысл тоже есть. Разборы чужих сбоев позволяют другим разработчикам искать те же слабые места у себя, а внешним исследователям — проверять объяснения, а не принимать их на веру.
Что пока неизвестно
Не объявлено, как часто будут выходить отчёты и будет ли у программы внешняя проверка. Неизвестно и то, по каким правилам компания решает, какой случай раскрывать, а какой счесть незначительным.
Источники
Читайте также

TechCrunch AI: Meta* оспорила сообщение о чтении Muse личных сообщений без разрешения

Ars Technica AI: LASST подала иск против OpenAI после инцидента с Hugging Face
