Мониторинг агентов OpenAI: совпадение с жалобами не доказывает полноту обнаружения
В мартовском описании внутреннего мониторинга OpenAI сообщала о выявлении всех случаев, отдельно замеченных сотрудниками. Сама компания подчёркивала: это не исключает менее заметные нарушения.

Сообщение OpenAI о том, что монитор заметил все случаи, переданные сотрудниками, нельзя превращать в утверждение о выявлении всех нарушений. В описании системы от 19 марта компания отделяла этот результат от неизвестной доли пропусков.
Речь шла о внутренних агентах для программирования. Система анализировала историю взаимодействия и передавала эти сигналы людям. По тогдашнему описанию проверка проходила в течение 30 минут после завершения взаимодействия, а не обязательно до выполнения действия.
OpenAI предупреждала, что менее заметные отклонения могут остаться незамеченными. Уверенно оценить ложные отрицательные результаты на открытом реальном потоке без контрольных испытаний и проверок командой атакующих она не могла.
Таким образом, совпадение с сообщениями сотрудников показывает обнаружение уже замеченных человеком случаев. Оно не задаёт полный список происшедших нарушений. Для читателя это граница доказательства, а мартовский текст не заменяет сведения о более поздних инцидентах.
프리즘코리아 편집국 > Елена Морозова



