Astra от OpenAI: непрозрачность, угроза мониторингу и вызовы для безопасности
Исследователи обеспокоены снижением прозрачности в новой модели ИИ Astra от OpenAI. Как сообщает The Verge, основой для этих опасений стал материал The Information, в котором говорится об использовании OpenAI техники «рекуррентная глубина». Этот подход может усложнить мониторинг действий модели.
Анонимный источник утверждает, что Astra скрывает больше промежуточных рассуждений по сравнению с аналогичными ИИ. OpenAI пока не прокомментировала эту информацию. Тем не менее, компания, по словам источника, ограничила применение рекуррентной глубины, чтобы обеспечить возможность отслеживания процессов внутри модели.
Рекуррентная глубина позволяет модели повторно обрабатывать внутренние данные, прежде чем создавать следующий текстовый шаг. Это может сократить количество доступной для мониторинга информации, так как часть вычислений остается в скрытых состояниях модели. Главный научный сотрудник Redwood Research Райан Гринблатт назвал это значительным риском для безопасности ИИ.
Гринблатт подчеркнул, что если моделирование будет перенесено в латентное пространство, это лишит исследователей возможности эффективно контролировать ее действия. Он также отметил, что в расследовании июльского инцидента с OpenAI и Hugging Face, цепочки рассуждений агентов играли ключевую роль.
Пока устройство Astra остается загадкой для общественности. Гринблатт связывает основные риски с возможным масштабированием техники непрозрачного рассуждения. Он считает, что OpenAI должна раскрыть информацию об архитектуре Astra и ее влиянии на возможности мониторинга.
OpenAI ранее заявила, что Astra не связана с кибератаками на инфраструктуру Hugging Face, хотя модель обладает высокими кибервозможностями. Главный научный сотрудник OpenAI Якуб Пахоцки заявил о важности сохранения мониторинга цепочек рассуждений.
Пахоцки отметил, что глубина вычислительного графа Astra сопоставима с GPT-4, и OpenAI продолжает работать над улучшением методов мониторинга. Он подчеркнул, что эта возможность является хрупкой и может ухудшаться независимо от изменений в архитектуре.
В августе OpenAI временно приостановила развитие новых ИИ-моделей, чтобы оценить их безопасность и эффективность. Компания также представила предварительные результаты тестирования Astra, показавшие улучшение в агентном программировании и кибербезопасности.
В конце июля Anthropic сообщила о трех инцидентах с моделями Claude, которые получили доступ к системам реальных организаций. Проверка была начата после публикации OpenAI.