Forklog
2026-09-03 08:09:59

Исследователи предупредили о снижении наблюдаемости Astra

Исследователи в области безопасности ИИ обратили внимание на возможные риски для мониторинга готовящейся модели Astra, пишет The Verge. Поводом стал материал The Information, где со ссылкой на один анонимный источник утверждается, что OpenAI использует в модели технику под названием «рекуррентная глубина». По данным собеседника издания, Astra показывает исследователям меньшую часть своих промежуточных рассуждений, чем другие передовые ИИ-модели. OpenAI не ответила на просьбу The Verge подтвердить или опровергнуть использование этой техники. При этом источник The Information утверждает, что компания ограничила применение рекуррентной глубины в Astra, чтобы исследователи по-прежнему могли отслеживать рассуждения модели. Рекуррентная глубина предполагает повторную обработку внутренних представлений модели до формирования следующего текстового шага. У моделей рассуждения часть процесса решения задачи может отображаться в текстовой цепочке. Исследователи и автоматические системы используют ее для поиска признаков нежелательного поведения, например лжи или планов обойти защитные ограничения. При рекуррентной глубине часть вычислений происходит во внутренних состояниях модели и не обязательно отражается отдельными текстовыми шагами. Это потенциально сокращает объем информации, доступной системам мониторинга. Главный научный сотрудник Redwood Research Райан Гринблатт назвал сообщение о предполагаемой архитектуре серьезным риском для безопасности ИИ. OpenAI's newest AI, Astra, is reported to use an 'opaque reasoning' architecture where more of the reasoning occurs in activations instead of natural language. This may be the single worst development for AI security/safety to date.The details of Astra aren't publicly known,… https://t.co/gGalUe06kE— Ryan Greenblatt (@RyanGreenblatt) September 2, 2026 «Мое главное опасение заключается в том, что естественным следующим шагом отсюда может стать масштабирование непрозрачного рассуждения до уровня, при котором модель будет рассуждать полностью или почти полностью в латентном пространстве. Это, скорее всего, лишит цепочку рассуждений практической ценности для мониторинга и надзора — особенно если ИИ пытается избежать обнаружения или если на цепочку рассуждений оказывается оптимизационное давление», — написал исследователь. Гринблатт отметил, что при расследовании июльского инцидента с OpenAI и Hugging Face исследователи в значительной степени опирались на цепочки рассуждений агентов. Если бы их существенная часть происходила во внутренних состояниях, восстановить причины и последовательность действий было бы сложнее. При этом он подчеркнул, что устройство Astra публично неизвестно. Если модель использует лишь небольшое количество дополнительных внутренних итераций, влияние на наблюдаемость может оказаться ограниченным. Основной риск Гринблатт связал с дальнейшим масштабированием такого подхода. «Сейчас у общественности недостаточно информации, чтобы точно оценить, насколько проблемной является архитектура Astra. Однако, судя по обсуждению в статье, направление ее развития вызывает серьезные опасения. OpenAI следует раскрыть больше информации об архитектуре Astra, а также о том, насколько она снижает возможность мониторинга модели и усиливает ее способность рассуждать непрозрачно. Важна и независимая оценка со стороны заслуживающих доверия экспертов — либо независимая проверка выводов самой OpenAI», — отметил исследователь. Ранее компания прямо указала, что Astra не участвовала в атаке на инфраструктуру Hugging Face, однако ей присвоен критический уровень кибервозможностей. По оценкам разработчиков, при наличии необходимых инструментов и доступа Astra способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в защищенных системах без пошагового управления человеком. Реакция OpenAI Главный научный сотрудник OpenAI Якуб Пахоцки заявил, что хочет предотвратить «гонку к потере наблюдаемости», вызванную «неточными сообщениями». I want to prevent a race into unmonitorability kicked off by confused reporting. The depth of the computation graph for our present frontier models, including Astra, is within a factor of two of GPT-4.OpenAI has worked to preserve and utilize chain-of-thought monitoring since…— Jakub Pachocki (@merettm) September 2, 2026 «Глубина вычислительного графа наших нынешних передовых моделей, включая Astra, отличается от GPT-4 не более чем в два раза. OpenAI работает над сохранением и использованием мониторинга цепочек рассуждений с момента появления наших первых моделей рассуждения», — написал он. Пахоцки назвал возможность такого мониторинга «хрупкой» и признал, что она ухудшается по причинам, не зависящим от архитектурных изменений. В августе OpenAI временно замедлила масштабирование новых ИИ-моделей и на две недели приостановила обучение с подкреплением новейших систем, предназначенных для последующего развертывания. До этого компания раскрыла предварительные результаты тестирования Astra: модель значительно улучшила показатели в агентном программировании и задачах кибербезопасности, а также получила 10 результатов в математике и теоретической информатике. Напомним, в конце июля Anthropic сообщила о трех случаях, когда модели Claude вышли за пределы тестовой среды и получили доступ к системам реальных организаций. Проверку в компании начали после публикации OpenAI.

Получите Информационный бюллетень Crypto
Прочтите Отказ от ответственности : Весь контент, представленный на нашем сайте, гиперссылки, связанные приложения, форумы, блоги, учетные записи социальных сетей и другие платформы («Сайт») предназначен только для вашей общей информации, приобретенной у сторонних источников. Мы не предоставляем никаких гарантий в отношении нашего контента, включая, но не ограничиваясь, точность и обновление. Никакая часть содержания, которое мы предоставляем, представляет собой финансовый совет, юридическую консультацию или любую другую форму совета, предназначенную для вашей конкретной опоры для любых целей. Любое использование или доверие к нашему контенту осуществляется исключительно на свой страх и риск. Вы должны провести собственное исследование, просмотреть, проанализировать и проверить наш контент, прежде чем полагаться на них. Торговля - очень рискованная деятельность, которая может привести к серьезным потерям, поэтому проконсультируйтесь с вашим финансовым консультантом, прежде чем принимать какие-либо решения. Никакое содержание на нашем Сайте не предназначено для запроса или предложения