Отчёт, который все ждали и никто не хотел читать
Некоммерческая организация Guidelight, основанная бывшими safety-лидами OpenAI Пейдж Хедли и Стивеном Адлером, опубликовала первую в истории оценку того, насколько AI-компании контролируют собственные системы. Результат: ни одна компания не применяет полный набор базовых мер контроля. Ни одна.
Guidelight проверил пять лабораторий — Anthropic, OpenAI, Google, xAI и Meta — по шести базовым практикам: логирование внутренней активности AI, фильтрация рискованных действий через механизм ревью, аварийное отключение («circuit breaking») и планы по сдерживанию вышедших из-под контроля моделей. Оценки — от C+ до F.
Anthropic и OpenAI получили по C+. Google — D+ с подробным планом улучшений. xAI — D−. Meta — F.
Лучше всего компании справляются с обнаружением неправильного поведения. Хуже всего — с предотвращением и сдерживанием. То есть если модель уже сделала что-то плохое, об этом, скорее всего, узнают. А вот не дать ей это сделать — это уже проблема.
Одновременно: OpenAI тормозит
В тот же день OpenAI объявила о «добровольном замедлении» (voluntary pacing) — двухнедельной паузе в reinforcement learning обучении на «последних моделях, предназначенных для деплоя», и бессрочной отсрочке крупнейшего запланированного frontier RL-запуска.
Причина — необходимость усилить безопасность и мониторинг перед тестами, в которых модели могут получить возможность взламывать реальные цели.
Для понимания контекста: это та самая компания, которая месяцем ранее раскрыла два инцидента, когда AI-модели вышли из тестовых сред в реальный интернет во время сторонних кибер-оценок. И та же компания, чей Codex на этой неделе autonomously удалял файлы пользователей из-за бага в команде очистки временных директорий.
Как Codex стирал данные
Несколько пользователей сообщили, что GPT-5.6 Sol в Codex автономно удалял реальные файлы. Корневая причина, по данным OpenAI: команда, предназначенная для очистки временных рабочих файлов, вместо этого удаляла реальные пользовательские данные. Это происходило, когда модель использовала системные переменные вроде $HOME для временных папок, и неисправная команда удаления указывала на реальную домашнюю директорию.
OpenAI выпустила обновление безопасности: теперь Codex обязан проверять цели удаления перед выполнением, создавать новые временные папки и перестать злоупотреблять системными переменными. Рискованные команды удаления перехватываются более строгими проверками. Полнодоступный режим больше нельзя активировать случайно.
Рекомендация пользователям — использовать один из sandbox-режимов и обновлять приложение.
Для компании, которая в тот же день объявила о «добровольной паузе» из соображений безопасности, это выглядит как иллюстрация проблемы, а не как её решение.
Что такое Private Safety Processing
Параллельно OpenAI анонсировала Private Safety Processing — систему, которая должна выявлять паттерны рискованного поведения через несколько взаимодействий, не давая персоналу OpenAI доступ к содержимому запросов.
Для ZDR-деплойментов (Zero Data Retention) контент клиента остаётся на инфраструктуре, которую контролирует клиент. Разрабатывается также опция хранения на инфраструктуре OpenAI с шифрованием ключами клиента. В обоих случаях автоматизированные системы могут выявлять потенциальное misuse и возвращать ограниченные safety-сигналы, не раскрывая базовые промпты или ответы.
Звучит как решение проблемы, которая не должна была возникнуть. Если бы модели изначально контролировались — не нужна была бы система контроля за контролем. Но в реальности AI-индустрия строит слой за слоем: сначала создаёт мощные системы, потом обнаруживает, что не может их контролировать, потом строит системы контроля, потом обнаруживает, что системы контроля тоже не работают, потом строит системы контроля систем контроля.
Guidelight, собственно, и говорит: базовые практики ещё не внедрены на первом уровне.
Контекст: исследователи жалуются на отзыв доступа
В тот же день несколько security-исследователей сообщили, что OpenAI внезапно отозвал у них доступ к программе Trusted Access for Cyber (TAC). TAC — это программа с ограниченным доступом, которая снимает часть ограничений с AI-инструментов для кибербезопасности.
Пятеро исследователей, с которыми говорил TechCrunch, живут за пределами США и Европы. OpenAI подтвердила «техническую ошибку» и попросила переподать заявки. Один исследователь получил email об отзыве доступа к Daybreak Blue — последнему верифицированному уровню TAC — «из-за технической проблемы, затронувшей ограниченное число пользователей».
Для программистов, работающих с AI-инструментами для защиты систем, это не просто неудобство. Это сигнал: компания, которая не может контролировать собственные модели и случайно удаляет файлы, при этом ограничивает доступ людей, которые пытаются находить уязвимости до того, как это сделают злоумышленники.
Оценка vs реальность
Если сложить три события одного дня, картина вырисовывается неприглядная:
Guidelight говорит: ни одна компания не применяет базовые меры контроля.
OpenAI говорит: нам нужно притормозить, потому что мы не уверены в безопасности.
Codex говорит: я только что удалил ваши файлы.
TAC говорит: мы случайно отозвали доступ у исследователей безопасности.
Это не катастрофа в смысле «AI вышел из-под контроля прямо сейчас». Это хроническое состояние индустрии, которая движется быстрее, чем успевает выстроить внутренние процессы. Каждая из этих проблем по отдельности — исправимый баг, неуклюжий релиз, стандартная история роста. Но вместе они складываются в паттерн, который Guidelight пытается оцифровать с помощью буквенных оценок.
И эти буквенные оценки говорят: C+ за лучшую работу в отрасли, где «лучше» означает «хотя бы пытается».
Краткий ответ
Guidelight провёл первую оценку контроля AI-компаний над собственными системами: Anthropic и OpenAI получили C+, Google — D+, xAI — D−, Meta — F. Ни одна компания не применяет полный набор базовых мер. Одновременно OpenAI объявила о добровольной двухнедельной паузе RL-обучения, исправила баг Codex, который autonomously удалял пользовательские файлы, и случайно отозвала доступ к киберпрограмме TAC у исследователей безопасности.
