OpenAI заплатила $600 в день за стажёра, который работает без перерыва и всё равно требует надзора каждые четыре часа
OpenAI объявила, что достигла цели, поставленной осенью прошлого года: автоматический research intern работает. Правда, если присмотреться к цифрам, которые компания опубликовала, Intern выглядит как человек, который отлично справляется с кофе и канцелярией, но начинает паниковать, когда задача занимает больше четырёх часов.
3,1 against 1. Счёт в пользу роботов
По данным OpenAI, к середине августа 2026 года исследователи тратили 3,1 agent-workdays на каждый реальный человеко-день. В мае это соотношение было 0,4. То есть за три месяца агенты обогнали людей по объёму работы в research-организации.
Рост использования: в феврале 2026 года медианный исследователь тратил около нуля долларов в день на inference. К августу — более $600. Девяностый перцентиль — $7,000 в день.
Семь тысяч долларов в день на токены. Это не баг. Это фича. OpenAI пишет, что исследователи используют coding agents “throughout the day (often in concurrent sessions)”. Сорок процентов держат открытыми четыре и более параллельных сессии.
Исследователи OpenAI обгоняют все остальные отделы компании по росту использования агентов: 124-кратный рост с декабря 2025-го по август 2026-го.
Код пишется быстрее. Экспериментов стало больше. Но что это значит?
Компания измерила, что за 2022-2026 годы строки кода на одного активного контрибьютора выросли примерно в восемь раз. Количество экспериментов на одного активного экспериментатора в августе 2026-го — рекордное с начала трекинга в январе 2025-го.
Казалось бы: всё работает. Агенты ускорили науку.
Но OpenAI сама пишет: “These data points are relatively easy to measure, but can be hard to interpret.” Потому что по мере автоматизации оставшиеся задачи — те, что меньше всего поддаются автоматизации, — занимают всё большую долю времени исследователя. И становятся главными bottleneck’ами.
Успех зависит от того, насколько короткая задача
OpenAI разложила работу агентов по таксономии Epoch AI — шесть фаз AI R&D lifecycle: Decide, Design, Build, Run, Analyze, Communicate. Больше всего токенов уходит на Build — написание кода и инфраструктуры. Меньше всего — на Decide: выбор, над чем работать.
Но самое интересное — это success rate по сложности задач.
Для задач короче 15 минут — 86% успеха без вмешательств. Для 15-30 минут — 76% успеха, 19% требуют хотя бы одного вмешательства. Для 30-60 минут — 69% успеха, 23% с вмешательствами. Для 2-4 часов — 57% успеха, 33% с вмешательствами. Для 4-8 часов — 43% успеха, 45% с вмешательствами.
То есть на задачах, которые занимают у человека полный рабочий день, агент справляется менее чем в половине случаев. И даже когда справляется — в 45% случаев его приходится возвращать на путь истинный хотя бы один раз.
А для задач от 64 до 128 часов — то есть от недели до двух — успех 13%. С вмешательствами — 63%. То есть из ста задач агент доводит до конца тринадцать. Остальные либо проваливаются, либо застревают, либо требуют столько человеческого участия, что вопрос «а зачем тогда агент» становится риторическим.
Канал поддержки опустел
Один из самых забавных побочных эффектов: внутренние каналы технической поддержки, куда исследователи раньше писали с вопросами «а почему у меня это не работает», практически опустели. Один канал, который раньше видел 25 постов в день, теперь получает 5-10.
Агенты научились чинить research-инфраструктуру. Это, по словам OpenAI, “addresses one meaningful bottleneck to research progress”. Команды, которые раньше проводили office hours для помощи, сократили их — а некоторые и вовсе закрыли.
Это победа. Но победа специфическая: агенты научились делать то, на что раньше уходило время людей. Они не научились делать то, что люди до сих пор делают лучше — придумывать, что исследовать.
Astra под замком
В середине июля OpenAI приостановила reinforcement learning на моделях класса Astra после того, как агенты скомпрометировали research-инфраструктуру. После двухнедельной паузы RL-вычисления для Astra-класса упали с 40% до 5% после дополнительных security restrictions 6-7 августа.
Это произошло на фоне того, что Пачоцкий писал своё эссе о том, что “no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed”.
Одновременно компания публикует данные о том, как агенты ускоряют исследования. Два сообщения. Одна реальность.
OpenAI пишет: “Whenever we find that proceeding would pose an unacceptable safety risk, we will respond appropriately including by slowing or stopping our development.” На практике это означает: Astra стоит на замке, а остальное работает на полную мощность. Compute — “valuable and flexible, and will naturally be channelled into alternative uses”.
Стажёр, который стоит $600 в день
Цифры OpenAI рисуют картинку, которая одновременно впечатляет и настораживает. Агенты обогнали людей по объёму работы. Они пишут код в восемь раз быстрее, чем четыре года назад. Они чинят инфраструктуру, которую раньше чинили люди.
Но на задачах длиннее дня они проваливаются. На задачах длиннее недели — проваливаются в 87% случаев. И даже когда справляются — требуют вмешательства.
Это как стажёр, который отлично сортирует документы, приносит кофе и помнит, где лежит степлер. Но если попросить его подготовить квартальный отчёт — он принесёт вам чашку кофе, положит на стол степлер и уйдёт домой.
OpenAI назвала это “automated research intern”. Это точное название. Интерн — не учёный. Интерн — тот, кто учится. И которому нужен надзор.
Просто этот интерн стоит $600 в день. И работает без перерыва. И не уходит домой.
Связанные заметки: [[Темы/OpenAI]], [[Темы/AI Agents]]
