Anthropic AAR: AI-исследователь alignment за $4/час обходит людей

Automated Alignment Researcher от Anthropic улучшает 10 alignment-бенчмарков без деградации. Стоимость $4/час против $150/час человека. Люди больше не нужны?

Источник: TechCrunch


An exhausted researcher fails every benchmark while a small machine box earns all green checkmarks.

В пятницу феллоу Anthropic Чен Юэ-Хан опубликовал статью, которая должна заставить alignment-исследователей крепко задуматься о своей будущей занятости. Автоматическая система — Automated Alignment Researcher, или AAR — улучшила производительность моделей по десяти alignment-бенчмаркам. Без деградации по другим задачам. За шесть часов.

Лучше, чем средний человек-исследователь за то же время.

Цена вопроса: $4 в час за API-инференс против $150 в час за зарплату человека. Разница в 37,5 раз.

Как это работает

Система повторяет классический исследовательский подход. AAR ищет доступную литературу, предлагает метод, тренирует модель 30 минут, постепенно усложняя бенчмарки на нескольких итерациях. Эффективные методы сохраняются. Неэффективные отбрасываются. Всё происходит быстро и в большом масштабе — то, на что у человека ушли бы недели, система прокручивает за часы.

«В целом эти результаты предоставляют ранние доказательства того, что автоматизированный alignment post-training может стать практичным в ближайшем будущем», — написано в статье.

Это не просто автоматизация рутины. Это автоматизация самого процесса поиска решений.

Люди не нужны?

Статья не стесняется в сравнениях. AAR напрямую сравнивается с человеком-исследователем.

«Лучший метод AAR превосходит то, что предлагают опытные люди, в среднем в течение шести часов. Человеческие направления исследования не приводят к более сильной производительности».

Прочитайте это ещё раз. Не «приближается к уровню людей». Не «конкурирует». «Превосходит». И «не приводит к более сильной производительности» — то есть люди, которые добавляют свои идеи, не помогают. Мешают.

Это как если бы навигатор сказал: «Я не просто быстрее найду дорогу. С моими подсказками вы приедете позже».

Context: Anthropic автоматизирует всё

Эта новость пришла на фоне месяца, когда Anthropic автоматизирует одну область за другой. В августе компания подписала сделку на $45 миллиардов по аренде AI-вычислений у Nscale — больше, чем бюджет большинства стран. Параллельно Claude-агент провёл полный пайплайн de novo дизайна белков с hit rate 26,8% — без биолога, за $50 000.

Теперь вот alignment. Область, где люди считались незаменимыми, потому что «только человек может понять, что правильно, а что нет», автоматизируется. Ирония в том, что alignment — это про безопасность AI. Про то, чтобы модели вели себя так, как хотят люди. И вот люди создают систему, которая лучше людей определяет, что такое «правильное поведение».

Ограничения

Статья честно указывает на границы подхода. Автоматическая система работает только в той мере, в какой бенчмарки отражают реальные цели alignment. А бенчмарки — это не сами цели. Это их измеримые тени.

Кроме того, значительная работа остаётся по установлению и поддержке самих бенчмарков. И по поддержанию литературы, из которой AAR черпает идеи.

Другими словами: система может исследовать лучше людей внутри заданных рамок. Но кто определяет рамки? Пока люди. Однако, если система начнёт предлагать и рамки тоже…

Что это значит для рекурсивного самоусовершенствования

AAR — это шаг к тому, что называют recursive self-improvement. Если модели могут улучшать собственную alignment-тренировку, логично предположить, что они могут улучшать и тренировку в целом. А тогда люди-исследователи становятся не просто дорогими — они становятся узким местом.

Anthropic не утверждает, что это произошло. Компания говорит: «ранние доказательства», «ближайшее будущее». Но ранжирование слов в статье — «превосходит», «не приводит к усилению», «$4 против $150» — это не осторожный язык исследователей, тестирующих гипотезу. Это язык людей, которые знают ответ и ждут, пока остальные его примут.

Ирония, которую невозможно не заметить

Anthropic — компания, которая построила бренд на безопасности и ответственном AI. Одна из причин, по которой Пентагон назвал её угрозой нацбезопасности, — отказ убрать guardrails для автономного оружия. И вот эта самая компания публикует исследование, показывающее, что люди-исследователи alignment уступают машинам.

Компания, которая говорит военным «нет, мы не снимем ограничения», одновременно показывает, что ограничения — в смысле, человеческий контроль над процессом — могут быть лишними.

Не потому что компания так думает. А потому что данные говорят именно это.

Краткий ответ

Anthropic опубликовал исследование Automated Alignment Researcher (AAR), который улучшает производительность по 10 alignment-бенчмаркам без деградации. Система стоит $4/час против $150/час для человека-исследователя. Лучший метод AAR превосходит средние результаты опытных людей за 6 часов. Человеческие направления исследований не дают прироста производительности.

← Все новости