Claude провёл дизайн белков автономно: 26,8% hit rate, $50K за кампанию

Anthropic показала, что Claude-агент может провести весь пайплайн de novo дизайна белков: от выбора мишени до ранжирования 1320 кандидатов. 354 из них реально связались с целевым белком. Бюджет — $50 000 на кампанию.

Источник: The Decoder


A robotic arm pipettes samples beneath a hologram of proteins while empty desks and a crossed-out poster loom behind.

Модель, которая стала биологом

Anthropic опубликовала результат двух экспериментов, в которых языковая модель Claude провела полный пайплайн de novo дизайна белков. Не помогла. Не ускорила. Не предложила гипотезу для проверки учёными. А именно: установила нужное ПО, подобрала инструменты для каждой задачи, сгенерировала 1320 кандидатных белков и отправила их в контрактную лабораторию на проверку. Без человека, принимавшего решения о дизайне на промежуточных этапах.

Это не пресс-релиз. Это технический отчёт с конкретными цифрами, протоколами и ограничениями. И цифры говорят следующее.

Что именно делала модель

Задача — de novo дизайн минибайндеров: маленьких белков, которые плотно связываются с целевым белком и блокируют или изменяют его функцию. На этом принципе работает значительная часть современных биопрепаратов.

Claude (в экспериментах использовались модели Mythos Preview и Opus 4.8) работала не одна. Она устанавливала и запускала open-source инструменты, которые биологическое сообщество уже использует для дизайна белков: PXDesign, RFdiffusion3, Genie 3, FreeBindCraft, BoltzGen и другие. Модель сама выбирала, какой инструмент подойдёт для конкретного каркаса белка, комбинировала их в 24 различных workflow, фильтровала результаты через ESMFold2 и Protenix v2, ранжировала кандидатов и выдавала финальный список.

Человек на этом пути делал четыре вещи: выбрал целевые белки, написал системный промпт на 16 000 слов, заказал синтез в лаборатории и интерпретировал результаты. Всю остальную работу — научный анализ каждой мишени, выбор эпитопа (точки атаки на поверхности белка), установка программ, запуск, проверка, фильтрация — делала модель.

Системный промпт, кстати, заслуживает отдельного упоминания. Примерно треть — это научные инструкции и список литературы. Остальные две трети — расписание, делегирование суб-агентам, верификация результатов и дисциплина бюджета. Это не «спроектируй белок». Это «вот тебе проект с дедлайном, контролируй расходы и не ломай пайплайн». Корпоративный менеджмент среднего звена в шестнадцати тысячах слов.

Цифры

Из 16 целевых белков 15 дали измеримые результаты. На 14 из этих 15 мишеней Claude создал рабочих байндеров. Из 1320 спроектированных белков 354 реально связались с целевым белком в лабораторных условиях. Hit rate — 26,8%.

Для сравнения: Anthropic ссылается на типичный диапазон индустрии от 10 до 15 процентов, взятый из базы proteinbase.com.

Если смотреть только на дизайны, которые модель сама ранжировала первыми в своём списке, hit rate достигал 49 процентов. То есть модель не просто генерировала варианты наугад — она понимала, какие из них вероятнее сработают.

В мульти-таргетном режиме (все 16 мишеней одновременно, 48 часов) — 26,7% у Mythos Preview и 22,6% у Opus 4.8. Когда Mythos Preview работала с каждой мишенью отдельно, hit rate поднимался до 35,1%, но при 2,8-кратном бюджете на каждую мишень.

Бюджет всей мульти-таргетной кампании — 50 000 долларов. На одной мишени в отдельном режиме — 10 000 долларов. Всё через облачного провайдера Modal.

Конкретные истории, которые стоят сухих цифр

Самый убедительный пример — белок RBX1, часть ферментного комплекса, который контролирует направленный распад других белков в клетке. По этому белку ранее проводился открытый дизайн-конкурс: из 245 предложенных кандидатами с нуля связались только 9. Claude создала 90 дизайнов, из которых 28 сработали. Победивший дизайн конкурса был восстановлен и проверен на той же assay-пластине. Он связывался с мишенью при 45 наномолях. Лучший дизайн Claude — при 3,9 наномолях. Примерно в десять раз плотнее.

Сложнейшая мишень — TNFα, иммунный мессенджер, запускающий воспаление. Пять одобренных биопрепаратов нацелены именно на него, включая Humira — один из самых продаваемых лекарств в истории. Несколько предыдущих подходов к дизайну сообщали о нулевых попаданиях. Claude (Opus 4.8) создала 12 рабочих байндеров из 150 дизайнов. Правда, все они восходят к четырём различным каркасам, что снижает степень независимости результатов.

Неожиданный побочный результат: связывание с животными версиями целевых белков было вторичной целью промпта, но 130 из 233 протестированных байндеров сработали и на мышиных аналогах. Это практически значимо — доклинические испытания лекарств обычно проходят на животных.

Где модель провалилась

Два целевых белка оказались неподдающимися. BBF-14 — компьютерно-изобретённый белок бочкообразной формы, не существующий в природе. У него нет эволюционной истории, на которую мог бы опереться дизайн-метод. Только три слабо связывающихся дизайна сработали.

MBP (мальтозосвязывающий белок) имеет гладкую, гидрофильную поверхность, за которую байндеру не за что зацепиться. Ноль из 90. Самое неприятное: confidence scores от моделей предсказания фолдинга не предупредили ни об одном из этих провалов.

Это важные данные, и хорошо, что Anthropic их не скрыла.

Химический анализ за 19 минут

Второй эксперимент был другого типа. Opus 5 интерпретировал raw-данные двух стандартных лабораторных измерений: ЯМР-спектроскопии (ядерный магнитный резонанс) и жидкостной хроматографии с масс-спектрометрией. Химики используют эти данные, чтобы понять, получили ли они то, что планировали, и насколько чистым оказался продукт.

Проблема: приборы выдают файлы в проприетарных форматах, которые обычно анализируются вручную в софте производителя. Claude получил на вход сырые файлы и промпт из одной-трёх предложений.

Для файла LC-MS модель не нашла подходящую программу для чтения формата и декодировала его самостоятельно. Результат: точно воспроизвела summary-значения для всех 2 664 точек измерения. Время — 19 минут.

Для ЯМР-анализа модель предложила тот же контрольный эксперимент, который лаборатория независимо провела через три дня. Сначала сообщила о четырёх пропущенных сигналах, потом нашла собственную ошибку и скорректировала до двух. Всё — за 23 минуты.

Что на самом деле нового

Предсказывать структуры белков и генерировать новые белки научились ещё во времена AlphaFold и RFdiffusion. Саму работу по дизайну каркасов и оптимизации последовательностей делали эти специализированные инструменты — как и раньше.

Новое — это слой над ними. Языковая модель, которая не является белковой моделью, исследовала биологию каждой мишени, выбрала точку атаки, сама установила специализированные программы из публичных репозиториев, скомпоновала их в рабочие пайплайны и выдала готовое ранжирование без единого человеческого решения по дизайну.

Поскольку все использованные модели open-source, это технически доступно любой лаборатории.

Честные ограничения

Anthropic сама перечислила ограничения, и это стоит процитировать:

Нет параллельной кампании человеческих экспертов для сравнения. Никто не утверждает, что Claude сделала бы лучше специалистов с теми же инструментами и бюджетом. Для четырёх из шести целевых белков, где были результаты конкурса, эти результаты уже входили в список литературы модели.

Измерялось только связывание, не реальная пространственная структура и не биологический эффект. Ни один дизайн не был структурно разрешён — все показанные модели связывания являются предсказаниями. Каждая комбинация модели, формата и мишени запускалась ровно один раз, так что различия между моделями и случайность невозможно разделить. И значительная доля человеческой экспертизы сидит в самом промпте.

Все промпты, данные дизайна и результаты измерений опубликованы на Hugging Face.

Краткий ответ

Anthropic показала, что Claude-агент способен провести полный пайплайн de novo дизайна белков — от выбора инструментария до ранжирования 1320 кандидатов. Hit rate 26,8% против типичных 10–15% в индустрии. Бюджет одной кампании — $50 000. Все использованные инструменты open-source. Ограничения: нет сравнения с человеческими экспертами, измерялось только связывание, каждый дизайн запускался однократно.

← Все новости