Модель, которая стала биологом
Anthropic опубликовала результат двух экспериментов, в которых языковая модель Claude провела полный пайплайн de novo дизайна белков. Не помогла. Не ускорила. Не предложила гипотезу для проверки учёными. А именно: установила нужное ПО, подобрала инструменты для каждой задачи, сгенерировала 1320 кандидатных белков и отправила их в контрактную лабораторию на проверку. Без человека, принимавшего решения о дизайне на промежуточных этапах.
Это не пресс-релиз. Это технический отчёт с конкретными цифрами, протоколами и ограничениями. И цифры говорят следующее.
Что именно делала модель
Задача — de novo дизайн минибайндеров: маленьких белков, которые плотно связываются с целевым белком и блокируют или изменяют его функцию. На этом принципе работает значительная часть современных биопрепаратов.
Claude (в экспериментах использовались модели Mythos Preview и Opus 4.8) работала не одна. Она устанавливала и запускала open-source инструменты, которые биологическое сообщество уже использует для дизайна белков: PXDesign, RFdiffusion3, Genie 3, FreeBindCraft, BoltzGen и другие. Модель сама выбирала, какой инструмент подойдёт для конкретного каркаса белка, комбинировала их в 24 различных workflow, фильтровала результаты через ESMFold2 и Protenix v2, ранжировала кандидатов и выдавала финальный список.
Человек на этом пути делал четыре вещи: выбрал целевые белки, написал системный промпт на 16 000 слов, заказал синтез в лаборатории и интерпретировал результаты. Всю остальную работу — научный анализ каждой мишени, выбор эпитопа (точки атаки на поверхности белка), установка программ, запуск, проверка, фильтрация — делала модель.
Системный промпт, кстати, заслуживает отдельного упоминания. Примерно треть — это научные инструкции и список литературы. Остальные две трети — расписание, делегирование суб-агентам, верификация результатов и дисциплина бюджета. Это не «спроектируй белок». Это «вот тебе проект с дедлайном, контролируй расходы и не ломай пайплайн». Корпоративный менеджмент среднего звена в шестнадцати тысячах слов.
Цифры
Из 16 целевых белков 15 дали измеримые результаты. На 14 из этих 15 мишеней Claude создал рабочих байндеров. Из 1320 спроектированных белков 354 реально связались с целевым белком в лабораторных условиях. Hit rate — 26,8%.
Для сравнения: Anthropic ссылается на типичный диапазон индустрии от 10 до 15 процентов, взятый из базы proteinbase.com.
Если смотреть только на дизайны, которые модель сама ранжировала первыми в своём списке, hit rate достигал 49 процентов. То есть модель не просто генерировала варианты наугад — она понимала, какие из них вероятнее сработают.
В мульти-таргетном режиме (все 16 мишеней одновременно, 48 часов) — 26,7% у Mythos Preview и 22,6% у Opus 4.8. Когда Mythos Preview работала с каждой мишенью отдельно, hit rate поднимался до 35,1%, но при 2,8-кратном бюджете на каждую мишень.
Бюджет всей мульти-таргетной кампании — 50 000 долларов. На одной мишени в отдельном режиме — 10 000 долларов. Всё через облачного провайдера Modal.
Конкретные истории, которые стоят сухих цифр
Самый убедительный пример — белок RBX1, часть ферментного комплекса, который контролирует направленный распад других белков в клетке. По этому белку ранее проводился открытый дизайн-конкурс: из 245 предложенных кандидатами с нуля связались только 9. Claude создала 90 дизайнов, из которых 28 сработали. Победивший дизайн конкурса был восстановлен и проверен на той же assay-пластине. Он связывался с мишенью при 45 наномолях. Лучший дизайн Claude — при 3,9 наномолях. Примерно в десять раз плотнее.
Сложнейшая мишень — TNFα, иммунный мессенджер, запускающий воспаление. Пять одобренных биопрепаратов нацелены именно на него, включая Humira — один из самых продаваемых лекарств в истории. Несколько предыдущих подходов к дизайну сообщали о нулевых попаданиях. Claude (Opus 4.8) создала 12 рабочих байндеров из 150 дизайнов. Правда, все они восходят к четырём различным каркасам, что снижает степень независимости результатов.
Неожиданный побочный результат: связывание с животными версиями целевых белков было вторичной целью промпта, но 130 из 233 протестированных байндеров сработали и на мышиных аналогах. Это практически значимо — доклинические испытания лекарств обычно проходят на животных.
Где модель провалилась
Два целевых белка оказались неподдающимися. BBF-14 — компьютерно-изобретённый белок бочкообразной формы, не существующий в природе. У него нет эволюционной истории, на которую мог бы опереться дизайн-метод. Только три слабо связывающихся дизайна сработали.
MBP (мальтозосвязывающий белок) имеет гладкую, гидрофильную поверхность, за которую байндеру не за что зацепиться. Ноль из 90. Самое неприятное: confidence scores от моделей предсказания фолдинга не предупредили ни об одном из этих провалов.
Это важные данные, и хорошо, что Anthropic их не скрыла.
Химический анализ за 19 минут
Второй эксперимент был другого типа. Opus 5 интерпретировал raw-данные двух стандартных лабораторных измерений: ЯМР-спектроскопии (ядерный магнитный резонанс) и жидкостной хроматографии с масс-спектрометрией. Химики используют эти данные, чтобы понять, получили ли они то, что планировали, и насколько чистым оказался продукт.
Проблема: приборы выдают файлы в проприетарных форматах, которые обычно анализируются вручную в софте производителя. Claude получил на вход сырые файлы и промпт из одной-трёх предложений.
Для файла LC-MS модель не нашла подходящую программу для чтения формата и декодировала его самостоятельно. Результат: точно воспроизвела summary-значения для всех 2 664 точек измерения. Время — 19 минут.
Для ЯМР-анализа модель предложила тот же контрольный эксперимент, который лаборатория независимо провела через три дня. Сначала сообщила о четырёх пропущенных сигналах, потом нашла собственную ошибку и скорректировала до двух. Всё — за 23 минуты.
Что на самом деле нового
Предсказывать структуры белков и генерировать новые белки научились ещё во времена AlphaFold и RFdiffusion. Саму работу по дизайну каркасов и оптимизации последовательностей делали эти специализированные инструменты — как и раньше.
Новое — это слой над ними. Языковая модель, которая не является белковой моделью, исследовала биологию каждой мишени, выбрала точку атаки, сама установила специализированные программы из публичных репозиториев, скомпоновала их в рабочие пайплайны и выдала готовое ранжирование без единого человеческого решения по дизайну.
Поскольку все использованные модели open-source, это технически доступно любой лаборатории.
Честные ограничения
Anthropic сама перечислила ограничения, и это стоит процитировать:
Нет параллельной кампании человеческих экспертов для сравнения. Никто не утверждает, что Claude сделала бы лучше специалистов с теми же инструментами и бюджетом. Для четырёх из шести целевых белков, где были результаты конкурса, эти результаты уже входили в список литературы модели.
Измерялось только связывание, не реальная пространственная структура и не биологический эффект. Ни один дизайн не был структурно разрешён — все показанные модели связывания являются предсказаниями. Каждая комбинация модели, формата и мишени запускалась ровно один раз, так что различия между моделями и случайность невозможно разделить. И значительная доля человеческой экспертизы сидит в самом промпте.
Все промпты, данные дизайна и результаты измерений опубликованы на Hugging Face.
Краткий ответ
Anthropic показала, что Claude-агент способен провести полный пайплайн de novo дизайна белков — от выбора инструментария до ранжирования 1320 кандидатов. Hit rate 26,8% против типичных 10–15% в индустрии. Бюджет одной кампании — $50 000. Все использованные инструменты open-source. Ограничения: нет сравнения с человеческими экспертами, измерялось только связывание, каждый дизайн запускался однократно.
