Почему ИИ отлично пишет код, но буксует в биологии: исследование Anthropic о данных и инфраструктуре

Компания Anthropic выпустила исследование с простым, но неудобным вопросом: почему ИИ-агенты так быстро прокачались в программировании и при этом до сих пор спотыкаются в биологии? Ответ оказался не про интеллект моделей, а про инфраструктуру, в которой им приходится работать.

Аналогия: ровные дороги для софта и узкие улочки для биологии

Авторы приводят наглядную аналогию.

Софт (программирование) Биологические данные
Изначально строился под машины (агентов) Похож на старый город, спроектированный задолго до появления автомобилей
Ровные дороги, размеченные полосы Узкие извилистые улочки
Понятные развязки, контроль версий Разрозненные базы данных
Документированные API, пакетные менеджеры Нестандартные форматы файлов
Самописные скрипты

Человек там как-то проедет, опираясь на местный опыт, а вот агенту — тяжело.


Почему кодовые агенты развиваются быстрее

Фактор В программировании
Структура Есть структурированные цифровые воркфлоу (рабочие процессы) и предсказуемые интерфейсы
Проверка результата Патч либо проходит тесты, либо нет — чёткий критерий

В биологии всё иначе:

Фактор В биологии
Инфраструктура Часто хрупкая и неоднородная
Проверка результата Понятных и проверяемых критериев успеха почти нет

Поэтому узкое место биологических агентов — не в умении рассуждать, а в отсутствии надёжного способа добраться до нужных данных и воспроизвести результат.


Бенчмарк VirBench: как измеряли проблему

Чтобы показать проблему на цифрах, команда Anthropic собрала бенчмарк VirBench:

Параметр Значение
Реалистичных запросов 120
По патогенам 40
Источник данных База NCBI Virus
Тип задач Выгрузка вирусных последовательностей

Это реальные задачи из вирусологии:

  • наблюдение за вспышками заболеваний

  • разработка диагностических тестов

  • сбор данных для обучения белковых моделей


Результаты: точность плавает, а ответы нестабильны

Когда агенты (Claude, Biomni, Edison Analysis, GPT) решали задачи самостоятельно, точность плавала в широком диапазоне:

Минимальная точность Максимальная точность
16,9% 91,3%

Для выгрузки данных это провал. Здесь нужна точность близко к 100%, потому что одна пропущенная или лишняя запись полностью меняет выводы.

Хуже того: нестабильность ответов

Одна и та же модель на одинаковый запрос выдавала разные ответы.

Пример с лихорадкой Эбола (Sonnet 4):

Прогон Количество последовательностей
Ожидалось 266
Первый прогон 106
Второй прогон 15
Третий прогон 5

Цена ошибки — не абстрактная

На этих же данных учёные:

  • строят филогенетические деревья (эволюционные связи)

  • оценивают, когда и где началась вспышка

  • определяют, будут ли работать тесты и препараты

Пример с Эбола:

Набор данных Оценка времени вспышки
Корректно собранный набор Январь 2014 года
Неполный набор от ИИ-агента 1922 год (ошибка почти в 100 лет)

Разница, которая полностью ломает интерпретацию.


Решение: не более умные модели, а детерминированный инструмент

Решение оказалось не в том, чтобы ждать более умных моделей, а в том, чтобы дать им детерминированный инструмент.

Что сделали исследователи:

Вместе с исследователями из NCBI (Национальный центр биотехнологической информации США) команда сделала gget virus — слой для надёжной выгрузки вирусных данных.

Что умеет gget virus:

Функция Что делает
Сам собирает запросы через разные API Не нужно разбираться в каждом
Аккуратно пагинирует большие выборки Берёт все данные, а не часть
Правильно применяет фильтры Не пропускает и не добавляет лишнего
Отдаёт результат с логами Видно, как результат получен

Эффект: точность выше 90% у всех

С доступом к gget virus результаты резко изменились.

Показатель Результат
Точность у всех агентов Выше 90%
У GPT-5.5 99,7%
Разброс между прогонами Практически исчез
Разрыв между моделями Стал почти незаметным

Любопытный вывод:

При правильном инструменте выбор модели перестаёт быть критичным. Даже более дешёвая модель с хорошим тулзом даёт надёжный результат.


Что это значит для разработчиков и дата-инженеров

Если вы строите ИИ-агентов под свои данные, не надейтесь, что очередная версия модели сама разберётся в хаосе ваших баз и форматов.

Ключевой вывод:

Не работает Работает
Ждать более умную модель Создать детерминированный слой под ней
Надеяться, что ИИ сам всё поймёт Чёткие идентификаторы, схемы, логика выгрузки

Стабильность даёт не размер модели, а детерминированный слой под ней.


Мысль на будущее

Базы данных пора проектировать с учётом того, что их основными пользователями становятся ИИ-агенты.

Если инфраструктура данных не меняется, даже самые продвинутые модели будут спотыкаться о хаос форматов, разрозненные базы и нестандартные файлы.


Что в итоге: главные выводы исследования Anthropic

Вывод Суть
Проблема не в интеллекте ИИ А в инфраструктуре данных
Программирование vs биология Софт изначально строился под машины, биологические данные — нет
VirBench показал провал Точность выгрузки данных плавает от 17% до 91%, а ответы нестабильны
Цена ошибки высока Неправильная выборка данных может сдвинуть оценку вспышки на 100 лет
Решение — детерминированный инструмент gget virus поднял точность всех агентов выше 90%
Выбор модели перестал быть критичным При правильном тулзе даже дешёвая модель даёт надёжный результат
Вывод для разработчиков Стабильность даёт не размер модели, а слой под ней
Вывод для будущего Базы данных пора проектировать под ИИ-агентов

Вопрос для читателей

Сталкивались ли вы с проблемой неструктурированных или хаотичных данных при работе с ИИ? Как решали — ждали более умную модель или строили детерминированные слои? Делитесь опытом в комментариях.

Комментарии: 0