Аналогия: ровные дороги для софта и узкие улочки для биологии
Авторы приводят наглядную аналогию.
| Софт (программирование) | Биологические данные |
|---|---|
| Изначально строился под машины (агентов) | Похож на старый город, спроектированный задолго до появления автомобилей |
| Ровные дороги, размеченные полосы | Узкие извилистые улочки |
| Понятные развязки, контроль версий | Разрозненные базы данных |
| Документированные API, пакетные менеджеры | Нестандартные форматы файлов |
| — | Самописные скрипты |
Человек там как-то проедет, опираясь на местный опыт, а вот агенту — тяжело.
Почему кодовые агенты развиваются быстрее
| Фактор | В программировании |
|---|---|
| Структура | Есть структурированные цифровые воркфлоу (рабочие процессы) и предсказуемые интерфейсы |
| Проверка результата | Патч либо проходит тесты, либо нет — чёткий критерий |
В биологии всё иначе:
| Фактор | В биологии |
|---|---|
| Инфраструктура | Часто хрупкая и неоднородная |
| Проверка результата | Понятных и проверяемых критериев успеха почти нет |
Поэтому узкое место биологических агентов — не в умении рассуждать, а в отсутствии надёжного способа добраться до нужных данных и воспроизвести результат.
Бенчмарк VirBench: как измеряли проблему
Чтобы показать проблему на цифрах, команда Anthropic собрала бенчмарк VirBench:
| Параметр | Значение |
|---|---|
| Реалистичных запросов | 120 |
| По патогенам | 40 |
| Источник данных | База NCBI Virus |
| Тип задач | Выгрузка вирусных последовательностей |
Это реальные задачи из вирусологии:
-
наблюдение за вспышками заболеваний
-
разработка диагностических тестов
-
сбор данных для обучения белковых моделей
Результаты: точность плавает, а ответы нестабильны
Когда агенты (Claude, Biomni, Edison Analysis, GPT) решали задачи самостоятельно, точность плавала в широком диапазоне:
| Минимальная точность | Максимальная точность |
|---|---|
| 16,9% | 91,3% |
Для выгрузки данных это провал. Здесь нужна точность близко к 100%, потому что одна пропущенная или лишняя запись полностью меняет выводы.
Хуже того: нестабильность ответов
Одна и та же модель на одинаковый запрос выдавала разные ответы.
Пример с лихорадкой Эбола (Sonnet 4):
| Прогон | Количество последовательностей |
|---|---|
| Ожидалось | 266 |
| Первый прогон | 106 |
| Второй прогон | 15 |
| Третий прогон | 5 |
Цена ошибки — не абстрактная
На этих же данных учёные:
-
строят филогенетические деревья (эволюционные связи)
-
оценивают, когда и где началась вспышка
-
определяют, будут ли работать тесты и препараты
Пример с Эбола:
| Набор данных | Оценка времени вспышки |
|---|---|
| Корректно собранный набор | Январь 2014 года |
| Неполный набор от ИИ-агента | 1922 год (ошибка почти в 100 лет) |
Разница, которая полностью ломает интерпретацию.
Решение: не более умные модели, а детерминированный инструмент
Решение оказалось не в том, чтобы ждать более умных моделей, а в том, чтобы дать им детерминированный инструмент.
Что сделали исследователи:
Вместе с исследователями из NCBI (Национальный центр биотехнологической информации США) команда сделала gget virus — слой для надёжной выгрузки вирусных данных.
Что умеет gget virus:
| Функция | Что делает |
|---|---|
| Сам собирает запросы через разные API | Не нужно разбираться в каждом |
| Аккуратно пагинирует большие выборки | Берёт все данные, а не часть |
| Правильно применяет фильтры | Не пропускает и не добавляет лишнего |
| Отдаёт результат с логами | Видно, как результат получен |
Эффект: точность выше 90% у всех
С доступом к gget virus результаты резко изменились.
| Показатель | Результат |
|---|---|
| Точность у всех агентов | Выше 90% |
| У GPT-5.5 | 99,7% |
| Разброс между прогонами | Практически исчез |
| Разрыв между моделями | Стал почти незаметным |
Любопытный вывод:
При правильном инструменте выбор модели перестаёт быть критичным. Даже более дешёвая модель с хорошим тулзом даёт надёжный результат.
Что это значит для разработчиков и дата-инженеров
Если вы строите ИИ-агентов под свои данные, не надейтесь, что очередная версия модели сама разберётся в хаосе ваших баз и форматов.
Ключевой вывод:
| Не работает | Работает |
|---|---|
| Ждать более умную модель | Создать детерминированный слой под ней |
| Надеяться, что ИИ сам всё поймёт | Чёткие идентификаторы, схемы, логика выгрузки |
Стабильность даёт не размер модели, а детерминированный слой под ней.
Мысль на будущее
Базы данных пора проектировать с учётом того, что их основными пользователями становятся ИИ-агенты.
Если инфраструктура данных не меняется, даже самые продвинутые модели будут спотыкаться о хаос форматов, разрозненные базы и нестандартные файлы.
Что в итоге: главные выводы исследования Anthropic
| Вывод | Суть |
|---|---|
| Проблема не в интеллекте ИИ | А в инфраструктуре данных |
| Программирование vs биология | Софт изначально строился под машины, биологические данные — нет |
| VirBench показал провал | Точность выгрузки данных плавает от 17% до 91%, а ответы нестабильны |
| Цена ошибки высока | Неправильная выборка данных может сдвинуть оценку вспышки на 100 лет |
| Решение — детерминированный инструмент | gget virus поднял точность всех агентов выше 90% |
| Выбор модели перестал быть критичным | При правильном тулзе даже дешёвая модель даёт надёжный результат |
| Вывод для разработчиков | Стабильность даёт не размер модели, а слой под ней |
| Вывод для будущего | Базы данных пора проектировать под ИИ-агентов |
Вопрос для читателей
Сталкивались ли вы с проблемой неструктурированных или хаотичных данных при работе с ИИ? Как решали — ждали более умную модель или строили детерминированные слои? Делитесь опытом в комментариях.
